ASD

Speech To Text

Transcribe audio a texto con los modelos ElevenLabs Scribe y Whisper vía la CLI de inference.sh, con diarización, timestamps y traducción.

Solicitabash(belt *)
Estrellas
6

en todo el repo

Actividad
61

0–100, la ruta de este skill

Actualizado
hace 11 días

último commit aquí

Commits
3

últimos 90 días

Contexto
1.1k tok

157 tok en reposo

Paquete
1 archivo

4 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add skills-101/superpowers --skill speech-to-text --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests.

Qué hace

  • Transcribe audio a texto usando modelos ElevenLabs Scribe y Whisper vía CLI belt
  • Soporta timestamps, diarización de hablantes y traducción a inglés
  • Extrae audio de video y genera transcripciones para subtítulos

Úsalo cuando

  • Transcribir reuniones, podcasts o notas de voz
  • Generar subtítulos o captions para videos
  • Traducir audio en otro idioma al inglés
  • Hacer transcripciones accesibles para búsqueda o investigación

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Transcribe esta grabación de reunión a texto
    • Genera subtítulos con timestamps para este video
    • Traduce este audio en francés al inglés
    • Convierte esta nota de voz en texto buscable

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere la CLI belt de inference.sh instalada y sesión iniciada con `belt login`.

    Necesita en el PATH:npx

    Detalles

    Creador
    skills-101
    Categoría
    Productividad
    Licencia
    No especificada
    Recursos incluidos
    Solo SKILL.md
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de skills-101/superpowers

    Este repo incluye 86 skills. Si instalas uno, normalmente ya tienes los demás.

    Convierte cualquier voz en otra voz distinta preservando el contenido y la emoción del habla, mediante el CLI de inference.sh (belt).

    Costo de contexto al activarse
    1.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    redaccion contenido

    Búsqueda web y extracción de contenido con Tavily y Exa vía la CLI de inference.sh, con apps para búsqueda IA, extracción, respuestas directas e investigación.

    Costo de contexto al activarse
    1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    investigacion

    Genera imágenes con los modelos P-Image de Pruna vía la CLI de inference.sh: texto a imagen, edición, estilos LoRA, composición multi-imagen e inferencia rápida.

    Costo de contexto al activarse
    1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    diseno ui

    Genera imágenes con Google Gemini 3.1 Flash Image Preview (Nano Banana 2) vía el CLI de inference.sh: texto a imagen, edición, hasta 14 imágenes y grounding con Google Search.

    Costo de contexto al activarse
    1.2k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    diseno ui

    Genera y edita videos físicamente realistas con los modelos Alibaba HappyHorse 1.0 vía el CLI de inference.sh: texto-a-video, imagen-a-video, referencia-a-video y edición de video.

    Costo de contexto al activarse
    1.6k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    diseno ui

    Genera imágenes con IA usando GPT-Image-2, FLUX, Gemini, Grok, Seedream, Reve y más de 50 modelos vía el CLI de inference.sh.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    diseno ui

    Skills relacionados

    Crea videos publicitarios con IA para anuncios, promociones, lanzamientos y contenido de marca usando Veo, Seedance, Wan, FLUX y Kokoro para voces en off.

    Costo de contexto al activarse
    2.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    marketing

    Convierte cualquier voz en otra voz distinta preservando el contenido y la emoción del habla, mediante el CLI de inference.sh (belt).

    Costo de contexto al activarse
    1.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    redaccion contenido

    Creación de anuncios en vídeo con specs exactos por plataforma para TikTok, Instagram, YouTube, Facebook y LinkedIn: dimensiones, duración, framework AIDA y requisitos de subtítulos.

    Costo de contexto al activarse
    2.2k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 11 días
    marketing