Skills Agentes

Text To Speech

Convierte texto en voz natural con Inworld TTS, ElevenLabs, DIA TTS, Kokoro, Chatterbox y más, vía la CLI de inference.sh, incluyendo clonación de voz, diálogo multi-hablante y generación de podcasts.

Solicitabash(belt *)
Estrellas
17

en todo el repo

Actividad
61

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
3

últimos 90 días

Contexto
1.7k tok

231 tok en reposo

Paquete
1 archivo

7 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add skills-101/superpowers --skill text-to-speech --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests.

Qué hace

  • Convierte texto en voz natural usando modelos como Inworld TTS-2, ElevenLabs, DIA TTS, Kokoro, Chatterbox, Higgs Audio y VibeVoice vía la CLI de inference.sh (belt)
  • Permite clonación de voz, diálogos multi-hablante, generación de podcasts y steering de emoción/entrega con [corchetes]
  • Ejecuta modelos con `belt app run <app-id> --input '{...}'` y permite listar apps de audio con `belt app list --category audio`
  • Combina audio generado con video de avatar (p. ej. P-Video-Avatar, OmniHuman) para crear vídeos de cabeza parlante

Úsalo cuando

  • Necesitas generar voiceovers, audiolibros, podcasts o narración de vídeo
  • Quieres voces de personajes para juegos/NPCs con steering de emoción (Inworld TTS-2)
  • Necesitas respuestas de baja latencia para IA conversacional o IVR
  • Vas a crear vídeos de avatar parlante y necesitas la pista de audio

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • “Convierte este texto en voz con Kokoro TTS”
    • “Genera una narración con emoción usando Inworld TTS-2”
    • “Crea un episodio de podcast a partir de este guion con VibeVoice”
    • “Necesito una voz de baja latencia para mi asistente conversacional”

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere la CLI de inference.sh (belt) instalada y haber ejecutado `belt login`.

    Necesita en el PATH:npx

    Detalles

    Creador
    skills-101
    Categoría
    Automatización
    Licencia
    No especificada
    Recursos incluidos
    Solo SKILL.md
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de skills-101/superpowers

    Este repo incluye 86 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack superpowers entero y su comando de instalación

    Búsqueda web y extracción de contenido con Tavily y Exa vía la CLI de inference.sh, con apps para búsqueda IA, extracción, respuestas directas e investigación.

    Costo de contexto al activarse
    1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    investigacion

    Automatiza Twitter/X: publicar tweets, programar contenido, dar like, retuitear, enviar DMs y seguir usuarios mediante el CLI de inference.sh.

    Costo de contexto al activarse
    1.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    marketing

    Genera y edita imágenes con los modelos Qwen-Image-2.0 de Alibaba vía la CLI de inference.sh: texto a imagen, edición multi-imagen y renderizado de texto complejo.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    diseno ui

    Transcribe audio a texto con los modelos ElevenLabs Scribe y Whisper vía la CLI de inference.sh, con diarización, timestamps y traducción.

    Costo de contexto al activarse
    1.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    productividad

    Genera y edita videos físicamente realistas con los modelos Alibaba HappyHorse 1.0 vía el CLI de inference.sh: texto-a-video, imagen-a-video, referencia-a-video y edición de video.

    Costo de contexto al activarse
    1.6k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    video

    Genera videos con los modelos optimizados de Pruna (P-Video, WAN-T2V, WAN-I2V) vía el CLI de inference.sh: texto-a-video, imagen-a-video, audio, 720p/1080p e inferencia rápida.

    Costo de contexto al activarse
    971 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    video