Skills Agentes

Dialogue Audio

Creación de audio de diálogo multi-hablante con ElevenLabs y Dia TTS: etiquetas de hablante, control de emoción, ritmo, flujo conversacional y post-producción.

Solicitabash(belt *)
Estrellas
17

en todo el repo

Actividad
60

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
2

últimos 90 días

Contexto
2.1k tok

126 tok en reposo

Paquete
1 archivo

8 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add skills-101/superpowers --skill dialogue-audio --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Genera audio de diálogo entre dos hablantes con Dia TTS usando la CLI belt
  • Aplica etiquetas [S1]/[S2], control de emoción por puntuación y sonidos no verbales
  • Controla ritmo y pausas mediante puntuación y longitud de frases
  • Fusiona segmentos de audio largo y hace normalización de volumen en post-producción

Úsalo cuando

  • Se necesita crear podcasts, audiolibros, explicativos o diálogos de personajes
  • Se requiere generar conversación de dos hablantes con control de emoción y ritmo
  • Hay que segmentar y fusionar conversaciones largas de más de 30 segundos

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • “Genera un diálogo de podcast entre dos hablantes con belt app run falai/dia-tts”
    • “Crea una conversación tipo entrevista con [S1] y [S2] usando Dia TTS”
    • “Necesito audio de diálogo con emoción y pausas naturales para un explainer”

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere instalar la CLI inference.sh (belt) y ejecutar belt login antes de usar dia-tts.

    Necesita en el PATH:npx

    Detalles

    Creador
    skills-101
    Licencia
    No especificada
    Recursos incluidos
    Solo SKILL.md
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de skills-101/superpowers

    Este repo incluye 86 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack superpowers entero y su comando de instalación

    Ejecuta apps de IA vía el CLI de inference.sh: generación de imágenes y video, LLMs, búsqueda web, 3D y automatización de Twitter, con modelos como FLUX, Veo, Gemini, Claude y OpenRouter.

    Costo de contexto al activarse
    1.5k tok
    Tamaño del paquete
    5 archivos
    Última actualización
    el mes pasado
    automatizacion

    Crea videos de avatares IA y talking heads con el CLI de inference.sh: P-Video-Avatar (TTS integrado), OmniHuman, Fabric, PixVerse, para presentadores, dobleaje, UGC y avatares de juegos.

    Costo de contexto al activarse
    2.4k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    video

    Genera imágenes con IA usando GPT-Image-2, FLUX, Gemini, Grok, Seedream, Reve y más de 50 modelos vía el CLI de inference.sh.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    diseno ui

    Genera música y canciones con IA usando ElevenLabs, Diffrythm y Tencent Song Generation vía el CLI de inference.sh, para fondos musicales, redes sociales, podcasts y bandas sonoras.

    Costo de contexto al activarse
    1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    redaccion contenido

    Genera videos con IA usando Google Veo, Seedance 2.0, HappyHorse, Wan, Grok y más de 40 modelos a través del CLI de inference.sh.

    Costo de contexto al activarse
    1.9k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    video

    Elimina fondos de imágenes con BiRefNet vía el CLI de inference.sh; útil para fotos de producto, retratos, e-commerce, PNGs transparentes y edición fotográfica.

    Costo de contexto al activarse
    667 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    diseno ui

    Skills relacionados

    Genera música y canciones con IA usando ElevenLabs, Diffrythm y Tencent Song Generation vía el CLI de inference.sh, para fondos musicales, redes sociales, podcasts y bandas sonoras.

    Costo de contexto al activarse
    1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    redaccion contenido

    Crea podcasts impulsados por IA con texto a voz, música y edición de audio, usando Kokoro TTS, DIA TTS, Chatterbox, generación musical con IA y media merger.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    redaccion contenido

    Generación de voz por IA, texto a voz y síntesis de voz vía la CLI de inference.sh, con modelos como Inworld TTS-2, ElevenLabs, Kokoro, DIA, Chatterbox, Higgs y VibeVoice.

    Costo de contexto al activarse
    2.5k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    redaccion contenido