# Text To Speech > Convierte texto en voz natural con Inworld TTS, ElevenLabs, DIA TTS, Kokoro, Chatterbox y más, vía la CLI de inference.sh, incluyendo clonación de voz, diálogo multi-hablante y generación de podcasts. Fuente: https://skillsagentes.com/skills/skills-101/superpowers/text-to-speech Markdown: https://skillsagentes.com/skills/skills-101/superpowers/text-to-speech.md Repositorio: https://github.com/skills-101/superpowers Autor: skills-101 Licencia: no declarada Actualizado: el mes pasado Coste de contexto: 231 tok instalada, 1.7k tok al activarse, 1.7k tok con todos los archivos del bundle Bundle: 1 archivo, 7 KB Permisos que pide: bash(belt *) ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add skills-101/superpowers --skill text-to-speech --agent claude-code # Cursor npx -y skills add skills-101/superpowers --skill text-to-speech --agent cursor # Codex npx -y skills add skills-101/superpowers --skill text-to-speech --agent codex # Gemini CLI npx -y skills add skills-101/superpowers --skill text-to-speech --agent gemini # Windsurf npx -y skills add skills-101/superpowers --skill text-to-speech --agent windsurf # Cline npx -y skills add skills-101/superpowers --skill text-to-speech --agent cline ``` ## Qué hace - Convierte texto en voz natural usando modelos como Inworld TTS-2, ElevenLabs, DIA TTS, Kokoro, Chatterbox, Higgs Audio y VibeVoice vía la CLI de inference.sh (belt) - Permite clonación de voz, diálogos multi-hablante, generación de podcasts y steering de emoción/entrega con [corchetes] - Ejecuta modelos con `belt app run --input '{...}'` y permite listar apps de audio con `belt app list --category audio` - Combina audio generado con video de avatar (p. ej. P-Video-Avatar, OmniHuman) para crear vídeos de cabeza parlante ## Cuándo usarla - Necesitas generar voiceovers, audiolibros, podcasts o narración de vídeo - Quieres voces de personajes para juegos/NPCs con steering de emoción (Inworld TTS-2) - Necesitas respuestas de baja latencia para IA conversacional o IVR - Vas a crear vídeos de avatar parlante y necesitas la pista de audio ## Qué la activa - "Convierte este texto en voz con Kokoro TTS" - "Genera una narración con emoción usando Inworld TTS-2" - "Crea un episodio de podcast a partir de este guion con VibeVoice" - "Necesito una voz de baja latencia para mi asistente conversacional" ## Antes de instalar - Requiere la CLI de inference.sh (belt) instalada y haber ejecutado `belt login`. - Necesita en el PATH: npx - makes network requests ## Archivos - SKILL.md — 7 KB ## SKILL.md No se reproduce aquí. Léelo en https://github.com/skills-101/superpowers/blob/main/tools/audio/text-to-speech/SKILL.md ## Dónde encaja - Categoría: [Automatización](https://skillsagentes.com/categorias/automatizacion.md) — Flujos de varios pasos que se ejecutan sin supervisión. - Creador: [skills-101](https://skillsagentes.com/creators/skills-101.md) — 86 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Agent Tools](https://skillsagentes.com/skills/skills-101/superpowers/agent-tools.md): Ejecuta apps de IA vía el CLI de inference.sh: generación de imágenes y video, LLMs, búsqueda web, 3D y automatización de Twitter, con modelos como FLUX, Veo, Gemini, Claude y OpenRouter. - [Ai Avatar Video](https://skillsagentes.com/skills/skills-101/superpowers/ai-avatar-video.md): Crea videos de avatares IA y talking heads con el CLI de inference.sh: P-Video-Avatar (TTS integrado), OmniHuman, Fabric, PixVerse, para presentadores, dobleaje, UGC y avatares de juegos. - [Ai Image Generation](https://skillsagentes.com/skills/skills-101/superpowers/ai-image-generation.md): Genera imágenes con IA usando GPT-Image-2, FLUX, Gemini, Grok, Seedream, Reve y más de 50 modelos vía el CLI de inference.sh. - [Ai Music Generation](https://skillsagentes.com/skills/skills-101/superpowers/ai-music-generation.md): Genera música y canciones con IA usando ElevenLabs, Diffrythm y Tencent Song Generation vía el CLI de inference.sh, para fondos musicales, redes sociales, podcasts y bandas sonoras. - [Ai Video Generation](https://skillsagentes.com/skills/skills-101/superpowers/ai-video-generation.md): Genera videos con IA usando Google Veo, Seedance 2.0, HappyHorse, Wan, Grok y más de 40 modelos a través del CLI de inference.sh. ## Skills relacionadas - [Agent Browser](https://skillsagentes.com/skills/skills-101/superpowers/agent-browser.md): Automatización de navegador para agentes de IA vía inference.sh: navega páginas, interactúa con elementos usando refs @e, hace capturas y graba vídeo. - [Agent Tools](https://skillsagentes.com/skills/skills-101/superpowers/agent-tools.md): Ejecuta apps de IA vía el CLI de inference.sh: generación de imágenes y video, LLMs, búsqueda web, 3D y automatización de Twitter, con modelos como FLUX, Veo, Gemini, Claude y OpenRouter. - [Ai Automation Workflows](https://skillsagentes.com/skills/skills-101/superpowers/ai-automation-workflows.md): Construye workflows de IA automatizados combinando varios modelos y servicios: batch processing, tareas programadas, pipelines por eventos y agent loops, usando la CLI de inference.sh, bash y Python SDK. - [Ai Content Pipeline](https://skillsagentes.com/skills/skills-101/superpowers/ai-content-pipeline.md): Construye pipelines de creación de contenido con IA en varios pasos combinando imagen, video, audio y texto, usando herramientas como FLUX, Veo, Kokoro TTS y OmniHuman. - [Ai Podcast](https://skillsagentes.com/skills/skills-101/superpowers/ai-podcast.md): Genera videos de podcast con varios hablantes desde cero usando IA: creación de personajes, TTS, animación de avatar y montaje de video. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)