# Ai Voice Cloning > Generación de voz por IA, texto a voz y síntesis de voz vía la CLI de inference.sh, con modelos como Inworld TTS-2, ElevenLabs, Kokoro, DIA, Chatterbox, Higgs y VibeVoice. Fuente: https://skillsagentes.com/skills/skills-101/superpowers/ai-voice-cloning Markdown: https://skillsagentes.com/skills/skills-101/superpowers/ai-voice-cloning.md Repositorio: https://github.com/skills-101/superpowers Autor: skills-101 Licencia: no declarada Actualizado: el mes pasado Coste de contexto: 207 tok instalada, 2.5k tok al activarse, 2.5k tok con todos los archivos del bundle Bundle: 1 archivo, 10 KB Permisos que pide: bash(belt *) ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add skills-101/superpowers --skill ai-voice-cloning --agent claude-code # Cursor npx -y skills add skills-101/superpowers --skill ai-voice-cloning --agent cursor # Codex npx -y skills add skills-101/superpowers --skill ai-voice-cloning --agent codex # Gemini CLI npx -y skills add skills-101/superpowers --skill ai-voice-cloning --agent gemini # Windsurf npx -y skills add skills-101/superpowers --skill ai-voice-cloning --agent windsurf # Cline npx -y skills add skills-101/superpowers --skill ai-voice-cloning --agent cline ``` ## Qué hace - Genera voces artificiales naturales mediante la CLI belt (inference.sh) usando modelos como Inworld TTS-2, ElevenLabs, Kokoro, DIA, Chatterbox, Higgs y VibeVoice - Permite controlar emoción, no-verbales y modo de entrega con marcadores entre corchetes como [whisper] o [excited] - Soporta múltiples voces, idiomas, acentos, velocidad y puntuación para pacing - Combina voz con video o avatares mediante media-merger y omnihuman-1-5 ## Cuándo usarla - Necesitas generar voiceovers, audiolibros, podcasts o narración de video - Requieres voces de personajes o NPCs con emociones y control de entrega - Necesitas contenido de accesibilidad, IVR o localización de contenido con voz - Quieres crear diálogos multi-voz o narración de formato largo por fragmentos ## Qué la activa - "Genera una narración de audiolibro con voz bf_emma a velocidad 0.9" - "Crea un diálogo entre dos voces usando kokoro-tts" - "Genera una voz de personaje emocionada con Inworld TTS-2" - "Añade un voiceover profesional a este video" ## Antes de instalar - Requiere instalar la CLI belt de inference.sh y ejecutar belt login. - Necesita en el PATH: npx - makes network requests ## Archivos - SKILL.md — 10 KB ## SKILL.md No se reproduce aquí. Léelo en https://github.com/skills-101/superpowers/blob/main/tools/audio/ai-voice-cloning/SKILL.md ## Dónde encaja - Categoría: [Redacción y contenido](https://skillsagentes.com/categorias/redaccion-contenido.md) — Redacción, edición y estructuración de contenido extenso. - Creador: [skills-101](https://skillsagentes.com/creators/skills-101.md) — 86 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Agent Tools](https://skillsagentes.com/skills/skills-101/superpowers/agent-tools.md): Ejecuta apps de IA vía el CLI de inference.sh: generación de imágenes y video, LLMs, búsqueda web, 3D y automatización de Twitter, con modelos como FLUX, Veo, Gemini, Claude y OpenRouter. - [Ai Avatar Video](https://skillsagentes.com/skills/skills-101/superpowers/ai-avatar-video.md): Crea videos de avatares IA y talking heads con el CLI de inference.sh: P-Video-Avatar (TTS integrado), OmniHuman, Fabric, PixVerse, para presentadores, dobleaje, UGC y avatares de juegos. - [Ai Image Generation](https://skillsagentes.com/skills/skills-101/superpowers/ai-image-generation.md): Genera imágenes con IA usando GPT-Image-2, FLUX, Gemini, Grok, Seedream, Reve y más de 50 modelos vía el CLI de inference.sh. - [Ai Music Generation](https://skillsagentes.com/skills/skills-101/superpowers/ai-music-generation.md): Genera música y canciones con IA usando ElevenLabs, Diffrythm y Tencent Song Generation vía el CLI de inference.sh, para fondos musicales, redes sociales, podcasts y bandas sonoras. - [Ai Video Generation](https://skillsagentes.com/skills/skills-101/superpowers/ai-video-generation.md): Genera videos con IA usando Google Veo, Seedance 2.0, HappyHorse, Wan, Grok y más de 40 modelos a través del CLI de inference.sh. ## Skills relacionadas - [Ai Music Generation](https://skillsagentes.com/skills/skills-101/superpowers/ai-music-generation.md): Genera música y canciones con IA usando ElevenLabs, Diffrythm y Tencent Song Generation vía el CLI de inference.sh, para fondos musicales, redes sociales, podcasts y bandas sonoras. - [Ai Podcast Creation](https://skillsagentes.com/skills/skills-101/superpowers/ai-podcast-creation.md): Crea podcasts impulsados por IA con texto a voz, música y edición de audio, usando Kokoro TTS, DIA TTS, Chatterbox, generación musical con IA y media merger. - [Case Study Writing](https://skillsagentes.com/skills/skills-101/superpowers/case-study-writing.md): Redacción de case studies B2B con el framework STAR, visualización de datos e investigación: estructura, citas de clientes, métricas y formatos de distribución. - [Content Repurposing](https://skillsagentes.com/skills/skills-101/superpowers/content-repurposing.md): Atomización de contenido: convierte una pieza en muchas —blog a hilo, blog a carrusel, podcast a blog, video a citas y más— usando la CLI de inference.sh. - [Dialogue Audio](https://skillsagentes.com/skills/skills-101/superpowers/dialogue-audio.md): Creación de audio de diálogo multi-hablante con ElevenLabs y Dia TTS: etiquetas de hablante, control de emoción, ritmo, flujo conversacional y post-producción. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)