Skills Agentes

Videoagent Audio Studio

¿Cansado de manejar varias APIs de audio? Da acceso con un solo comando a TTS, generación de música, efectos de sonido y clonación de voz, sin gestionar múltiples claves API.

Reemplaza a: Gestionar manualmente varias APIs de audio y claves distintas

Estrellas
767

en todo el repo

Actividad
33

0–100, la ruta de este skill

Actualizado
hace 5 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
1.7k tok

54 tok en reposo

Paquete
10 archivos

33 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add pexoai/pexo-skills --skill videoagent-audio-studio --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests.

Qué hace

  • Analiza la petición de audio y la enruta al mejor modelo disponible (ElevenLabs o fal.ai)
  • Genera voz (TTS), narraciones, música de fondo, efectos de sonido y clonación de voz
  • Devuelve una URL de audio lista para usar
  • Arranca un servidor MCP de ElevenLabs para gestionar toda la generación de audio

Úsalo cuando

  • El usuario pide generar voz, narrar un texto o crear un voice-over
  • El usuario pide componer música o crear una banda sonora
  • El usuario pide un efecto de sonido específico
  • El usuario aporta una muestra de audio y quiere clonar esa voz

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Voice this text for me: Welcome to our product launch
    • Genera 60 segundos de música de fondo relajante para un podcast
    • Crea un efecto de sonido de una puerta abriéndose estilo sci-fi
    • Clona esta voz a partir de este audio

    SKILL.md

    En inglés

    🎙️ VideoAgent Audio Studio

    Use when: User asks to generate speech, narrate text, create a voice-over, compose music, or produce a sound effect.

    VideoAgent Audio Studio is a smart audio dispatcher. It analyzes your request and routes it to the best available model — ElevenLabs for speech and music, fal.ai for fast SFX — and returns a ready-to-use audio URL.


    Quick Reference

    Request Type Best Model Latency
    Narrate text / Voice-over elevenlabs-tts-v3 ~3s
    Low-latency TTS (real-time) elevenlabs-tts-turbo <1s
    Background music cassetteai-music ~15s
    Sound effect elevenlabs-sfx ~5s
    Clone a voice from audio elevenlabs-voice-clone ~10s

    How to Use

    1. Start the AudioMind server (once per session)

    bash {baseDir}/tools/start_server.sh
    

    This starts the ElevenLabs MCP server on port 8124. The skill uses it for all audio generation.

    2. Route the request

    Analyze the user's request and call the appropriate tool via the MCP server:

    Text-to-Speech (TTS)

    When user asks to "narrate", "read aloud", "say", or "create a voice-over":

    Use MCP tool: text_to_speech
      text: "<the text to narrate>"
      voice_id: "JBFqnCBsd6RMkjVDRZzb"   # Default: "George" (professional, neutral)
      model_id: "eleven_multilingual_v2"   # Use "eleven_turbo_v2_5" for low latency
    

    Music Generation

    When user asks to "compose", "create background music", or "make a soundtrack":

    Use MCP tool: text_to_sound_effects  (via cassetteai-music on fal.ai)
      prompt: "<music description, e.g. 'upbeat lo-fi hip hop, 90 seconds'>"
      duration_seconds: <duration>
    

    Sound Effect (SFX)

    When user asks for a specific sound (e.g., "a door creaking", "rain on a window"):

    Use MCP tool: text_to_sound_effects
      text: "<sound description>"
      duration_seconds: <1-22>
    

    Voice Cloning

    When user provides an audio sample and wants to clone the voice:

    Use MCP tool: voice_add
      name: "<voice name>"
      files: ["<audio_file_url>"]
    

    Example Conversations

    User: "Voice this text for me: Welcome to our product launch"

    → Route to: text_to_speech
      text: "Welcome to our product launch"
      voice_id: "JBFqnCBsd6RMkjVDRZzb"
      model_id: "eleven_multilingual_v2"
    

    🎙️ Voiceover done! Listen here


    User: "Generate 60 seconds of relaxing background music for a podcast"

    → Route to: cassetteai-music (fal.ai)
      prompt: "relaxing lo-fi background music for a podcast, gentle piano and soft beats, 60 seconds"
      duration_seconds: 60
    

    🎵 Background music ready! Listen here


    User: "Generate a sci-fi style door opening sound effect"

    → Route to: text_to_sound_effects
      text: "a futuristic sci-fi door sliding open with a hydraulic hiss"
      duration_seconds: 3
    

    Setup

    Required

    Set ELEVENLABS_API_KEY in ~/.openclaw/openclaw.json:

    {
      "skills": {
        "entries": {
          "videoagent-audio-studio": {
            "enabled": true,
            "env": {
              "ELEVENLABS_API_KEY": "your_elevenlabs_key_here"
            }
          }
        }
      }
    }
    

    Get your key at elevenlabs.io/app/settings/api-keys.

    Optional (for fal.ai music & SFX models)

    "FAL_KEY": "your_fal_key_here"
    

    Get your key at fal.ai/dashboard/keys.


    Self-Hosting the Proxy

    The cli.js connects to a hosted proxy by default. If you want full control — or need to serve users in regions where vercel.app is blocked — you can deploy your own instance from the proxy/ directory.

    Quick Deploy (Vercel)

    cd proxy
    npm install
    vercel --prod
    

    Environment Variables

    Set these in your Vercel project (Dashboard → Settings → Environment Variables):

    Variable Required For Where to Get
    ELEVENLABS_API_KEY TTS, SFX, Voice Clone elevenlabs.io/app/settings/api-keys
    FAL_KEY Music generation fal.ai/dashboard/keys
    VALID_PRO_KEYS (Optional) Restrict access Comma-separated list of allowed client keys

    Point cli.js to Your Proxy

    export AUDIOMIND_PROXY_URL="https://your-domain.com/api/audio"
    

    Or set it in ~/.openclaw/openclaw.json:

    {
      "skills": {
        "entries": {
          "videoagent-audio-studio": {
            "env": {
              "AUDIOMIND_PROXY_URL": "https://your-domain.com/api/audio"
            }
          }
        }
      }
    }
    

    Custom Domain (Recommended)

    If your users are in mainland China, bind a custom domain in Vercel Dashboard → Settings → Domains to avoid DNS issues with vercel.app.


    Model Reference

    Model ID Type Provider Notes
    eleven_multilingual_v2 TTS ElevenLabs Best quality, supports 29 languages
    eleven_turbo_v2_5 TTS ElevenLabs Ultra-low latency, ideal for real-time
    eleven_monolingual_v1 TTS ElevenLabs English only, fastest
    cassetteai-music Music fal.ai Reliable, fast music generation
    elevenlabs-sfx SFX ElevenLabs High-quality sound effects (up to 22s)
    elevenlabs-voice-clone Clone ElevenLabs Clone any voice from a short audio sample

    Changelog

    v3.0.0

    • Simplified routing table: Removed unstable/offline models from the main reference. The skill now only surfaces models that reliably work.
    • Clearer use-case triggers: Added "Use when" section so the agent activates this skill at the right moment.
    • Unified setup: Single ELEVENLABS_API_KEY is all you need to get started. FAL_KEY is now optional.
    • Removed polling complexity: Music generation now uses cassetteai-music by default, which completes synchronously.

    v2.1.0

    • Added async workflow for long-running music generation tasks.
    • Added cassetteai-music as a stable alternative for music generation.

    v2.0.0

    • Migrated to ElevenLabs MCP server architecture.
    • Added voice cloning support.

    v1.0.0

    • Initial release with TTS, music, and SFX routing.

    Reproducido de pexoai/pexo-skills bajo licencia MIT. Leer esta página en markdown.

    Archivos

    10 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere la variable ELEVENLABS_API_KEY (y opcionalmente FAL_KEY para música y SFX de fal.ai) configuradas en ~/.openclaw/openclaw.json.

    Necesita en el PATH:npm

    Detalles

    Creador
    pexoai
    Categoría
    Automatización
    Licencia
    MIT
    Recursos incluidos
    Incluye scripts o referencias
    Código fuente
    Ver SKILL.md

    Más de pexoai/pexo-skills

    Este repo incluye 20 skills. Si instalas uno, normalmente ya tienes los demás.

    Skill de generación de video con IA que selecciona modelo automáticamente entre Seedance 2, Kling 3.0, HappyHorse y más de 10 modelos, y produce videos multi-toma de 5–120s desde texto, imágenes, URLs, guiones o audio.

    Costo de contexto al activarse
    4.9k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 26 días
    diseno ui

    Genera video con IA a partir de texto, imagen o guion: enruta cada toma al mejor de 10+ modelos (Seedance, Kling, Veo, Sora...) y entrega un video final con música y subtítulos.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 2 meses
    diseno ui

    Crea un video de fundador con Pexo: cuenta tu historia o pitch y Pexo escribe el guion, genera las tomas y entrega un video listo para publicar, con música.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 2 meses
    marketing

    Anima una foto fija en un vídeo terminado con Pexo: añade movimiento, cámara y música, elige el mejor modelo automáticamente y entrega el clip listo para publicar.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 2 meses
    diseno ui

    Crea anuncios nativos para TikTok con Pexo: vertical 9:16, con sonido, hook-first. Escribe el guion, secuencia las tomas, elige modelos y entrega el ad listo para publicar.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 2 meses
    marketing

    Crea un video demo o explicativo de tu SaaS con Pexo: describe tu software (o pega la URL o una captura) y recibe un video terminado y listo para publicar.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 2 meses
    marketing

    Skills relacionados

    Úsalo cuando enfrentes 2 o más tareas independientes que puedan trabajarse sin estado compartido ni dependencias secuenciales.

    Costo de contexto al activarse
    1.5k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    automatizacion

    Úsalo al ejecutar planes de implementación con tareas independientes dentro de la sesión actual.

    Costo de contexto al activarse
    8.1k tok
    Tamaño del paquete
    7 archivos
    Última actualización
    hace 4 días
    automatizacion

    Interrógame sobre las specs de los workflows que quiero construir, dentro de este workspace.

    Costo de contexto al activarse
    640 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 18 días
    automatizacion