Skills Agentes

Doubao Tts

Genera narración en mandarín y multilingüe con Volcengine Doubao Speech 2.0. Úsalo para voces en off en chino o cuando la narración necesite marcas de tiempo por carácter.

Estrellas
49.5k

en todo el repo

Actividad
42

0–100, la ruta de este skill

Actualizado
hace 3 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
1k tok

64 tok en reposo

Paquete
1 archivo

4 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add calesthio/OpenMontage --skill doubao-tts --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests, needs API credentials.

Qué hace

  • Genera narración en mandarín y en varios idiomas con Volcengine Doubao Speech 2.0
  • Devuelve metadatos de marca de tiempo por carácter, útiles para subtítulos
  • Documenta el flujo recomendado, los parámetros y el diagnóstico de errores

Úsalo cuando

  • Crear voces en off en chino
  • El usuario prefiere Doubao / Volcengine / 火山引擎 / 豆包 para TTS
  • La narración necesita marcas de tiempo por carácter para subtítulos

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Genera la narración en chino de este guion
    • Necesito voz en off con marcas por carácter
    • Usa Doubao para la locución

    SKILL.md

    En inglés

    Doubao TTS

    Requires DOUBAO_SPEECH_API_KEY in .env. Set DOUBAO_SPEECH_VOICE_TYPE for the default voice, or pass voice_id to the tool.

    Current API

    Use the new-console API key flow:

    X-Api-Key: ${DOUBAO_SPEECH_API_KEY}
    X-Api-Resource-Id: seed-tts-2.0
    

    Do not use X-Api-App-Id and X-Api-Access-Key with a new-console API Key. If the API returns load grant: requested grant not found, the key type or auth header is probably wrong.

    For long-form video narration, prefer the async endpoint:

    POST https://openspeech.bytedance.com/api/v3/tts/submit
    POST https://openspeech.bytedance.com/api/v3/tts/query
    

    This returns audio_url plus sentences[].words[] timing metadata that can be used to build subtitles.

    OpenMontage Usage

    Generate with the TTS selector:

    from tools.audio.tts_selector import TTSSelector
    
    result = TTSSelector().execute({
        "preferred_provider": "doubao",
        "text": "如果 AI 真的会改变未来,普通人到底该怎么参与?",
        "voice_id": "zh_female_vv_uranus_bigtts",
        "output_path": "projects/my-video/assets/audio/narration.mp3",
        "speech_rate": 0,
        "enable_timestamp": True,
    })
    

    Or call the provider directly:

    from tools.audio.doubao_tts import DoubaoTTS
    
    result = DoubaoTTS().execute({
        "text": "短样本试听文本。",
        "voice_id": "zh_female_vv_uranus_bigtts",
        "output_path": "projects/my-video/assets/audio/doubao_sample.mp3",
    })
    

    The provider writes:

    • output_path: downloaded audio file
    • metadata_path: full query response JSON, defaulting to <output_path>.json

    Recommended Workflow

    1. Generate a 10-15 second sample before a full paid narration.
    2. Ask the user to approve voice naturalness, accent, and speed.
    3. Generate the full narration only after approval.
    4. Keep the query JSON. It is the source of truth for subtitle timing.
    5. Build captions from sentences[].words[], not from estimated text length.
    6. Group captions by Chinese semantic phrases before applying timestamps. Do not split only by fixed character count; it can break phrases like "在不押单个公司的情况下" or "可能会被慢慢稀释" and hurt comprehension.
    7. Let the video duration follow the approved voice rhythm unless the user explicitly asks to match a prior runtime.

    Parameters

    • voice_id: Doubao speaker / voice type. Defaults to DOUBAO_SPEECH_VOICE_TYPE.
    • resource_id: use seed-tts-2.0 for Doubao Speech 2.0 voices.
    • speech_rate: 0 is normal, 100 is 2x, -50 is 0.5x.
    • sample_rate: default 24000.
    • enable_timestamp: default true.
    • return_usage: default true, requests usage metadata when available.

    Do not pass additions.explicit_language by default. Some endpoint/key combinations reject zh-cn with unsupported additions explicit language zh-cn.

    For calm Mandarin explainers, start with speech_rate: 0. If the result is too long for the approved format, make a short comparison sample with speech_rate: 25 or 50 before regenerating the full narration. Do not speed up only to match a previous provider's duration if the user prefers Doubao's natural pace.

    Troubleshooting

    • load grant: requested grant not found: wrong key type or wrong auth header. Use X-Api-Key for new-console API Keys.
    • speaker permission denied: voice id is wrong or not authorized for the selected resource.
    • quota exceeded: quota, lifetime characters, or concurrency exceeded.
    • Missing timestamps: verify enable_timestamp: true, keep the query JSON, and confirm the selected endpoint returned sentences.

    Safety

    Never print or write the API key to logs, metadata, patches, or project artifacts. .env.example should contain only empty variable names.

    Reproducido de calesthio/OpenMontage bajo licencia AGPL-3.0. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Necesita credenciales de Volcengine para Doubao Speech 2.0.

    Variables de entorno:DOUBAO_SPEECH_API_KEY

    Detalles

    Creador
    calesthio
    Categoría
    Diseño y UI
    Licencia
    AGPL-3.0
    Recursos incluidos
    Solo SKILL.md
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de calesthio/OpenMontage

    Este repo incluye 89 skills. Si instalas uno, normalmente ya tienes los demás.

    Comfyui

    49.5k

    Úsalo al trabajar con workflows de ComfyUI en OpenMontage: comfyui_image/video/music, workflows propios, selección de output_node, modelos que faltan, LoRAs, poca VRAM e importación de workflows de la comunidad.

    Costo de contexto al activarse
    1.9k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    diseno ui

    Genera vídeo cinematográfico de 4-30 s con ByteDance Seedance 2.5 por fal.ai, Volcengine Ark, Runway o ComfyUI. Cubre el contrato de prompt 2.5, cortes duros, locks de continuidad y voz.

    Costo de contexto al activarse
    3.2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 días
    diseno ui

    Genera narración expresiva y multilingüe con fish.audio (modelos S1 / S2) y reutiliza voces clonadas mediante reference_id.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    diseno ui

    Genera y edita conversacionalmente vídeos cortos con Google Gemini Omni Flash: itera con ediciones en lenguaje natural, clips de 3-10s a 720p con audio y texto en pantalla, e imágenes de referencia por etiquetas.

    Costo de contexto al activarse
    2.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    Permisos
    diseno ui

    Genera vídeo con MiniMax H3 (Hailuo 3.0) por la API oficial v2, fal.ai, Runway, nodos partner de ComfyUI o pesos abiertos locales. Clips de 4-15s a 2K con animación de primer/último fotograma.

    Costo de contexto al activarse
    582 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    diseno ui

    Genera, reconstruye, inspecciona y enruta activos 3D de producción para mundos de OpenMontage con Atlas Cloud, fal.ai, catálogos con licencia y Blender.

    Costo de contexto al activarse
    1.2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 9 días
    diseno ui

    Skills relacionados

    Genera, reconstruye, inspecciona y enruta activos 3D de producción para mundos de OpenMontage con Atlas Cloud, fal.ai, catálogos con licencia y Blender.

    Costo de contexto al activarse
    1.2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 9 días
    diseno ui

    Acestep

    49.5k

    Generación musical con ACE-Step 1.5: música de fondo, pistas con voz, versiones y extracción de stems para producción de vídeo.

    Costo de contexto al activarse
    2.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 meses
    diseno ui

    Genera vídeos con IA desde texto usando varias pasarelas — HeyGen, fal.ai, Kling y Gemini — con soporte de imagen a vídeo y comparación entre VEO, Kling, Sora, Runway, Seedance y MiniMax.

    Costo de contexto al activarse
    3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    diseno ui