Skills Agentes

Azure Speech To Text

Transcribe audio a texto con Azure AI Speech (API REST Fast Transcription). Proveedor STT en la nube opcional, preferido cuando AZURE_SPEECH_KEY está configurada.

Reemplaza a: Batch Transcription de Azure con Blob storage y URLs SAS, El SDK nativo de Speech (`spx`)

Estrellas
49.5k

en todo el repo

Actividad
54

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
1

últimos 90 días

Contexto
1.3k tok

83 tok en reposo

Paquete
1 archivo

5 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add calesthio/OpenMontage --skill azure-speech-to-text --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests.

Qué hace

  • Transcribe archivos de audio locales con la API REST Fast Transcription de Azure AI Speech
  • Usa Fast Transcription en vez de Batch o el SDK: no hace falta Blob storage, ni URLs SAS, ni paquete nativo — solo `requests` y dos variables de entorno
  • Devuelve la respuesta mapeada al esquema del `transcriber` de OpenMontage
  • Es la ruta preferida cuando `AZURE_SPEECH_KEY` está configurada; si no, el `transcriber` local con faster-whisper es la ruta offline por defecto

Úsalo cuando

  • Convertir audio o vídeo a texto
  • Generar subtítulos
  • Procesar contenido hablado dentro de OpenMontage

No lo uses cuando

  • No hay clave de Azure configurada: la ruta por defecto es el faster-whisper local

Qué lo activa

Di cualquiera de estas frases y el agente debería cargar este skill.

  • Transcribe este audio a texto
  • Genera subtítulos para este vídeo
  • Pásame a texto lo que se dice en este archivo

SKILL.md

En inglés

Azure AI Speech — Speech-to-Text

Transcribe audio to text with Azure Fast Transcription — synchronous, word-level timestamps, speaker diarization, and multi-language identification. In OpenMontage this is exposed through the azure_stt tool (capability=analysis, provider=azure). It is an optional cloud STT provider — when AZURE_SPEECH_KEY is configured, prefer it for cloud transcription. The local transcriber tool (faster-whisper) remains the default offline path and the fallback when Azure is unavailable.

Docs: Fast Transcription · Speech service overview

Why Fast Transcription (not Batch)

Azure exposes three STT surfaces. OpenMontage uses Fast Transcription because the pipeline transcribes local audio files:

Surface Input Latency Needs
Fast Transcription (used here) local file, multipart POST synchronous, sub-real-time key + region
Batch Transcription audio at a URL (Blob + SAS) async job + polling Blob storage plumbing
Speech SDK (spx) mic / stream / file streaming native azure-cognitiveservices-speech package

Fast Transcription needs no Blob storage, no SAS URLs, and no native SDK — just requests and the two env vars.

Setup

Create a Speech resource in the Azure portal; copy the key and region from its Keys and Endpoint page.

export AZURE_SPEECH_KEY=your_speech_resource_key
export AZURE_SPEECH_REGION=eastus          # your resource's region
# export AZURE_SPEECH_ENDPOINT=https://...  # optional: overrides region

azure_stt reports AVAILABLE once AZURE_SPEECH_KEY plus either AZURE_SPEECH_REGION or AZURE_SPEECH_ENDPOINT are set.

Using it in a pipeline

Prefer azure_stt over transcriber unless the run must be offline. Its output matches the transcriber schema exactly, so it is a drop-in for subtitle_gen and any stage that consumes a transcript.

from tools.tool_registry import registry
registry.discover()
stt = registry._tools["azure_stt"]

result = stt.execute({
    "input_path": "projects/my-video/assets/audio/narration.mp3",
    # "language": "en",          # ISO 639-1 or BCP-47 ("en-US"); omit for auto-ID
    # "diarize": True,           # speaker labels, no HuggingFace token needed
    # "max_speakers": 4,
    "output_dir": "projects/my-video/artifacts",
})
if result.success:
    segs = result.data["segments"]          # [{id,start,end,text,words:[...]}]
    words = result.data["word_timestamps"]  # flat [{word,start,end,probability}]

If azure_stt is unavailable (no key) or errors, fall back to transcriber (local whisper) — its execute signature and output are identical.

Parameters that matter

  • language — pass an ISO code ("en") or a full locale ("en-US"). Pin it when you know the language; it is faster and more accurate than auto-ID.
  • candidate_locales — when language is omitted, Azure runs language identification across this shortlist. Narrow it to the languages you actually expect; a huge list slows detection and invites misclassification.
  • diarize / max_speakers — enable for multi-speaker audio (interviews, podcasts). Set max_speakers to the real upper bound.
  • profanity_filterNone | Masked (default) | Removed | Tags.

Response shape (mapped to the transcriber schema)

The raw Azure response (phrases[] with offsetMilliseconds / words[]) is converted to seconds and the OpenMontage transcript schema:

{
  "segments": [
    {"id": 0, "start": 0.0, "end": 2.4, "text": "Hello world",
     "speaker": 1,
     "words": [{"word": "Hello", "start": 0.0, "end": 0.5, "probability": 0.98}]}
  ],
  "word_timestamps": [{"word": "Hello", "start": 0.0, "end": 0.5, "probability": 0.98}],
  "language": "en-US",
  "duration_seconds": 2.4,
  "provider": "azure"
}

Note: Fast Transcription has no per-word confidence, so each word carries the phrase confidence in probability.

Limits & tips

  • Single file up to ~2 hours / a few hundred MB per request. For longer or bulk jobs, use Azure Batch Transcription instead.
  • Send clean audio (16 kHz+ mono is plenty). Transcode video to audio first if you only need speech — smaller upload, same result.
  • Verify timing: word timestamps drive subtitle cues in subtitle_gen. Spot-check the first and last cues against the source audio.

Reproducido de calesthio/OpenMontage bajo licencia MIT. Leer esta página en markdown.

Archivos

1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

Antes de instalar

Necesita acceso a internet y un recurso de Azure AI Speech con `AZURE_SPEECH_KEY` y `AZURE_SPEECH_REGION`.

Detalles

Creador
calesthio
Licencia
MIT
Recursos incluidos
Solo SKILL.md
Código fuente
Ver SKILL.md

Etiquetas

Más de calesthio/OpenMontage

Este repo incluye 89 skills. Si instalas uno, normalmente ya tienes los demás.

Comfyui

49.5k

Úsalo al trabajar con workflows de ComfyUI en OpenMontage: comfyui_image/video/music, workflows propios, selección de output_node, modelos que faltan, LoRAs, poca VRAM e importación de workflows de la comunidad.

Costo de contexto al activarse
1.9k tok
Tamaño del paquete
1 archivo
Última actualización
hace 9 días
diseno ui

Genera vídeo cinematográfico de 4-30 s con ByteDance Seedance 2.5 por fal.ai, Volcengine Ark, Runway o ComfyUI. Cubre el contrato de prompt 2.5, cortes duros, locks de continuidad y voz.

Costo de contexto al activarse
3.2k tok
Tamaño del paquete
2 archivos
Última actualización
hace 4 días
diseno ui

Genera narración expresiva y multilingüe con fish.audio (modelos S1 / S2) y reutiliza voces clonadas mediante reference_id.

Costo de contexto al activarse
1.4k tok
Tamaño del paquete
1 archivo
Última actualización
hace 9 días
diseno ui

Genera y edita conversacionalmente vídeos cortos con Google Gemini Omni Flash: itera con ediciones en lenguaje natural, clips de 3-10s a 720p con audio y texto en pantalla, e imágenes de referencia por etiquetas.

Costo de contexto al activarse
2.1k tok
Tamaño del paquete
1 archivo
Última actualización
hace 9 días
Permisos
diseno ui

Genera vídeo con MiniMax H3 (Hailuo 3.0) por la API oficial v2, fal.ai, Runway, nodos partner de ComfyUI o pesos abiertos locales. Clips de 4-15s a 2K con animación de primer/último fotograma.

Costo de contexto al activarse
582 tok
Tamaño del paquete
1 archivo
Última actualización
hace 9 días
diseno ui

Genera, reconstruye, inspecciona y enruta activos 3D de producción para mundos de OpenMontage con Atlas Cloud, fal.ai, catálogos con licencia y Blender.

Costo de contexto al activarse
1.2k tok
Tamaño del paquete
2 archivos
Última actualización
hace 9 días
diseno ui

Skills relacionados

D3 Viz

49.5k

Crea visualizaciones de datos interactivas con d3.js. Úsalo para gráficos a medida, diagramas de red, visualizaciones geográficas o cualquier SVG complejo que necesite control fino de elementos, transiciones e interacciones.

Costo de contexto al activarse
5.4k tok
Tamaño del paquete
7 archivos
Última actualización
hace 4 meses
datos analitica

Transcribe audio a texto con ElevenLabs Scribe v2. Úsalo para convertir audio o vídeo a texto, generar subtítulos, transcribir reuniones o procesar contenido hablado.

Costo de contexto al activarse
2k tok
Tamaño del paquete
7 archivos
Última actualización
hace 4 meses
datos analitica

Entiende el contenido de un vídeo en local con extracción de fotogramas por ffmpeg y transcripción con Whisper. Sin claves de API.

Costo de contexto al activarse
841 tok
Tamaño del paquete
3 archivos
Última actualización
hace 4 meses
datos analitica