Skills Agentes

Video Understand

Entiende el contenido de un vídeo en local con extracción de fotogramas por ffmpeg y transcripción con Whisper. Sin claves de API.

Reemplaza a: Servicios de transcripción y análisis de vídeo en la nube

Estrellas
49.5k

en todo el repo

Actividad
36

0–100, la ruta de este skill

Actualizado
hace 4 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
841 tok

72 tok en reposo

Paquete
3 archivos

27 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add calesthio/OpenMontage --skill video-understand --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Entiende el contenido de un vídeo en local, sin claves de API y totalmente offline
  • Extrae fotogramas con ffmpeg: detección de escenas, keyframes o intervalos regulares, con límite de fotogramas
  • Transcribe el audio con Whisper, y permite elegir un modelo mayor
  • Puede saltarse la transcripción y sacar solo fotogramas, o dar salida JSON en modo silencioso

Úsalo cuando

  • Entender qué contiene un vídeo
  • Transcribir el audio de un vídeo en local
  • Extraer fotogramas clave para analizarlos visualmente
  • Sacar el contenido de un vídeo sin usar claves de API

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • ¿De qué va este vídeo?
    • Transcribe este vídeo en local
    • Sácame los fotogramas clave de este clip
    • Analiza el contenido de este vídeo sin subirlo a ningún sitio

    SKILL.md

    En inglés

    video-understand

    Understand video content locally using ffmpeg for frame extraction and Whisper for transcription. Fully offline, no API keys required.

    Prerequisites

    • ffmpeg + ffprobe (required): brew install ffmpeg
    • openai-whisper (optional, for transcription): pip install openai-whisper

    Commands

    # Scene detection + transcribe (default)
    python3 skills/video-understand/scripts/understand_video.py video.mp4
    
    # Keyframe extraction
    python3 skills/video-understand/scripts/understand_video.py video.mp4 -m keyframe
    
    # Regular interval extraction
    python3 skills/video-understand/scripts/understand_video.py video.mp4 -m interval
    
    # Limit frames extracted
    python3 skills/video-understand/scripts/understand_video.py video.mp4 --max-frames 10
    
    # Use a larger Whisper model
    python3 skills/video-understand/scripts/understand_video.py video.mp4 --whisper-model small
    
    # Frames only, skip transcription
    python3 skills/video-understand/scripts/understand_video.py video.mp4 --no-transcribe
    
    # Quiet mode (JSON only, no progress)
    python3 skills/video-understand/scripts/understand_video.py video.mp4 -q
    
    # Output to file
    python3 skills/video-understand/scripts/understand_video.py video.mp4 -o result.json
    

    CLI Options

    Flag Description
    video Input video file (positional, required)
    -m, --mode Extraction mode: scene (default), keyframe, interval
    --max-frames Maximum frames to keep (default: 20)
    --whisper-model Whisper model size: tiny, base, small, medium, large (default: base)
    --no-transcribe Skip audio transcription, extract frames only
    -o, --output Write result JSON to file instead of stdout
    -q, --quiet Suppress progress messages, output only JSON

    Extraction Modes

    Mode How it works Best for
    scene Detects scene changes via ffmpeg select='gt(scene,0.3)' Most videos, varied content
    keyframe Extracts I-frames (codec keyframes) Encoded video with natural keyframe placement
    interval Evenly spaced frames based on duration and max-frames Fixed sampling, predictable output

    If scene mode detects no scene changes, it automatically falls back to interval mode.

    Output

    The script outputs JSON to stdout (or file with -o). See references/output-format.md for the full schema.

    {
      "video": "video.mp4",
      "duration": 18.076,
      "resolution": {"width": 1224, "height": 1080},
      "mode": "scene",
      "frames": [
        {"path": "/abs/path/frame_0001.jpg", "timestamp": 0.0, "timestamp_formatted": "00:00"}
      ],
      "frame_count": 12,
      "transcript": [
        {"start": 0.0, "end": 2.5, "text": "Hello and welcome..."}
      ],
      "text": "Full transcript...",
      "note": "Use the Read tool to view frame images for visual understanding."
    }
    

    Use the Read tool on frame image paths to visually inspect extracted frames.

    References

    • references/output-format.md -- Full JSON output schema documentation

    Reproducido de calesthio/OpenMontage bajo licencia AGPL-3.0. Leer esta página en markdown.

    Archivos

    3 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Necesita `ffmpeg` y `ffprobe`; la transcripción es opcional y requiere `openai-whisper` (`pip install openai-whisper`).

    Necesita en el PATH:python3

    Detalles

    Creador
    calesthio
    Licencia
    AGPL-3.0
    Recursos incluidos
    scripts en python + referencias
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de calesthio/OpenMontage

    Este repo incluye 89 skills. Si instalas uno, normalmente ya tienes los demás.

    Comfyui

    49.5k

    Úsalo al trabajar con workflows de ComfyUI en OpenMontage: comfyui_image/video/music, workflows propios, selección de output_node, modelos que faltan, LoRAs, poca VRAM e importación de workflows de la comunidad.

    Costo de contexto al activarse
    1.9k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    diseno ui

    Genera vídeo cinematográfico de 4-30 s con ByteDance Seedance 2.5 por fal.ai, Volcengine Ark, Runway o ComfyUI. Cubre el contrato de prompt 2.5, cortes duros, locks de continuidad y voz.

    Costo de contexto al activarse
    3.2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 días
    diseno ui

    Genera narración expresiva y multilingüe con fish.audio (modelos S1 / S2) y reutiliza voces clonadas mediante reference_id.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    diseno ui

    Genera y edita conversacionalmente vídeos cortos con Google Gemini Omni Flash: itera con ediciones en lenguaje natural, clips de 3-10s a 720p con audio y texto en pantalla, e imágenes de referencia por etiquetas.

    Costo de contexto al activarse
    2.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    Permisos
    diseno ui

    Genera vídeo con MiniMax H3 (Hailuo 3.0) por la API oficial v2, fal.ai, Runway, nodos partner de ComfyUI o pesos abiertos locales. Clips de 4-15s a 2K con animación de primer/último fotograma.

    Costo de contexto al activarse
    582 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 9 días
    diseno ui

    Genera, reconstruye, inspecciona y enruta activos 3D de producción para mundos de OpenMontage con Atlas Cloud, fal.ai, catálogos con licencia y Blender.

    Costo de contexto al activarse
    1.2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 9 días
    diseno ui

    Skills relacionados

    Transcribe audio a texto con Azure AI Speech (API REST Fast Transcription). Proveedor STT en la nube opcional, preferido cuando AZURE_SPEECH_KEY está configurada.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    datos analitica

    D3 Viz

    49.5k

    Crea visualizaciones de datos interactivas con d3.js. Úsalo para gráficos a medida, diagramas de red, visualizaciones geográficas o cualquier SVG complejo que necesite control fino de elementos, transiciones e interacciones.

    Costo de contexto al activarse
    5.4k tok
    Tamaño del paquete
    7 archivos
    Última actualización
    hace 4 meses
    datos analitica

    Transcribe audio a texto con ElevenLabs Scribe v2. Úsalo para convertir audio o vídeo a texto, generar subtítulos, transcribir reuniones o procesar contenido hablado.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    7 archivos
    Última actualización
    hace 4 meses
    datos analitica