# Video Understand > Entiende el contenido de un vídeo en local con extracción de fotogramas por ffmpeg y transcripción con Whisper. Sin claves de API. Fuente: https://skillsagentes.com/skills/calesthio/openmontage/video-understand Markdown: https://skillsagentes.com/skills/calesthio/openmontage/video-understand.md Repositorio: https://github.com/calesthio/OpenMontage Autor: calesthio Licencia: AGPL-3.0 Actualizado: hace 4 meses Coste de contexto: 72 tok instalada, 841 tok al activarse, 6.8k tok con todos los archivos del bundle Bundle: 3 archivos, 27 KB Permisos que pide: ninguno declarado ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add calesthio/OpenMontage --skill video-understand --agent claude-code # Cursor npx -y skills add calesthio/OpenMontage --skill video-understand --agent cursor # Codex npx -y skills add calesthio/OpenMontage --skill video-understand --agent codex # Gemini CLI npx -y skills add calesthio/OpenMontage --skill video-understand --agent gemini # Windsurf npx -y skills add calesthio/OpenMontage --skill video-understand --agent windsurf # Cline npx -y skills add calesthio/OpenMontage --skill video-understand --agent cline ``` ## Qué hace - Entiende el contenido de un vídeo en local, sin claves de API y totalmente offline - Extrae fotogramas con ffmpeg: detección de escenas, keyframes o intervalos regulares, con límite de fotogramas - Transcribe el audio con Whisper, y permite elegir un modelo mayor - Puede saltarse la transcripción y sacar solo fotogramas, o dar salida JSON en modo silencioso ## Cuándo usarla - Entender qué contiene un vídeo - Transcribir el audio de un vídeo en local - Extraer fotogramas clave para analizarlos visualmente - Sacar el contenido de un vídeo sin usar claves de API ## Qué la activa - "¿De qué va este vídeo?" - "Transcribe este vídeo en local" - "Sácame los fotogramas clave de este clip" - "Analiza el contenido de este vídeo sin subirlo a ningún sitio" ## Antes de instalar - Necesita `ffmpeg` y `ffprobe`; la transcripción es opcional y requiere `openai-whisper` (`pip install openai-whisper`). - Necesita en el PATH: python3 ## Archivos - SKILL.md — 3 KB - references/output-format.md — 3 KB - scripts/understand_video.py — 20 KB ## SKILL.md Reproducido tal cual desde calesthio/OpenMontage bajo AGPL-3.0. Esta sección es el documento original y está en inglés. # video-understand Understand video content locally using ffmpeg for frame extraction and Whisper for transcription. Fully offline, no API keys required. ## Prerequisites - `ffmpeg` + `ffprobe` (required): `brew install ffmpeg` - `openai-whisper` (optional, for transcription): `pip install openai-whisper` ## Commands ```bash # Scene detection + transcribe (default) python3 skills/video-understand/scripts/understand_video.py video.mp4 # Keyframe extraction python3 skills/video-understand/scripts/understand_video.py video.mp4 -m keyframe # Regular interval extraction python3 skills/video-understand/scripts/understand_video.py video.mp4 -m interval # Limit frames extracted python3 skills/video-understand/scripts/understand_video.py video.mp4 --max-frames 10 # Use a larger Whisper model python3 skills/video-understand/scripts/understand_video.py video.mp4 --whisper-model small # Frames only, skip transcription python3 skills/video-understand/scripts/understand_video.py video.mp4 --no-transcribe # Quiet mode (JSON only, no progress) python3 skills/video-understand/scripts/understand_video.py video.mp4 -q # Output to file python3 skills/video-understand/scripts/understand_video.py video.mp4 -o result.json ``` ## CLI Options | Flag | Description | |------|-------------| | `video` | Input video file (positional, required) | | `-m, --mode` | Extraction mode: `scene` (default), `keyframe`, `interval` | | `--max-frames` | Maximum frames to keep (default: 20) | | `--whisper-model` | Whisper model size: tiny, base, small, medium, large (default: base) | | `--no-transcribe` | Skip audio transcription, extract frames only | | `-o, --output` | Write result JSON to file instead of stdout | | `-q, --quiet` | Suppress progress messages, output only JSON | ## Extraction Modes | Mode | How it works | Best for | |------|-------------|----------| | `scene` | Detects scene changes via ffmpeg `select='gt(scene,0.3)'` | Most videos, varied content | | `keyframe` | Extracts I-frames (codec keyframes) | Encoded video with natural keyframe placement | | `interval` | Evenly spaced frames based on duration and max-frames | Fixed sampling, predictable output | If `scene` mode detects no scene changes, it automatically falls back to `interval` mode. ## Output The script outputs JSON to stdout (or file with `-o`). See `references/output-format.md` for the full schema. ```json { "video": "video.mp4", "duration": 18.076, "resolution": {"width": 1224, "height": 1080}, "mode": "scene", "frames": [ {"path": "/abs/path/frame_0001.jpg", "timestamp": 0.0, "timestamp_formatted": "00:00"} ], "frame_count": 12, "transcript": [ {"start": 0.0, "end": 2.5, "text": "Hello and welcome..."} ], "text": "Full transcript...", "note": "Use the Read tool to view frame images for visual understanding." } ``` Use the Read tool on frame image paths to visually inspect extracted frames. ## References - `references/output-format.md` -- Full JSON output schema documentation ## Dónde encaja - Categoría: [Datos y analítica](https://skillsagentes.com/categorias/datos-analitica.md) — Consulta, limpia y visualiza datos sin salir del agente. - Creador: [calesthio](https://skillsagentes.com/creators/calesthio.md) — 0 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Seedance 2 5](https://skillsagentes.com/skills/calesthio/openmontage/seedance-2-5.md): Genera vídeo cinematográfico de 4-30 s con ByteDance Seedance 2.5 por fal.ai, Volcengine Ark, Runway o ComfyUI. Cubre el contrato de prompt 2.5, cortes duros, locks de continuidad y voz. - [Comfyui](https://skillsagentes.com/skills/calesthio/openmontage/comfyui.md): Úsalo al trabajar con workflows de ComfyUI en OpenMontage: comfyui_image/video/music, workflows propios, selección de output_node, modelos que faltan, LoRAs, poca VRAM e importación de workflows de la comunidad. - [Fish Audio Tts](https://skillsagentes.com/skills/calesthio/openmontage/fish-audio-tts.md): Genera narración expresiva y multilingüe con fish.audio (modelos S1 / S2) y reutiliza voces clonadas mediante reference_id. - [Minimax H3](https://skillsagentes.com/skills/calesthio/openmontage/minimax-h3.md): Genera vídeo con MiniMax H3 (Hailuo 3.0) por la API oficial v2, fal.ai, Runway, nodos partner de ComfyUI o pesos abiertos locales. Clips de 4-15s a 2K con animación de primer/último fotograma. - [Gemini Omni](https://skillsagentes.com/skills/calesthio/openmontage/gemini-omni.md): Genera y edita conversacionalmente vídeos cortos con Google Gemini Omni Flash: itera con ediciones en lenguaje natural, clips de 3-10s a 720p con audio y texto en pantalla, e imágenes de referencia por etiquetas. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)