# Grok Media > Guía de generación de imagen y vídeo con xAI Grok: autenticación, endpoints, estructura de prompt, edición de imagen, vídeo con imagen de referencia y polling asíncrono. Fuente: https://skillsagentes.com/skills/calesthio/openmontage/grok-media Markdown: https://skillsagentes.com/skills/calesthio/openmontage/grok-media.md Repositorio: https://github.com/calesthio/OpenMontage Autor: calesthio Licencia: AGPL-3.0 Actualizado: hace 4 meses Coste de contexto: 38 tok instalada, 950 tok al activarse, 950 tok con todos los archivos del bundle Bundle: 1 archivo, 4 KB Permisos que pide: ninguno declarado ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add calesthio/OpenMontage --skill grok-media --agent claude-code # Cursor npx -y skills add calesthio/OpenMontage --skill grok-media --agent cursor # Codex npx -y skills add calesthio/OpenMontage --skill grok-media --agent codex # Gemini CLI npx -y skills add calesthio/OpenMontage --skill grok-media --agent gemini # Windsurf npx -y skills add calesthio/OpenMontage --skill grok-media --agent windsurf # Cline npx -y skills add calesthio/OpenMontage --skill grok-media --agent cline ``` ## Qué hace - Guía la generación de imagen y vídeo con Grok de xAI: autenticación, endpoints y polling asíncrono - Cubre texto a imagen, edición de imagen y vídeo condicionado por imagen de referencia - Da pautas de prompt específicas de Grok para imagen y para vídeo - Documenta modos, restricciones de vídeo, precios y manejo de fallos ## Cuándo usarla - Transferencia de estilo en imagen o composición desde varias fuentes - Vídeo corto condicionado por referencia o clips de movimiento centrados en producto - Escenas con personaje consistente sin bloqueo duro de primer fotograma ## Cuándo no - Generación de clips largos - Dependencia fuerte de semillas deterministas - Prompts sobrecargados con varios cambios de escena ## Qué la activa - "Genera esta imagen con Grok" - "Edita esta imagen con xAI" - "Hazme un clip corto a partir de esta imagen de referencia" ## Antes de instalar - Necesita credenciales de la API de xAI; consulta la tabla de precios del skill antes de lanzar un lote. ## Archivos - SKILL.md — 4 KB ## SKILL.md Reproducido tal cual desde calesthio/OpenMontage bajo AGPL-3.0. Esta sección es el documento original y está en inglés. # Grok Media Use this skill when working with xAI media models in OpenMontage. ## Models - `grok-imagine-image` for image generation and image editing - `grok-imagine-video` for text-to-video, image-to-video, and reference-image video ## Authentication - Env var: `XAI_API_KEY` - Base URL: `https://api.x.ai/v1` - Header: `Authorization: Bearer $XAI_API_KEY` ## Image API ### Text-to-image - Endpoint: `POST /images/generations` - Core fields: - `model` - `prompt` - `n` - `aspect_ratio` - `resolution` ### Image edit - Endpoint: `POST /images/edits` - Use `image` for one source image - Use `images` for multi-image compositing - Each source image can be: - a public HTTPS URL - a base64 data URI ### Image prompting - Grok responds well to direct natural language - For edits, describe only the intended change and preserve everything else implicitly - For multi-image merges, explicitly name how each source contributes - Prefer one strong scene description over long style-stacking ## Video API ### Generation - Endpoint: `POST /videos/generations` - Polling endpoint: `GET /videos/{request_id}` - Success state: `status == "done"` - Failure states to handle explicitly: `failed`, `expired` ### Modes - Text-to-video: - prompt-only generation - Image-to-video: - use `image: {"url": ...}` - this anchors the starting frame - Reference-to-video: - use `reference_images: [{"url": ...}, ...]` - this influences who/what appears in the video without locking the first frame - prompts can reference inputs with placeholders like ``, `` ### Video constraints - Grok video is best treated as short-form generation - Current output resolutions are `480p` and `720p` - Reference-image video supports multiple images and is useful for product placement, wardrobe transfer, and identity consistency - Download outputs promptly; provider URLs may be temporary ## Pricing - `grok-imagine-image`: `$0.02` per generated image - `grok-imagine-image` edits/composites: add `$0.002` per input image - `grok-imagine-video`: - `480p`: `$0.05` per second - `720p`: `$0.07` per second - `grok-imagine-video` image-conditioned requests: add `$0.002` per input image ## Grok-Specific Prompt Guidance ### Images - Start with subject, action, setting - Add one style anchor, not five - For edits: - describe the desired modification - keep the rest of the image stable by omission, not by writing a giant preservation list ### Video - Keep prompts scene-local: one shot, one main motion idea, one emotional beat - For reference-conditioned video, explicitly map source images to roles: - person from `` - jacket from `` - product from `` - Camera and pacing language helps: - slow push-in - handheld follow - locked-off medium shot - high-energy whip pan transition ## Good Fits - Image style transfer - Image compositing from multiple sources - Reference-conditioned short video - Product-led motion clips - Character-consistent scenes without hard first-frame lock ## Weak Fits - Long-form clip generation - Heavy reliance on deterministic seeds - Overloaded prompts with multiple scene changes ## Failure Handling - If generation submission succeeds but polling expires, surface it as a provider/runtime issue - If a request fails, preserve the endpoint, mode, and prompt summary in the error - Do not silently substitute a different provider after xAI was selected without user approval ## Dónde encaja - Categoría: [Diseño y UI](https://skillsagentes.com/categorias/diseno-ui.md) — Sistemas de diseño, trabajo con componentes y acabado visual. - Creador: [calesthio](https://skillsagentes.com/creators/calesthio.md) — 0 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Seedance 2 5](https://skillsagentes.com/skills/calesthio/openmontage/seedance-2-5.md): Genera vídeo cinematográfico de 4-30 s con ByteDance Seedance 2.5 por fal.ai, Volcengine Ark, Runway o ComfyUI. Cubre el contrato de prompt 2.5, cortes duros, locks de continuidad y voz. - [Comfyui](https://skillsagentes.com/skills/calesthio/openmontage/comfyui.md): Úsalo al trabajar con workflows de ComfyUI en OpenMontage: comfyui_image/video/music, workflows propios, selección de output_node, modelos que faltan, LoRAs, poca VRAM e importación de workflows de la comunidad. - [Fish Audio Tts](https://skillsagentes.com/skills/calesthio/openmontage/fish-audio-tts.md): Genera narración expresiva y multilingüe con fish.audio (modelos S1 / S2) y reutiliza voces clonadas mediante reference_id. - [Minimax H3](https://skillsagentes.com/skills/calesthio/openmontage/minimax-h3.md): Genera vídeo con MiniMax H3 (Hailuo 3.0) por la API oficial v2, fal.ai, Runway, nodos partner de ComfyUI o pesos abiertos locales. Clips de 4-15s a 2K con animación de primer/último fotograma. - [Gemini Omni](https://skillsagentes.com/skills/calesthio/openmontage/gemini-omni.md): Genera y edita conversacionalmente vídeos cortos con Google Gemini Omni Flash: itera con ediciones en lenguaje natural, clips de 3-10s a 720p con audio y texto en pantalla, e imágenes de referencia por etiquetas. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)