Skills Agentes

Videoagent Image Studio

Acceso con un solo comando a Midjourney, Flux, Ideogram y más, sin configurar claves API, para generar cualquier imagen sin preocuparte por credenciales.

Reemplaza a: Gestionar 8 API keys distintas de proveedores de generación de imágenes

Estrellas
788

en todo el repo

Actividad
33

0–100, la ruta de este skill

Actualizado
hace 6 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
1.7k tok

50 tok en reposo

Paquete
6 archivos

21 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add pexoai/pexo-skills --skill videoagent-image-studio --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests.

Qué hace

  • Genera imágenes con 8 modelos IA (Midjourney, Flux, Ideogram, Recraft, SDXL, Nano Banana) vía un script Node
  • Elige automáticamente el mejor modelo según la intención del usuario
  • Mejora el prompt con descriptores de estilo, iluminación y calidad antes de generar
  • Gestiona el polling asíncrono de Midjourney y ofrece acciones de upscale, variation y reroll

Úsalo cuando

  • El usuario pide generar, dibujar, crear o hacer cualquier imagen, foto, ilustración, icono, logo o artwork

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • “Dibuja un leopardo de las nieves con iluminación cinematográfica”
    • “Usa Flux para generar un póster de perfume con fondo blanco”
    • “Muéstrame un boceto rápido”
    • “Hazme un icono de app estilo flat en azul”

    SKILL.md

    En inglés

    🎨 VideoAgent Image Studio

    Use when: User asks to generate, draw, create, or make any kind of image, photo, illustration, icon, logo, or artwork.

    Generate images with 8 state-of-the-art AI models. This skill automatically picks the best model for the job and handles all the complexity — including Midjourney's async polling — so you can focus on the conversation.


    Quick Reference

    User Intent Model Speed
    Artistic, cinematic, painterly midjourney ~15s
    Photorealistic, portrait, product flux-pro ~8s
    General purpose, balanced flux-dev ~10s
    Quick draft, fast iteration flux-schnell ~2s
    Image with text, logo, poster ideogram ~10s
    Vector art, icon, flat design recraft ~8s
    Anime, stylized illustration sdxl ~5s
    Gemini-powered, consistent style nano-banana ~12s

    How to Generate an Image

    Step 1 — Enhance the prompt

    Before calling the script, expand the user's prompt with style, lighting, and quality descriptors appropriate for the chosen model.

    • Midjourney: Add cinematic lighting, ultra detailed, --v 7, --style raw
    • Flux: Add masterpiece, highly detailed, sharp focus, professional photography
    • Ideogram: Be explicit about text content, font style, and layout
    • Recraft: Specify vector illustration, flat design, icon style

    Step 2 — Run the script

    node {baseDir}/tools/generate.js \
      --model <model_id> \
      --prompt "<enhanced prompt>" \
      --aspect-ratio <ratio>
    

    All parameters:

    Parameter Default Description
    --model flux-dev Model ID from the table above
    --prompt (required) The image generation prompt
    --aspect-ratio 1:1 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 21:9
    --num-images 1 Number of images (1–4; Midjourney always returns 4)
    --negative-prompt — Things to avoid (not supported by Midjourney)
    --seed — Seed for reproducibility

    Step 3 — Return the result

    The script always waits and returns the final image URL(s). No polling required.

    {
      "success": true,
      "model": "flux-pro",
      "imageUrl": "https://...",
      "images": ["https://..."]
    }
    

    Send the imageUrl to the user.


    Midjourney Actions

    After generating a 4-image grid with Midjourney, offer the user these options:

    # Upscale image #2 (subtle, preserves details)
    node {baseDir}/tools/generate.js \
      --model midjourney \
      --action upscale \
      --index 2 \
      --job-id <job_id>
    
    # Create a strong variation of image #3
    node {baseDir}/tools/generate.js \
      --model midjourney \
      --action variation \
      --index 3 \
      --job-id <job_id> \
      --variation-type 1
    
    # Regenerate with same prompt
    node {baseDir}/tools/generate.js \
      --model midjourney \
      --action reroll \
      --job-id <job_id>
    

    Upscale types: 0 = Subtle (default, best for photos), 1 = Creative (best for illustrations)

    Variation types: 0 = Subtle (default), 1 = Strong (dramatic changes)


    Example Conversations

    User: "Draw a snow leopard on a snowy mountain with cinematic lighting"

    # Choose midjourney for artistic quality
    node {baseDir}/tools/generate.js \
      --model midjourney \
      --prompt "a majestic snow leopard on a snowy mountain peak, cinematic lighting, dramatic atmosphere, ultra detailed --ar 16:9 --v 7" \
      --aspect-ratio 16:9
    

    🎨 Done! Which one to upscale? (U1-U4) Or create a variant? (V1-V4)


    User: "Use Flux to generate a perfume product poster, white background"

    # Choose flux-pro for photorealistic product shots
    node {baseDir}/tools/generate.js \
      --model flux-pro \
      --prompt "a luxury perfume bottle on a clean white background, professional product photography, soft shadows, 8k, highly detailed" \
      --aspect-ratio 3:4
    

    User: "Show me a quick draft"

    # flux-schnell for instant previews
    node {baseDir}/tools/generate.js \
      --model flux-schnell \
      --prompt "..." \
      --aspect-ratio 1:1
    

    User: "Make me an App icon, flat style, blue theme"

    # recraft for vector/icon style
    node {baseDir}/tools/generate.js \
      --model recraft \
      --prompt "a minimal flat design app icon, blue color scheme, simple geometric shapes, vector style, white background"
    

    Setup

    Zero API keys needed! All requests go through a hosted proxy that handles authentication server-side.

    The skill works out of the box — just install and use.

    Advanced: Custom proxy or token

    If you want to use your own proxy or a persistent token, set these environment variables:

    {
      "skills": {
        "entries": {
          "videoagent-image-studio": {
            "enabled": true,
            "env": {
              "IMAGE_STUDIO_PROXY_URL": "https://your-proxy.vercel.app",
              "IMAGE_STUDIO_TOKEN": "your_token_here"
            }
          }
        }
      }
    }
    
    Variable Required Description
    IMAGE_STUDIO_PROXY_URL No Custom proxy base URL (default: https://image-gen-proxy.vercel.app)
    IMAGE_STUDIO_TOKEN No Persistent token (auto-obtained if not set, 100 free uses per token)

    To deploy your own proxy, see the videoagent-audio-studio proxy as a reference implementation. You'll need FAL_KEY and LEGNEXT_KEY as Vercel environment variables.


    Changelog

    v2.0.0

    • Simplified async: The script now blocks until Midjourney completes. No more --async / --poll flags needed in SKILL.md instructions.
    • Unified output format: All models return the same { success, imageUrl, images } shape.
    • Reference images for Nano Banana: Pass --reference-images "url1,url2" for character/style consistency across generations.

    v1.3.0

    • Added non-blocking async mode for Midjourney (--async + --poll).

    v1.2.0

    • Midjourney turbo mode enabled by default (~10-20s).

    v1.1.0

    • Switched Midjourney provider from TTAPI to Legnext.ai for better stability.

    v1.0.0

    • Initial release with Midjourney, Flux, SDXL, Nano Banana, Ideogram, Recraft.

    Reproducido de pexoai/pexo-skills bajo licencia MIT. Leer esta página en markdown.

    Archivos

    6 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    No requiere claves API propias: todo pasa por un proxy alojado, aunque opcionalmente se puede configurar IMAGE_STUDIO_PROXY_URL y IMAGE_STUDIO_TOKEN.

    Necesita en el PATH:node

    Detalles

    Creador
    pexoai
    Categoría
    Diseño y UI
    Licencia
    MIT
    Recursos incluidos
    Incluye scripts o referencias
    Código fuente
    Ver SKILL.md

    Más de pexoai/pexo-skills

    Este repo incluye 20 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack pexo-skills entero y su comando de instalación

    Skill de generación de video con IA que selecciona modelo automáticamente entre Seedance 2, Kling 3.0, HappyHorse y más de 10 modelos, y produce videos multi-toma de 5–120s desde texto, imágenes, URLs, guiones o audio.

    Costo de contexto al activarse
    4.9k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 2 meses
    video

    Genera video con IA a partir de texto, imagen o guion: enruta cada toma al mejor de 10+ modelos (Seedance, Kling, Veo, Sora...) y entrega un video final con música y subtítulos.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 3 meses
    video

    Crea un video explicativo narrado con Pexo: describe tu producto, concepto o proceso y Pexo escribe el guion, genera los visuales, añade voz en off y subtítulos.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 3 meses
    video

    Crea un video de fundador con Pexo: cuenta tu historia o pitch y Pexo escribe el guion, genera las tomas y entrega un video listo para publicar, con música.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 3 meses
    video

    Anima una foto fija en un vídeo terminado con Pexo: añade movimiento, cámara y música, elige el mejor modelo automáticamente y entrega el clip listo para publicar.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 3 meses
    video

    Crea un video de lanzamiento listo para publicar a partir de tu producto, URL de landing page o captura: guion, planos, modelos y música incluidos, ideal para Product Hunt o el día de lanzamiento.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 3 meses
    video

    Skills relacionados

    Crea arte algorítmico con p5.js, aleatoriedad con semilla y exploración interactiva de parámetros. Úsalo cuando pidan arte por código, arte generativo, flow fields o sistemas de partículas.

    Costo de contexto al activarse
    4.9k tok
    Tamaño del paquete
    4 archivos
    Última actualización
    hace 5 meses
    Oficialdiseno ui

    Aplica los colores y la tipografía oficiales de la marca Anthropic a cualquier artefacto que pueda beneficiarse de su look-and-feel. Úsalo cuando apliquen colores de marca o estándares de diseño.

    Costo de contexto al activarse
    559 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 5 meses
    Oficialdiseno ui

    Crea arte visual en documentos .png y .pdf partiendo de una filosofía de diseño. Úsalo cuando pidan un póster, una pieza de arte, un diseño u otra pieza estática.

    Costo de contexto al activarse
    3k tok
    Tamaño del paquete
    83 archivos
    Última actualización
    hace 5 meses
    Oficialdiseno ui