Skills Agentes

Vision Analysis

Analiza, describe y extrae información de imágenes con la herramienta de visión MCP de MiniMax. Se activa al compartir una imagen o pedir analizar, describir, revisar o extraer texto de una captura, diagrama, gráfico, mockup o wireframe.

Estrellas
13.5k

en todo el repo

Actividad
34

0–100, la ruta de este skill

Actualizado
hace 5 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
1.4k tok

241 tok en reposo

Paquete
1 archivo

5 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add MiniMax-AI/skills --skill vision-analysis --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests.

Qué hace

  • Analiza, describe y extrae información de imágenes con la herramienta MCP `MiniMax_understand_image` del plan MiniMax Token Plan.
  • Se dispara al recibir una ruta o URL de imagen (.jpg, .jpeg, .png, .gif, .webp, .bmp, .svg) o palabras como analizar, describir, extraer texto u OCR junto a una imagen.
  • Ofrece cinco modos con prompt específico: describe, ocr, ui-review, chart-data y object-detect.
  • Si el MCP no está configurado, detecta el entorno (OpenCode, Cursor, Claude Code) y da los comandos exactos de configuración.
  • Presenta el resultado según el modo: prosa legible para describe, estructura preservada para ocr y un formato de crítica para ui-review.

Úsalo cuando

  • El usuario comparte una ruta o URL de imagen, o pide analizar, describir, revisar o extraer texto de una imagen, captura, diagrama, gráfico, mockup o wireframe.
  • Revisión de mockups de UI, análisis de wireframes, crítica de diseño, extracción de datos de gráficos o detección de objetos.

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Analiza esta captura y dime qué contiene
    • Extrae todo el texto de esta imagen (OCR)
    • Haz una crítica de UX de este mockup

    SKILL.md

    En inglés

    Vision Analysis

    Analyze images using the MiniMax MiniMax_understand_image MCP tool available in the MiniMax Token Plan.

    Prerequisites

    • MiniMax Token Plan subscription with valid MINIMAX_API_KEY
    • MiniMax MCP configured (MiniMax_understand_image tool available)

    If MCP tool is not configured

    Step 1: The agent should fetch setup instructions from: https://platform.minimaxi.com/docs/token-plan/mcp-guide

    Step 2: Detect the user's environment (OpenCode, Cursor, Claude Code, etc.) and output the exact commands needed. Common examples:

    OpenCode — add to ~/.config/opencode/opencode.json or package.json:

    {
      "mcp": {
        "MiniMax": {
          "type": "local",
          "command": ["uvx", "minimax-coding-plan-mcp", "-y"],
          "environment": {
            "MINIMAX_API_KEY": "YOUR_TOKEN_PLAN_KEY",
            "MINIMAX_API_HOST": "https://api.minimaxi.com"
          },
          "enabled": true
        }
      }
    }
    

    Claude Code:

    claude mcp add -s user MiniMax --env MINIMAX_API_KEY=your-key --env MINIMAX_API_HOST=https://api.minimaxi.com -- uvx minimax-coding-plan-mcp -y
    

    Cursor — add to MCP settings:

    {
      "mcpServers": {
        "MiniMax": {
          "command": "uvx",
          "args": ["minimax-coding-plan-mcp"],
          "env": {
            "MINIMAX_API_KEY": "your-key",
            "MINIMAX_API_HOST": "https://api.minimaxi.com"
          }
        }
      }
    }
    

    Step 3: After configuration, tell the user to restart their app and verify with /mcp.

    Important: If the user does not have a MiniMax Token Plan subscription, inform them that the understand_image tool requires one — it cannot be used with free or other tier API keys.

    Analysis Modes

    Mode When to use Prompt strategy
    describe General image understanding Ask for detailed description
    ocr Text extraction from screenshots, documents Ask to extract all text verbatim
    ui-review UI mockups, wireframes, design files Ask for design critique with suggestions
    chart-data Charts, graphs, data visualizations Ask to extract data points and trends
    object-detect Identify objects, people, activities Ask to list and locate all elements

    Workflow

    Step 1: Auto-detect image

    The skill triggers automatically when a message contains an image file path or URL with extensions: .jpg, .jpeg, .png, .gif, .webp, .bmp, .svg

    Extract the image path from the message.

    Step 2: Select analysis mode and call MCP tool

    Use the MiniMax_understand_image tool with a mode-specific prompt:

    describe:

    Provide a detailed description of this image. Include: main subject, setting/background,
    colors/style, any text visible, notable objects, and overall composition.
    

    ocr:

    Extract all text visible in this image verbatim. Preserve structure and formatting
    (headers, lists, columns). If no text is found, say so.
    

    ui-review:

    You are a UI/UX design reviewer. Analyze this interface mockup or design. Provide:
    (1) Strengths — what works well, (2) Issues — usability or design problems,
    (3) Specific, actionable suggestions for improvement. Be constructive and detailed.
    

    chart-data:

    Extract all data from this chart or graph. List: chart title, axis labels, all
    data points/series with values if readable, and a brief summary of the trend.
    

    object-detect:

    List all distinct objects, people, and activities you can identify. For each,
    describe what it is and its approximate location in the image.
    

    Step 3: Present results

    Return the analysis clearly. For describe, use readable prose. For ocr, preserve structure. For ui-review, use a structured critique format.

    Output Format Example

    For describe mode:

    ## Image Description
    
    [Detailed description of the image contents...]
    

    For ocr mode:

    ## Extracted Text
    
    [Preserved text structure from the image]
    

    For ui-review mode:

    ## UI Design Review
    
    ### Strengths
    - ...
    
    ### Issues
    - ...
    
    ### Suggestions
    - ...
    

    Notes

    • Images up to 20MB supported (JPEG, PNG, GIF, WebP)
    • Local file paths work if MiniMax MCP is configured with file access
    • The MiniMax_understand_image tool is provided by the minimax-coding-plan-mcp package

    Reproducido de MiniMax-AI/skills bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Necesita una suscripción MiniMax Token Plan con `MINIMAX_API_KEY` válida y el MCP de MiniMax configurado (herramienta `MiniMax_understand_image`); no funciona con claves de tier gratuito.

    Detalles

    Creador
    MiniMax-AI
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de MiniMax-AI/skills

    Este repo incluye 23 skills. Si instalas uno, normalmente ya tienes los demás.

    Guía de desarrollo multiplataforma con Flutter: patrones de widget, gestión de estado con Riverpod y Bloc, navegación con GoRouter, optimización de rendimiento y testing de widgets.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    13 archivos
    Última actualización
    hace 4 meses
    herramientas desarrollo

    Construye páginas web completas y visualmente llamativas combinando diseño premium, animaciones cinemáticas, assets de media generados por IA, copy persuasivo y arte visual, con media real y motion avanzado.

    Costo de contexto al activarse
    5.2k tok
    Tamaño del paquete
    98 archivos
    Última actualización
    hace 4 meses
    diseno ui

    Guía de desarrollo de React Native y Expo: componentes, estilos, animaciones, navegación, gestión de estado, formularios, networking, rendimiento, testing, capacidades nativas y despliegue a las tiendas con EAS.

    Costo de contexto al activarse
    1.8k tok
    Tamaño del paquete
    12 archivos
    Última actualización
    hace 4 meses
    herramientas desarrollo

    Convierte la mascota de Claude Code (`/buddy`) en cantante. Cada mascota recibe una identidad vocal única basada en su nombre y personalidad, cacheada para que suene siempre igual.

    Costo de contexto al activarse
    4.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 meses
    productividad

    Genera canciones vocales o instrumentales con la API de música de MiniMax. Se activa para crear música, escribir canciones, generar letra o convertir una letra en canción; no para reproducir archivos ni teoría musical.

    Costo de contexto al activarse
    3.5k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    productividad

    Genera playlists de música personalizadas analizando el gusto del usuario y su historial de feedback, y crea una portada de álbum. Se activa para generar playlists, perfilar el gusto musical o pedir recomendaciones personalizadas.

    Costo de contexto al activarse
    3.2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    productividad

    Skills relacionados

    Guía de desarrollo y diseño de UI de aplicaciones Android nativas: Material Design 3, desarrollo con Kotlin y Compose, configuración del proyecto, accesibilidad y resolución de problemas de build. Léela antes de empezar.

    Costo de contexto al activarse
    7.2k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    hace 5 meses
    herramientas desarrollo

    Convierte la mascota de Claude Code (`/buddy`) en cantante. Cada mascota recibe una identidad vocal única basada en su nombre y personalidad, cacheada para que suene siempre igual.

    Costo de contexto al activarse
    4.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 meses
    productividad

    Elige paletas de color y emparejamientos de fuentes listos para presentación en tareas de PPT y diseño. Se activa para temas visuales, paletas seguras para marca o recomendaciones de fuentes (配色, 色板, 字体, color palette, font).

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    diseno ui