Skills Agentes

Baoyu Danger Gemini Web

Genera imágenes y texto mediante la API web de Gemini (ingeniería inversa). Soporta generación de texto e imágenes, imágenes de referencia para visión y conversaciones multi-turno.

Estrellas
25k

en todo el repo

Actividad
53

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
2

últimos 90 días

Contexto
1.6k tok

89 tok en reposo

Paquete
28 archivos

95 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add JimLiu/baoyu-skills --skill baoyu-danger-gemini-web --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests, reads environment config.

Qué hace

  • Genera texto e imágenes usando la API web de Gemini mediante ingeniería inversa
  • Acepta imágenes de referencia como entrada de visión
  • Mantiene conversaciones multi-turno con sessionId
  • Autentica vía navegador y cachea cookies automáticamente

Úsalo cuando

  • Otra skill necesita un backend de generación de imágenes
  • El usuario pide 'generar imagen con Gemini' o 'generación de texto con Gemini'
  • Se necesita generación de IA con capacidad de visión

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Genera una imagen de un gato con Gemini
    • Describe esta imagen usando Gemini
    • Continúa esta conversación con Gemini usando el mismo sessionId

    SKILL.md

    En inglés

    Gemini Web Client

    Text/image generation via Gemini Web API. Supports reference images and multi-turn conversations.

    User Input Tools

    When this skill prompts the user, follow this tool-selection rule (priority order):

    1. Prefer built-in user-input tools exposed by the current agent runtime — e.g., AskUserQuestion, request_user_input, clarify, ask_user, or any equivalent.
    2. Fallback: if no such tool exists, emit a numbered plain-text message and ask the user to reply with the chosen number/answer for each question.
    3. Batching: if the tool supports multiple questions per call, combine all applicable questions into a single call; if only single-question, ask them one at a time in priority order.

    Concrete AskUserQuestion references below are examples — substitute the local equivalent in other runtimes.

    Script Directory

    Important: All scripts are located in the scripts/ subdirectory of this skill.

    Agent Execution Instructions:

    1. Determine this SKILL.md file's directory path as {baseDir}
    2. Script path = {baseDir}/scripts/<script-name>.ts
    3. Resolve ${BUN_X} runtime: if bun installed → bun; if npx available → npx -y bun; else suggest installing bun
    4. Replace all {baseDir} and ${BUN_X} in this document with actual values

    Script Reference:

    Script Purpose
    scripts/main.ts CLI entry point for text/image generation
    scripts/gemini-webapi/* TypeScript port of gemini_webapi (GeminiClient, types, utils)

    Consent Check (REQUIRED)

    Before first use, verify user consent for reverse-engineered API usage.

    Consent file locations:

    • macOS: ~/Library/Application Support/baoyu-skills/gemini-web/consent.json
    • Linux: ~/.local/share/baoyu-skills/gemini-web/consent.json
    • Windows: %APPDATA%\baoyu-skills\gemini-web\consent.json

    Flow:

    1. Check if consent file exists with accepted: true and disclaimerVersion: "1.0"
    2. If valid consent exists → print warning with acceptedAt date, proceed
    3. If no consent → show disclaimer, ask user via AskUserQuestion:
      • "Yes, I accept" → create consent file with ISO timestamp, proceed
      • "No, I decline" → output decline message, stop
    4. Consent file format: {"version":1,"accepted":true,"acceptedAt":"<ISO>","disclaimerVersion":"1.0"}

    Preferences (EXTEND.md)

    Check EXTEND.md in priority order — the first one found wins:

    Priority Path Scope
    1 .baoyu-skills/baoyu-danger-gemini-web/EXTEND.md Project
    2 ${XDG_CONFIG_HOME:-$HOME/.config}/baoyu-skills/baoyu-danger-gemini-web/EXTEND.md XDG
    3 $HOME/.baoyu-skills/baoyu-danger-gemini-web/EXTEND.md User home

    If none found, use defaults.

    EXTEND.md supports: Default model, proxy settings, custom data directory.

    Usage

    # Text generation
    ${BUN_X} {baseDir}/scripts/main.ts "Your prompt"
    ${BUN_X} {baseDir}/scripts/main.ts --prompt "Your prompt" --model gemini-3-flash
    
    # Image generation
    ${BUN_X} {baseDir}/scripts/main.ts --prompt "A cute cat" --image cat.png
    ${BUN_X} {baseDir}/scripts/main.ts --promptfiles system.md content.md --image out.png
    
    # Vision input (reference images)
    ${BUN_X} {baseDir}/scripts/main.ts --prompt "Describe this" --reference image.png
    ${BUN_X} {baseDir}/scripts/main.ts --prompt "Create variation" --reference a.png --image out.png
    
    # Multi-turn conversation
    ${BUN_X} {baseDir}/scripts/main.ts "Remember: 42" --sessionId session-abc
    ${BUN_X} {baseDir}/scripts/main.ts "What number?" --sessionId session-abc
    
    # JSON output
    ${BUN_X} {baseDir}/scripts/main.ts "Hello" --json
    

    Options

    Option Description
    --prompt, -p Prompt text
    --promptfiles Read prompt from files (concatenated)
    --model, -m Model: gemini-3-pro (default), gemini-3-flash, gemini-3-flash-thinking, gemini-3.1-pro-preview
    --image [path] Generate image (default: generated.png)
    --reference, --ref Reference images for vision input
    --sessionId Session ID for multi-turn conversation
    --list-sessions List saved sessions
    --json Output as JSON
    --login Refresh cookies, then exit
    --cookie-path Custom cookie file path
    --profile-dir Chrome profile directory

    Models

    Model Description
    gemini-3-pro Default, latest 3.0 Pro
    gemini-3-flash Fast, lightweight 3.0 Flash
    gemini-3-flash-thinking 3.0 Flash with thinking
    gemini-3.1-pro-preview 3.1 Pro preview (empty header, auto-routed)

    Authentication

    First run opens browser for Google auth. Cookies cached automatically.

    When no explicit profile dir is set, cookie refresh may reuse an already-running local Chrome/Chromium debugging session tied to a standard user-data dir. Set --profile-dir or GEMINI_WEB_CHROME_PROFILE_DIR to force a dedicated profile and skip existing-session reuse. This is a best-effort CDP session reuse path, not the Chrome DevTools MCP prompt-based --autoConnect flow described in Chrome's official docs.

    Supported browsers (auto-detected): Chrome, Chrome Canary/Beta, Chromium, Edge.

    Force refresh: --login flag. Override browser: GEMINI_WEB_CHROME_PATH env var.

    Environment Variables

    Variable Description
    GEMINI_WEB_DATA_DIR Data directory
    GEMINI_WEB_COOKIE_PATH Cookie file path
    GEMINI_WEB_CHROME_PROFILE_DIR Chrome profile directory
    GEMINI_WEB_CHROME_PATH Chrome executable path
    HTTP_PROXY, HTTPS_PROXY Proxy for Google access (set inline with command)

    Sessions

    Session files stored in data directory under sessions/<id>.json.

    Contains: id, metadata (Gemini chat state), messages array, timestamps.

    Extension Support

    Custom configurations via EXTEND.md. See Preferences section for paths and supported options.

    Reproducido de JimLiu/baoyu-skills bajo licencia MIT. Leer esta página en markdown.

    Archivos

    28 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere bun o npx, un navegador Chrome/Chromium/Edge para autenticación, y aceptar un aviso de consentimiento antes del primer uso.

    Variables de entorno:BAOYU_CHROME_PROFILE_DIRBUN_XGEMINI_WEB_CHROME_PROFILE_DIRGEMINI_WEB_COOKIE_PATHGEMINI_WEB_DATA_DIRGEMINI_WEB_FORCE_LOGINGEMINI_WEB_LOGINJSONWSL_DISTRO_NAME

    Detalles

    Creador
    JimLiu
    Licencia
    MIT
    Recursos incluidos
    scripts en typescript
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de JimLiu/baoyu-skills

    Este repo incluye 22 skills. Si instalas uno, normalmente ya tienes los demás.

    Generación de imágenes con IA usando OpenAI GPT Image 2, Azure OpenAI, Google, OpenRouter, DashScope, Z.AI GLM-Image, MiniMax, Jimeng, Seedream, Replicate y Agnes; soporta texto a imagen, referencias, aspectos y lotes.

    Costo de contexto al activarse
    5.2k tok
    Tamaño del paquete
    49 archivos
    Última actualización
    el mes pasado
    diseno ui

    Publica contenido en WeChat Official Account (微信公众号) vía API o Chrome CDP, con posts de artículo (文章) o de imagen-texto (贴图/图文).

    Costo de contexto al activarse
    3.7k tok
    Tamaño del paquete
    29 archivos
    Última actualización
    hace 2 meses
    redaccion contenido

    Convierte los chats de un grupo de WeChat en un resumen estructurado usando el binario local wx-cli, con historial, perfiles de usuario y memoria de hechos por grupo entre ejecuciones.

    Costo de contexto al activarse
    8.3k tok
    Tamaño del paquete
    6 archivos
    Última actualización
    el mes pasado
    productividad

    Publica contenido y artículos en X (Twitter): posts normales con imágenes/vídeos y X Articles en Markdown, vía plugin Chrome de Codex, Computer Use o scripts CDP.

    Costo de contexto al activarse
    4.4k tok
    Tamaño del paquete
    16 archivos
    Última actualización
    el mes pasado
    marketing

    Genera portadas de artículos con 5 dimensiones (tipo, paleta, renderizado, texto, mood), combinando 11 paletas y 7 estilos de renderizado, en formatos cinematic, widescreen o square.

    Costo de contexto al activarse
    4.5k tok
    Tamaño del paquete
    35 archivos
    Última actualización
    hace 2 meses
    diseno ui

    Analiza la estructura del artículo, identifica dónde faltan apoyos visuales y genera ilustraciones combinando Tipo × Estilo × Paleta. Úsalo para "ilustrar artículo", "añadir imágenes" o "为文章配图".

    Costo de contexto al activarse
    4.3k tok
    Tamaño del paquete
    37 archivos
    Última actualización
    hace 2 meses
    redaccion contenido

    Skills relacionados

    Extrae recursos y JavaScript de cualquier app Electron instalada (app.asar), restaurando las fuentes originales desde .js.map o formateando el código minificado con Prettier.

    Costo de contexto al activarse
    2.6k tok
    Tamaño del paquete
    3 archivos
    Última actualización
    hace 2 meses
    herramientas desarrollo

    Analiza la estructura del artículo, identifica dónde faltan apoyos visuales y genera ilustraciones combinando Tipo × Estilo × Paleta. Úsalo para "ilustrar artículo", "añadir imágenes" o "为文章配图".

    Costo de contexto al activarse
    4.3k tok
    Tamaño del paquete
    37 archivos
    Última actualización
    hace 2 meses
    redaccion contenido

    Da formato a textos planos o markdown: añade frontmatter, títulos, resúmenes, encabezados, negritas, listas y bloques de código, guardando el resultado en {filename}-formatted.md.

    Costo de contexto al activarse
    3.5k tok
    Tamaño del paquete
    8 archivos
    Última actualización
    hace 4 meses
    redaccion contenido