Skills Agentes

Vercel Plugin Eval

Ejecuta sesiones de eval en vivo contra vercel-plugin para verificar el comportamiento de hooks, la inyección de skills, la corrección del dedup y la cobertura, generando un informe estructurado.

Oficial
Estrellas
287

en todo el repo

Actividad
33

0–100, la ruta de este skill

Actualizado
hace 6 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
1.2k tok

59 tok en reposo

Paquete
1 archivo

5 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add vercel/vercel-plugin --skill vercel-plugin-eval --agent claude-code

Se instala solo en este repositorio.

Este skill makes network requests, reads environment config.

Qué hace

  • Lanza sesiones reales de Claude Code con vercel-plugin instalado vía WezTerm
  • Monitorea logs de debug en tiempo real para verificar que los 8 hooks se disparen
  • Verifica la corrección del dedup comparando inyecciones vs claim files
  • Genera un informe de cobertura estructurado en .notes/COVERAGE.md

Úsalo cuando

  • Necesitas verificar el comportamiento de hooks, inyección de skills, dedup y cobertura en vercel-plugin

No lo uses cuando

  • No uses claude --print o -p, porque los hooks no se disparan
  • No uses --dangerously-skip-permissions ni escribas scripts de eval

Qué lo activa

Di cualquiera de estas frases y el agente debería cargar este skill.

  • “Ejecuta un eval en vivo del vercel-plugin para verificar los hooks y el dedup”
  • “Lanza una sesión de prueba con WezTerm para comprobar la inyección de skills del plugin”
  • “Genera el informe de cobertura de hooks para vercel-plugin”

SKILL.md

En inglés

Plugin Eval

Launch real Claude Code sessions with the plugin installed, monitor debug logs in real-time, and verify every hook fires correctly with proper dedup.

DO NOT (Hard Rules)

  • DO NOT use claude --print or -p — hooks don't fire, no files created
  • DO NOT use --dangerously-skip-permissions
  • DO NOT create projects in /tmp/ — always use ~/dev/vercel-plugin-testing/
  • DO NOT manually wire hooks or create settings.local.json — use npx add-plugin
  • DO NOT set CLAUDE_PLUGIN_ROOT manually
  • DO NOT use bash -c in WezTerm — use /bin/zsh -ic
  • DO NOT use full path to claude — use the x alias
  • DO NOT write eval scripts — do everything as Bash tool calls in the conversation

Copy the exact commands below. Do not improvise.

Quick Start

Always append a timestamp to directory names so reruns don't overwrite old projects:

# 1. Create test dir & install plugin (with timestamp)
TS=$(date +%Y%m%d-%H%M)
SLUG="my-eval-$TS"
mkdir -p ~/dev/vercel-plugin-testing/$SLUG
cd ~/dev/vercel-plugin-testing/$SLUG
npx add-plugin https://github.com/vercel/vercel-plugin -s project -y

# 2. Launch session via WezTerm
wezterm cli spawn --cwd /Users/johnlindquist/dev/vercel-plugin-testing/$SLUG -- /bin/zsh -ic \
  "unset CLAUDECODE; VERCEL_PLUGIN_LOG_LEVEL=debug x '<PROMPT>' --settings .claude/settings.json; exec zsh"

# 3. Find debug log (wait ~25s for session start)
find ~/.claude/debug -name "*.txt" -mmin -2 -exec grep -l "$SLUG" {} +

What to Monitor

Hook firing (all 8 registered hooks)

LOG=~/.claude/debug/<session-id>.txt

# SessionStart (3 hooks)
grep "SessionStart.*success" "$LOG"

# PreToolUse skill injection
grep -c "executePreToolHooks" "$LOG"        # total calls
grep -c "provided additionalContext" "$LOG"  # injections

# UserPromptSubmit
grep "UserPromptSubmit.*success" "$LOG"

# PostToolUse validate + shadcn font-fix
grep "posttooluse-validate.*provided" "$LOG"
grep "PostToolUse:Bash.*success" "$LOG"

# SessionEnd cleanup
grep "SessionEnd" "$LOG"

Dedup correctness (the key metric)

TMPDIR=$(node -e "import {tmpdir} from 'os'; console.log(tmpdir())" --input-type=module)
CLAIMDIR="$TMPDIR/vercel-plugin-<session-id>-seen-skills.d"

# Claim files = one per skill, atomic O_EXCL
ls "$CLAIMDIR"

# Compare: injections should equal claims
inject_meta=$(grep -c "skillInjection:" "$LOG")
claims=$(ls "$CLAIMDIR" 2>/dev/null | wc -l | tr -d ' ')
echo "Injections: $((inject_meta / 3)) | Claims: $claims"

skillInjection: appears 3x per actual injection in the debug log (initial check, parsed, success). Divide by 3.

PostToolUse validate quality

Look for real catches — API key bypass, outdated models, wrong patterns:

grep "VALIDATION" "$LOG" | head -10

Scenario Design

Describe products and features, never name specific technologies. Let the plugin infer which skills to inject. Always end prompts with: "Link the project to my vercel-labs team so we can deploy it later. Skip any planning and just build it. Get the dev server running."

Coverage targets by scenario type

Scenario Type Skills Exercised
AI chat app ai-sdk, ai-gateway, nextjs, ai-elements
Durable workflow workflow, ai-sdk, vercel-queues
Monorepo turborepo, turbopack, nextjs
Edge auth + routing routing-middleware, auth, sign-in-with-vercel
Chat bot (multi-platform) chat-sdk, ai-sdk, vercel-storage
Feature flags + CRM vercel-flags, vercel-queues, ai-sdk
Email pipeline email, satori, ai-sdk, vercel-storage
Marketplace/payments payments, marketplace, cms
Kitchen sink micro, ncc, all niche skills

Hard-to-trigger skills (8 of 44)

These need explicit technology references in the prompt because agents don't naturally reach for them:

  • ai-elements — say "use the AI Elements component registry"
  • v0-dev — say "generate components with v0"
  • vercel-firewall — say "use Vercel Firewall for rate limiting"
  • marketplace — say "publish to the Vercel Marketplace"
  • geist — say "install the geist font package"
  • json-render — name files components/chat-*.tsx

Coverage Report

Write results to .notes/COVERAGE.md with:

  1. Session index — slug, session ID, unique skills, dedup status
  2. Hook coverage matrix — which hooks fired in which sessions
  3. Skill injection table — which of the 44 skills triggered
  4. Dedup stats — injections vs claims per session
  5. Issues found — bugs, pattern gaps, validation findings

Cleanup

rm -rf ~/dev/vercel-plugin-testing

Reproducido de vercel/vercel-plugin bajo licencia NOASSERTION. Leer esta página en markdown.

Archivos

1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

Antes de instalar

Requiere WezTerm, el comando npx add-plugin y un directorio de trabajo en ~/dev/vercel-plugin-testing/.

Necesita en el PATH:nodenpx

Variables de entorno:CLAIMDIRSLUG

Detalles

Creador
vercel
Categoría
Testing y QA
Licencia
NOASSERTION
Recursos incluidos
Solo SKILL.md
Código fuente
Ver SKILL.md

Etiquetas

Más de vercel/vercel-plugin

Este repo incluye 43 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack vercel-plugin entero y su comando de instalación

Corrige el conocimiento desactualizado del LLM sobre la plataforma Vercel e introduce sus productos nuevos. Se inyecta al inicio de la sesión.

Costo de contexto al activarse
1.8k tok
Tamaño del paquete
1 archivo
Última actualización
el mes pasado
Oficialdevops infraestructura

Guía experta de Vercel Connect: obtén tokens OAuth con permisos limitados para servicios de terceros (Slack, GitHub, servidores MCP, OAuth, Snowflake) en nombre de apps o usuarios vía Vercel OIDC.

Costo de contexto al activarse
4.8k tok
Tamaño del paquete
1 archivo
Última actualización
el mes pasado
Oficialdesarrollo apis

Depura el caching de la CDN de Vercel: tasa de aciertos, contenido obsoleto, revalidación, ISR + PPR, cacheReason, ppr_state y costos.

Costo de contexto al activarse
5.2k tok
Tamaño del paquete
1 archivo
Última actualización
hace 2 meses
Oficialdevops infraestructura

Guía experta sobre Vercel Functions: Serverless Functions, Edge Functions, Fluid Compute, streaming, Cron Jobs y configuración de runtime para código server-side en Vercel.

Costo de contexto al activarse
5.6k tok
Tamaño del paquete
1 archivo
Última actualización
el mes pasado
Oficialdevops infraestructura

Guía de arquitectura backend: úsala para planear, construir o migrar una API o backend, elegir entre Functions, Services, contenedores, Workflow, Queues y bases de datos de Marketplace, o seleccionar framework y runtime.

Costo de contexto al activarse
1.5k tok
Tamaño del paquete
2 archivos
Última actualización
el mes pasado
Oficialdesarrollo apis

Eve

287

Guía de eve, el framework para agentes de IA duraderos: runtime basado en filesystem, sesiones, tools, skills, canales, sandboxes, subagentes, schedules, evals y observabilidad con Agent Runs.

Costo de contexto al activarse
1.5k tok
Tamaño del paquete
3 archivos
Última actualización
el mes pasado
Oficialherramientas desarrollo

Skills relacionados

Escenarios avanzados de benchmark para agentes de IA que ponen a prueba Workflow SDK, AI Gateway, MCP, Chat SDK, Queues, Flags, Sandbox y orquestación multi-agente de Vercel.

Costo de contexto al activarse
3.6k tok
Tamaño del paquete
2 archivos
Última actualización
el mes pasado
Oficialtesting qa

Suite de benchmark end-to-end para vercel-plugin: ejecuta proyectos reales con inyección de skills, verifica servidores dev, analiza logs y genera un reporte de mejora.

Costo de contexto al activarse
1.3k tok
Tamaño del paquete
1 archivo
Última actualización
hace 7 meses
Oficialtesting qa

Corre escenarios de eval de vercel-plugin en Vercel Sandboxes en vez de paneles locales de WezTerm: aprovisiona microVMs con Claude Code, ejecuta prompts y genera reportes de cobertura.

Costo de contexto al activarse
5.5k tok
Tamaño del paquete
9 archivos
Última actualización
hace 6 meses
Oficialtesting qa