Skills Agentes

Gaia Submission

Recorre el flujo completo de benchmark→envío de GAIA, desde la resolución de claves hasta generar un paquete compatible con HAL.

Solicitabash mcp__plugin_ruflo-core_ruflo__memory_store mcp__plugin_ruflo-core_ruflo__memory_search mcp__plugin_ruflo-core_ruflo__memory_list mcp__plugin_ruflo-core_ruflo__hooks_post_task mcp__plugin_ruflo-core_ruflo__hooks_pre_task
Estrellas
69.4k

en todo el repo

Actividad
55

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
2

últimos 90 días

Contexto
1.3k tok

30 tok en reposo

Paquete
1 archivo

5 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add ruvnet/ruflo --skill gaia-submission --agent claude-code

Se instala solo en este repositorio.

Este skill reads environment config.

Qué hace

  • Valida el entorno (claves API, Node, CLI) antes de ejecutar el benchmark
  • Estima el costo de la corrida y pide confirmación si supera $5
  • Ejecuta el benchmark y empaqueta los resultados en un paquete firmado (Ed25519) compatible con HAL, tras una auditoría de integridad
  • Compara el resultado contra el leaderboard y persiste los aprendizajes

Úsalo cuando

  • Quieres ejecutar un benchmark y enviar resultados al leaderboard de HAL
  • Quieres empaquetar un archivo de resultados existente en un paquete de envío
  • Necesitas confirmar que tu entorno está listo para una corrida de benchmark

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Prepara y envía una corrida de GAIA al leaderboard de HAL
    • Empaqueta estos resultados de GAIA para enviarlos

    SKILL.md

    En inglés

    GAIA Submission Skill

    Walk Claude Code through every step needed to go from a clean environment to a signed, HAL-compatible submission package ready to upload to the Princeton GAIA leaderboard.

    When to use

    When the user wants to:

    • Run a benchmark and submit results to the HAL leaderboard
    • Package an existing results file into a submission archive
    • Confirm their environment is ready for a benchmark run

    Prerequisites

    Before starting, confirm these are available:

    Requirement Check
    ANTHROPIC_API_KEY echo ${ANTHROPIC_API_KEY:0:8}… (should show sk-ant-…)
    HF_TOKEN echo ${HF_TOKEN:0:5}… (should show hf_…)
    Node.js 20+ node --version
    CLI built node v3/@claude-flow/cli/bin/cli.js --version

    Phase 1 — Validate environment

    # Run all pre-flight checks
    /gaia validate
    

    If any check fails, resolve it before continuing.

    Phase 2 — Estimate cost and confirm

    Ask the user for their configuration:

    • Level (default: 1)
    • Question limit (default: 53 for a quick run, 165 for the full L1 set)
    • Models (default: claude-sonnet-4-6)
    • Self-consistency voting (default: 1; use 3 for L2/L3)
    /gaia cost --level=$LEVEL --limit=$LIMIT --models=$MODELS --voting=$VOTING
    

    If projected cost > $5, show the estimate and ask: "This run will cost approximately $X. Proceed? (y/N)"

    Phase 3 — Run the benchmark

    /gaia run --level=$LEVEL --limit=$LIMIT --models=$MODELS --voting=$VOTING
    

    While running, progress is reported every 5 questions:

    [12/53] 22.7% (5 passed of 22 scored) — est. remaining: $0.18
    

    Store the run summary in memory for history tracking:

    npx @claude-flow/cli@latest memory store \
      --namespace gaia-runs \
      --key "run-$(date +%Y%m%d-%H%M)" \
      --value '{"level":$LEVEL,"model":"$MODEL","total":$TOTAL,"passed":$PASSED,"pass_rate":$RATE,"est_cost_usd":$COST}'
    

    Phase 4 — Package for submission

    /gaia submit --results=~/.cache/ruflo/gaia/results-latest.json
    

    This produces:

    submission-<date>-<sha>/
    ├── results.jsonl        ← HAL-compatible, one JSON per line
    ├── trajectories.jsonl   ← full agent traces
    ├── metadata.json        ← harness info, model, tool catalogue
    ├── audit-report.json    ← ADR-167 pre-submission exploit-audit report
    ├── manifest.md.json     ← Ed25519-signed witness (signs audit-report.json's hash)
    └── README.md            ← human summary + leaderboard comparison
    

    Integrity gate — the audit runs before signing (ADR-167)

    Post-RDI (UC Berkeley broke 8 agent benchmarks — GAIA to ~98% — without solving a task), a signature alone is not enough: it proves the bytes are untampered, not that the score was earned. /gaia submit therefore runs a deterministic, $0 exploit audit before signing and refuses to build the leaderboard package on a CRITICAL failure unless --allow-dirty is passed. The audit report is signed into the witness manifest as an ADR-103 fix marker, so a ruflo GAIA submission attests both transport-integrity and earning-integrity.

    If the gate blocks, treat it as a real finding — inspect audit-report.json (answer-leakage, no-work pass, oracle leakage, grader monkey-patching, an answer-key read outside the dataset dir, or dynamic eval/exec of task content in the runner) rather than reaching for --allow-dirty. The static source-scan family (answer-key-reads, dynamic-eval, judge-injection) enforces today with no trajectory instrumentation; the trajectory-fed checks the current schema cannot feed are reported as harness_gaps (ADR-167 §7), not passes.

    Phase 5 — Compare and report

    /gaia leaderboard --level=$LEVEL
    /gaia history
    

    Interpret the gap between ruflo's score and the leaderboard top-10. Identify the primary failure mode (tool gap, reasoning miss, extraction bug) using the /gaia-debugging skill if needed.

    Phase 6 — Persist learnings

    npx @claude-flow/cli@latest hooks post-task \
      --task-id "gaia-submission-$(date +%Y%m%d)" \
      --success true \
      --train-neural true
    

    Store any discovered patterns:

    npx @claude-flow/cli@latest memory store \
      --namespace gaia-patterns \
      --key "submission-notes-$(date +%Y%m%d)" \
      --value "Level $LEVEL, $MODEL: $NOTES"
    

    Extensibility note

    This skill is intentionally structured to be benchmark-agnostic. The phase headers (validate → estimate → run → package → compare → learn) apply to SWE-bench, WebArena, and HumanEval with only phase 3-4 details changing.

    Reproducido de ruvnet/ruflo bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere ANTHROPIC_API_KEY, HF_TOKEN y Node.js 20+.

    Necesita en el PATH:npx

    Variables de entorno:COSTLEVELLIMITMODELMODELSNOTESPASSEDRATETOTALVOTING

    Detalles

    Creador
    ruvnet
    Categoría
    Testing y QA
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    ruvnet/ruflo
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de ruvnet/ruflo

    Este repo incluye 275 skills. Si instalas uno, normalmente ya tienes los demás.

    Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución.

    Costo de contexto al activarse
    833 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    herramientas desarrollo

    Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento.

    Costo de contexto al activarse
    566 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde.

    Costo de contexto al activarse
    627 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado.

    Costo de contexto al activarse
    443 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 26 días
    devops infraestructura

    Skills relacionados

    Agente de benchmarking de rendimiento exhaustivo: detección de regresiones y validación de rendimiento mediante pruebas automatizadas de carga, estrés y escalabilidad.

    Costo de contexto al activarse
    4.9k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Agente avanzado de análisis de calidad de código para revisiones y mejoras exhaustivas del código.

    Costo de contexto al activarse
    1.5k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Despliega agentes de IA especializados para realizar revisiones de código exhaustivas e inteligentes que van más allá del análisis estático tradicional.

    Costo de contexto al activarse
    3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa