Skills Agentes

Cost Benchmark

Corre el benchmark del corpus — booster local, con baselines opcionales de Gemini/Sonnet/Opus — y guarda una tabla verificable de medido vs. reclamado.

Solicitabash
Estrellas
69.4k

en todo el repo

Actividad
41

0–100, la ruta de este skill

Actualizado
hace 3 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
752 tok

35 tok en reposo

Paquete
1 archivo

3 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add ruvnet/ruflo --skill cost-benchmark --agent claude-code

Se instala solo en este repositorio.

Este skill runs shell commands.

Qué hace

  • Corre el benchmark del corpus estructural+adversarial contra `agent-booster` local, con baselines opcionales de Gemini/Sonnet/Opus.
  • Guarda resultados por caso y un resumen en `docs/benchmarks/runs/`, incluyendo el `winRate` de la Tier 1.
  • Es el gate de verificación que respalda cada afirmación medible de `cost-booster-edit` y `cost-booster-route`.

Úsalo cuando

  • Antes de publicar un release, para verificar que el win rate del booster no haya bajado.
  • Después de ampliar el corpus de casos, para confirmar que las nuevas pruebas enrutan correctamente.
  • Al auditar una etiqueta 'claimed upstream' para pasarla a 'verified' una vez respaldada por el benchmark.

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Corre el benchmark de costos antes de publicar el release
    • Verifica si el win rate del booster bajó
    • Compara el costo de Sonnet 4.6 contra Opus 4.7 en estas tareas

    SKILL.md

    En inglés

    Cost Benchmark

    Runs scripts/bench.mjs against the structural+adversarial corpus and writes per-case + summary results to docs/benchmarks/runs/. This is the verification gate that backs every measurable claim in cost-booster-edit / cost-booster-route.

    When to use

    • Before publishing a release — verify booster win rate didn't regress.
    • After expanding bench/booster-corpus.json — confirm new cases route correctly.
    • When auditing a "claimed upstream" tag — flip it to "verified" once the bench supports it.
    • On a cost question ("is Sonnet 4.6 cheaper than Opus 4.7 for these tasks?") — re-run with BENCH_ANTHROPIC=1.

    Steps

    1. Run the bench from v3/ (where agent-booster resolves):

      ( cd v3 && node ../plugins/ruflo-cost-tracker/scripts/bench.mjs )                  # booster only — free, ~85 ms
      ( cd v3 && BENCH_LLM_BASELINE=1 node ../plugins/ruflo-cost-tracker/scripts/bench.mjs ) # + Gemini 2.0 Flash (cheap)
      ( cd v3 && BENCH_LLM_BASELINE=1 BENCH_ANTHROPIC=1 \
           node ../plugins/ruflo-cost-tracker/scripts/bench.mjs )                          # + Sonnet 4.6 + Opus 4.7
      
    2. Inspect the markdown summary printed to stdout. The gate metric is winRate (Tier 1 cases). Adversarial cases are tracked separately as escalationRate.

    3. Persisted output lands at:

      • docs/benchmarks/runs/latest.json — pointer to the most recent run
      • docs/benchmarks/runs/<ISO-timestamp>.json — historical record
    4. Read it back in subsequent skills (e.g. cost-report step 2 reads latest.json for live tier-spend numbers).

    Smoke gates

    • winRate ≥ 0.80 on Tier 1 cases (smoke step 23). Lower the threshold by editing scripts/smoke.sh.
    • escalationRate is reported but ungated — adversarial cases are diagnostic.

    Env overrides

    Env var Default Purpose
    BENCH_LLM_BASELINE unset =1 runs the OpenAI-compat baseline
    BENCH_LLM_MODEL models/gemini-2.0-flash Override the OpenAI-compat model
    BENCH_LLM_BASE_URL Gemini OpenAI shim Override endpoint
    BENCH_ANTHROPIC unset =1 runs Anthropic baseline (Sonnet 4.6 + Opus 4.7)
    BENCH_ANTHROPIC_MODELS claude-sonnet-4-6,claude-opus-4-7 Comma-separated Claude IDs
    BENCH_OUT timestamped file Override output path
    BENCH_QUIET=1 unset Suppress markdown summary

    API keys auto-pulled from gcloud secrets (GOOGLE_AI_API_KEY, ANTHROPIC_API_KEY); override with BENCH_LLM_API_KEY / BENCH_ANTHROPIC_API_KEY.

    Cross-references

    ADR-0002 §"Decision 1" / §"Riskiest assumption" · cost-booster-edit/SKILL.md (verification table consumes this skill's output) · cost-report/SKILL.md step 2 (reads runs/latest.json).

    Reproducido de ruvnet/ruflo bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere ejecutarse desde `v3/` para que `agent-booster` resuelva; las claves API se toman de `gcloud secrets` o variables de entorno.

    Necesita en el PATH:node

    Detalles

    Creador
    ruvnet
    Categoría
    Testing y QA
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    ruvnet/ruflo
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de ruvnet/ruflo

    Este repo incluye 275 skills. Si instalas uno, normalmente ya tienes los demás.

    Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución.

    Costo de contexto al activarse
    833 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    herramientas desarrollo

    Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento.

    Costo de contexto al activarse
    566 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde.

    Costo de contexto al activarse
    627 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado.

    Costo de contexto al activarse
    443 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 26 días
    devops infraestructura

    Skills relacionados

    Agente de benchmarking de rendimiento exhaustivo: detección de regresiones y validación de rendimiento mediante pruebas automatizadas de carga, estrés y escalabilidad.

    Costo de contexto al activarse
    4.9k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Agente avanzado de análisis de calidad de código para revisiones y mejoras exhaustivas del código.

    Costo de contexto al activarse
    1.5k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Despliega agentes de IA especializados para realizar revisiones de código exhaustivas e inteligentes que van más allá del análisis estático tradicional.

    Costo de contexto al activarse
    3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa