Skills Agentes

Cost Trend

Lee cada docs/benchmarks/runs/*.json y muestra la deriva en win rate, latencia, tasa de escalada y costo del baseline LLM a lo largo del tiempo.

Solicitabash
Estrellas
69.4k

en todo el repo

Actividad
41

0–100, la ruta de este skill

Actualizado
hace 3 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
499 tok

32 tok en reposo

Paquete
1 archivo

2 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add ruvnet/ruflo --skill cost-trend --agent claude-code

Se instala solo en este repositorio.

Este skill runs shell commands.

Qué hace

  • Lee todos los benchmarks guardados en `docs/benchmarks/runs/*.json` y muestra la deriva en win rate, latencia, tasa de escalada y costo del baseline LLM.
  • Reporta el delta entre la primera y la última corrida más una serie por corrida.
  • Marca regresiones cuando el win rate bajó o la latencia media subió 1.5× o más.

Úsalo cuando

  • Antes de un release, para comprobar que el speedup no se haya degradado.
  • Después de ampliar el corpus de pruebas, para verificar que las corridas antiguas mantienen su win rate.
  • Tras actualizar `agent-booster`, para ver cambios de latencia o estrategia.

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • ¿El win rate del booster se ha degradado con el tiempo?
    • Muéstrame la deriva de latencia entre benchmarks

    SKILL.md

    En inglés

    Cost Trend

    The smoke gate is binary (winRate ≥ 0.80 → pass/fail). The corpus benchmarks captured over time form a curve — and curves catch regressions the gate misses (win rate slowly creeping from 100% to 85% is "still passing" by smoke but a real degradation).

    This skill reads every persisted run in docs/benchmarks/runs/*.json and reports first→last deltas plus a per-run series, flagging regressions in win rate or latency.

    When to use

    • Before a release — check that the speedup hasn't drifted.
    • After expanding the corpus — verify older runs still hit the same win rate on the new corpus they reflected.
    • After upgrading agent-booster — surface latency / strategy changes.

    Steps

    1. Run the trend script from the project root:

      node plugins/ruflo-cost-tracker/scripts/trend.mjs
      

      Optional env:

      • TREND_FORMAT=json — emit JSON instead of markdown
      • TREND_LIMIT=10 — consider only the most recent N runs
    2. Inspect the drift summary — first vs last on win rate, avg latency, p99, escalation rate, speedup vs Gemini.

    3. Inspect the per-run series — one row per run, including Sonnet 4.6 + Opus 4.7 baseline latencies if those were enabled (BENCH_ANTHROPIC=1 at run time).

    4. Regression flags — the script emits > ⚠ Regression callouts when:

      • Win rate dropped between first and last run
      • Avg latency rose ≥ 1.5× from first run

    Cross-references

    • cost-benchmark — the producer of the run JSONs this skill consumes
    • bench/booster-corpus.json — the corpus version is recorded in each run, so trends across corpus versions remain interpretable
    • docs/benchmarks/runs/latest.json — the most-recent run; smoke step 23 gates on winRate ≥ 0.80 from this file

    Reproducido de ruvnet/ruflo bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere que `cost-benchmark` haya generado corridas previas en `docs/benchmarks/runs/`.

    Detalles

    Creador
    ruvnet
    Categoría
    Testing y QA
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    ruvnet/ruflo
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de ruvnet/ruflo

    Este repo incluye 275 skills. Si instalas uno, normalmente ya tienes los demás.

    Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución.

    Costo de contexto al activarse
    833 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    herramientas desarrollo

    Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento.

    Costo de contexto al activarse
    566 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde.

    Costo de contexto al activarse
    627 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado.

    Costo de contexto al activarse
    443 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 26 días
    devops infraestructura

    Skills relacionados

    Agente de benchmarking de rendimiento exhaustivo: detección de regresiones y validación de rendimiento mediante pruebas automatizadas de carga, estrés y escalabilidad.

    Costo de contexto al activarse
    4.9k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Agente avanzado de análisis de calidad de código para revisiones y mejoras exhaustivas del código.

    Costo de contexto al activarse
    1.5k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Despliega agentes de IA especializados para realizar revisiones de código exhaustivas e inteligentes que van más allá del análisis estático tradicional.

    Costo de contexto al activarse
    3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa