# Cost Trend > Lee cada docs/benchmarks/runs/*.json y muestra la deriva en win rate, latencia, tasa de escalada y costo del baseline LLM a lo largo del tiempo. Fuente: https://skillsagentes.com/skills/ruvnet/ruflo/cost-trend Markdown: https://skillsagentes.com/skills/ruvnet/ruflo/cost-trend.md Repositorio: https://github.com/ruvnet/ruflo Autor: ruvnet Licencia: MIT Actualizado: hace 3 meses Coste de contexto: 32 tok instalada, 499 tok al activarse, 499 tok con todos los archivos del bundle Bundle: 1 archivo, 2 KB Permisos que pide: bash ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add ruvnet/ruflo --skill cost-trend --agent claude-code # Cursor npx -y skills add ruvnet/ruflo --skill cost-trend --agent cursor # Codex npx -y skills add ruvnet/ruflo --skill cost-trend --agent codex # Gemini CLI npx -y skills add ruvnet/ruflo --skill cost-trend --agent gemini # Windsurf npx -y skills add ruvnet/ruflo --skill cost-trend --agent windsurf # Cline npx -y skills add ruvnet/ruflo --skill cost-trend --agent cline ``` ## Qué hace - Lee todos los benchmarks guardados en `docs/benchmarks/runs/*.json` y muestra la deriva en win rate, latencia, tasa de escalada y costo del baseline LLM. - Reporta el delta entre la primera y la última corrida más una serie por corrida. - Marca regresiones cuando el win rate bajó o la latencia media subió 1.5× o más. ## Cuándo usarla - Antes de un release, para comprobar que el speedup no se haya degradado. - Después de ampliar el corpus de pruebas, para verificar que las corridas antiguas mantienen su win rate. - Tras actualizar `agent-booster`, para ver cambios de latencia o estrategia. ## Qué la activa - "¿El win rate del booster se ha degradado con el tiempo?" - "Muéstrame la deriva de latencia entre benchmarks" ## Antes de instalar - Requiere que `cost-benchmark` haya generado corridas previas en `docs/benchmarks/runs/`. - runs shell commands ## Archivos - SKILL.md — 2 KB ## SKILL.md Reproducido tal cual desde ruvnet/ruflo bajo MIT. Esta sección es el documento original y está en inglés. # Cost Trend The smoke gate is binary (`winRate ≥ 0.80` → pass/fail). The corpus benchmarks captured over time form a curve — and curves catch regressions the gate misses (win rate slowly creeping from 100% to 85% is "still passing" by smoke but a real degradation). This skill reads every persisted run in `docs/benchmarks/runs/*.json` and reports first→last deltas plus a per-run series, flagging regressions in win rate or latency. ## When to use - Before a release — check that the speedup hasn't drifted. - After expanding the corpus — verify older runs still hit the same win rate on the new corpus *they* reflected. - After upgrading `agent-booster` — surface latency / strategy changes. ## Steps 1. **Run the trend script** from the project root: ```bash node plugins/ruflo-cost-tracker/scripts/trend.mjs ``` Optional env: - `TREND_FORMAT=json` — emit JSON instead of markdown - `TREND_LIMIT=10` — consider only the most recent N runs 2. **Inspect the drift summary** — first vs last on win rate, avg latency, p99, escalation rate, speedup vs Gemini. 3. **Inspect the per-run series** — one row per run, including Sonnet 4.6 + Opus 4.7 baseline latencies if those were enabled (`BENCH_ANTHROPIC=1` at run time). 4. **Regression flags** — the script emits `> ⚠ Regression` callouts when: - Win rate dropped between first and last run - Avg latency rose ≥ 1.5× from first run ## Cross-references - `cost-benchmark` — the producer of the run JSONs this skill consumes - `bench/booster-corpus.json` — the corpus version is recorded in each run, so trends across corpus versions remain interpretable - `docs/benchmarks/runs/latest.json` — the most-recent run; smoke step 23 gates on `winRate ≥ 0.80` from this file ## Dónde encaja - Categoría: [Testing y QA](https://skillsagentes.com/categorias/testing-qa.md) — Flujos de testing unitario, de integración y end-to-end. - Creador: [ruvnet](https://skillsagentes.com/creators/ruvnet.md) — 275 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Harness Gepa](https://skillsagentes.com/skills/ruvnet/ruflo/harness-gepa.md): Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución. - [Deepseek Reason](https://skillsagentes.com/skills/ruvnet/ruflo/deepseek-reason.md): Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde. - [Deepseek Chat](https://skillsagentes.com/skills/ruvnet/ruflo/deepseek-chat.md): Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento. - [Adr Index](https://skillsagentes.com/skills/ruvnet/ruflo/adr-index.md): Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP. - [Agntcy Status](https://skillsagentes.com/skills/ruvnet/ruflo/agntcy-status.md): Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)