Skills Agentes

Cost Counterfactual

Análisis contrafactual de costo con múltiples baselines. Compara el gasto real contra baselines hipotéticos de usar siempre haiku, sonnet u opus, para saber si el enrutamiento vale la pena.

Solicitabash
Estrellas
69.4k

en todo el repo

Actividad
49

0–100, la ruta de este skill

Actualizado
hace 2 meses

último commit aquí

Commits
1

últimos 90 días

Contexto
792 tok

70 tok en reposo

Paquete
1 archivo

3 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add ruvnet/ruflo --skill cost-counterfactual --agent claude-code

Se instala solo en este repositorio.

Este skill runs shell commands.

Qué hace

  • Compara el gasto real de las sesiones contra líneas base hipotéticas: siempre-haiku, siempre-sonnet o siempre-opus.
  • Calcula el ahorro (o sobrecosto) frente a cada baseline y su porcentaje.
  • Un ahorro negativo frente a siempre-haiku indica que el enrutador escaló a modelos más caros de lo necesario.

Úsalo cuando

  • En revisiones trimestrales de costo, para demostrar cuánto se ahorró frente a usar siempre Sonnet.
  • Como gate de CI que falle si el enrutamiento no ahorra al menos cierto % frente a la baseline sonnet.
  • Al validar una nueva configuración de calidad o límite de costo, para confirmar que el ahorro no retrocedió.

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • ¿Cuánto ahorramos usando el enrutador frente a usar siempre Sonnet?
    • Compara el gasto real contra la baseline de siempre-opus
    • ¿Está el enrutador sobre-escalando a modelos caros?

    SKILL.md

    En inglés

    Multi-baseline counterfactual cost analysis. Pairs with the existing observability surface:

    • cost-budget-check — "have we crossed a threshold?" (reactive)
    • cost-projection — "when will we cross a threshold?" (predictive)
    • cost-counterfactual — "is the routing earning its keep?" (comparative) ← this one

    Algorithm

    1. Read all session-* records from the cost-tracking namespace.
    2. Apply --since window filter (default all-time).
    3. Sum tokens across byModel[*] entries for each session.
    4. For each requested baseline (default: all three):
      • counterfactualUsd = (input × tier.input + output × tier.output + cache_write × tier.cache_write + cache_read × tier.cache_read) / 1M
    5. Compute savings = counterfactualUsd − actualUsd.
    6. Emit per-baseline totals + savings % across the comparison set.

    Smoke transcript (2 sessions: 50K haiku tokens + 50K sonnet tokens)

    | Sessions considered | 2 |
    | Total input tokens  | 100,000 |
    | Actual spend        | $0.162500 |
    
    | Baseline           | Hypothetical | Actual    | Savings    | %       |
    | `always-haiku`     | $0.025000    | $0.162500 | -$0.137500 | -550.00% |
    | `always-sonnet`    | $0.300000    | $0.162500 | +$0.137500 |   45.83% |
    | `always-opus`      | $1.500000    | $0.162500 | +$1.337500 |   89.17% |
    

    How to read negative savings

    A negative always-haiku result means the router chose more-expensive models than haiku on tasks haiku could have handled. That's an over-escalation signal:

    • Maybe qualityBar is set too high
    • Maybe the sonnet/opus session was warranted by complexity but the baseline doesn't know that
    • Run cost optimize (or inspect specific sessions via cost conversation) to investigate

    Positive savings quantify the router's win against that baseline. The most informative number is usually always-sonnet — it's the standard "safe default" baseline most teams would pick if they didn't have routing.

    When to use

    • Quarterly cost review: "We saved $X vs always-Sonnet — here's the proof."
    • CI gate: cost counterfactual --format json | jq '.baselines[1].savingsPct > 30' — fail builds if routing isn't saving ≥30% vs sonnet baseline (workload-shift detector).
    • Routing-config validation: When introducing a new qualityBar or cost-ceiling, re-run counterfactual to confirm savings didn't regress.

    Stationarity caveat

    Like all counterfactual analyses, this assumes the same tokens at the same complexity would have produced the same outcome from the baseline model. That's an upper bound — the baseline might have failed and required retries, which the math doesn't capture. Treat the numbers as a quality-blind ceiling.

    Reproducido de ruvnet/ruflo bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Lee los registros `session-*` del namespace `cost-tracking`.

    Detalles

    Creador
    ruvnet
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    ruvnet/ruflo
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de ruvnet/ruflo

    Este repo incluye 275 skills. Si instalas uno, normalmente ya tienes los demás.

    Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución.

    Costo de contexto al activarse
    833 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    herramientas desarrollo

    Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento.

    Costo de contexto al activarse
    566 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde.

    Costo de contexto al activarse
    627 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado.

    Costo de contexto al activarse
    443 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 26 días
    devops infraestructura

    Skills relacionados

    Agente especializado en desarrollo, entrenamiento y despliegue de modelos de machine learning.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    datos analitica

    Agente experto en análisis y optimización de matrices usando algoritmos sublineales. Se especializa en propiedades matriciales, dominancia diagonal, número de condición y recomendaciones para sistemas lineales grandes.

    Costo de contexto al activarse
    1.8k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    datos analitica

    Especialista en entrenamiento y despliegue de redes neuronales. Gestiona entrenamiento distribuido, inferencia y ciclo de vida de modelos usando la infraestructura cloud de Flow Nexus.

    Costo de contexto al activarse
    965 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    datos analitica