Skills Agentes

Harness Learn

Ejecuta un ciclo de aprendizaje GEPA con metaharness learn: optimiza el genoma de un harness contra un manifiesto de tareas tipo SWE-bench. Dry-run gratis por defecto; --run gasta de verdad.

Solicitabash
Estrellas
69.4k

en todo el repo

Actividad
53

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
2

últimos 90 días

Contexto
807 tok

103 tok en reposo

Paquete
1 archivo

3 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add ruvnet/ruflo --skill harness-learn --agent claude-code

Se instala solo en este repositorio.

Este skill runs shell commands, makes network requests.

Qué hace

  • Ejecuta metaharness learn para optimizar el genoma de política de un harness contra un corpus de tareas puntuadas.
  • Por defecto hace dry-run a coste cero; solo gasta con --run.
  • Sin un checkout local de metaharness, informa checkout-required con instrucciones de clonado.

Úsalo cuando

  • El prompt de política de un harness rinde mal en una familia de tareas y quieres una mejora medida, no iteración manual.
  • Quieres calcular el coste de una ejecución de aprendizaje antes de gastar.

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Calcula el coste de un ciclo de aprendizaje sin gastar
    • Ejecuta metaharness learn sobre este slice con --run

    SKILL.md

    En inglés

    Surfaces metaharness learn — the upstream GEPA learning harness that evolves harness policy genomes against a scored task corpus instead of hand-editing prompts. Candidates are scored on held-out slices and only measured winners promote (the shipped cand-6 genome is the first such promotion: holdout gold 2/12 → 3/12, zero regressions).

    When to use

    • A harness's policy prompt underperforms on a task family and you want a measured improvement loop rather than manual prompt iteration.
    • Pricing a learning run before committing spend — the default dry-run resolves the slice manifest and reports cost without any model calls.
    • After a learn run promotes a genome: pair with harness-gepa --op render to inspect what the promoted policy actually says.

    Preconditions (upstream design)

    The learning harness (GEPA + SWE-bench + Docker) is too heavy for the npm package, so learn needs a local clone:

    git clone https://github.com/ruvnet/metaharness.git
    node scripts/learn.mjs --repo ./metaharness --host claude-code --model haiku --slice slices/lite.json
    

    Without a checkout the script emits {status: "checkout-required"} and exits 0 — a precondition report, not an error (distinct from degraded: true, which means the npm package itself is absent). The managed-service path (gateway-side learn jobs, no checkout) is upstream's ADR-235 follow-up and not available yet.

    Algorithm

    Implementation: scripts/learn.mjs.

    1. Validate --repo exists when given; export it as $METAHARNESS_REPO.
    2. Invoke the pinned metaharness binary (metaharness@~0.3.0, local install or one-time versioned cache — never @latest): metaharness learn --host <h> --model <m> --slice <s> [--run] via _harness.mjs (graceful degradation, hard timeout).
    3. Default timeouts: 120s dry-run, 600s with --run — real runs on larger slices need an explicit --timeout-ms matched to slice size × model cost.
    4. Detect the checkout-required message → structured payload, exit 0.
    5. Parse the trailing JSON report when upstream emits one; otherwise return the raw report text under rawReport.

    Cost note

    --run is the ONLY path that spends. Everything else — dry-run, checkout probe, degraded path — is $0. The MCP tool (metaharness_learn) has a 120s subprocess budget; run real learning cycles from a terminal via ruflo metaharness learn ... --run --timeout-ms <big>.

    Exit codes

    • 0 — report produced (or dry-run, checkout-required, degraded)
    • 1--alert-on-fail and the learn run reported failure
    • 2 — config error (bad --repo path)

    Reproducido de ruvnet/ruflo bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Necesita un checkout local del repo metaharness (--repo o $METAHARNESS_REPO); sin él reporta checkout-required.

    Necesita en el PATH:gitnode

    Detalles

    Creador
    ruvnet
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    ruvnet/ruflo
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de ruvnet/ruflo

    Este repo incluye 275 skills. Si instalas uno, normalmente ya tienes los demás.

    Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución.

    Costo de contexto al activarse
    833 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    herramientas desarrollo

    Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento.

    Costo de contexto al activarse
    566 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde.

    Costo de contexto al activarse
    627 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado.

    Costo de contexto al activarse
    443 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 26 días
    devops infraestructura

    Skills relacionados

    Añade descripciones de modelos nuevos del router de HuggingFace a la configuración de chat-ui (prod.yaml y dev.yaml).

    Costo de contexto al activarse
    600 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo