Skills Agentes

Harness Bench

Gestiona los conjuntos de evaluación de @metaharness/darwin: bench create genera una suite JSON desde los tests de un repo y bench verify comprueba que esté bien formada.

Solicitabash
Estrellas
69.4k

en todo el repo

Actividad
50

0–100, la ruta de este skill

Actualizado
hace 2 meses

último commit aquí

Commits
1

últimos 90 días

Contexto
588 tok

99 tok en reposo

Paquete
1 archivo

2 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add ruvnet/ruflo --skill harness-bench --agent claude-code

Se instala solo en este repositorio.

Este skill runs shell commands.

Qué hace

  • Ejecuta `bench create <repo>` para generar una suite JSON de evaluación a partir de los tests existentes del repositorio.
  • Ejecuta `bench verify <suite.json>` para comprobar que la suite esté bien formada.
  • Sirve de corpus fijo contra el que harness-evolve puntúa las variantes.

Úsalo cuando

  • Vas a montar un pipeline de evolución para un repo cuyo npm test es inestable, lento o insuficiente.
  • Quieres verificar en CI que la suite versionada sigue bien formada en cada PR.
  • Vas a bifurcar un harness a un nuevo dominio y necesitas adaptar la evaluación sin perder comparabilidad.

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Crea una bench suite para este repo
    • Verifica que la suite de evaluación esté bien formada

    SKILL.md

    En inglés

    Surfaces metaharness-darwin bench <create|verify> — the supporting verb for harness-evolve --bench. Use when you want evolution scored against a fixed corpus (independent of npm test) so champion fitness is comparable across commits or across forks of the same harness.

    When to use

    • Setting up a new evolution pipeline for a repo whose npm test is flaky, slow, or undersized — scaffold a deterministic bench suite once, then evolve against it repeatedly.
    • CI: bench verify the checked-in suite on every PR that touches it (cheap; ~5s).
    • Forking a harness to a new domain: copy and edit the suite to retarget the evaluation without losing comparability to the parent.

    Algorithm

    Implementation: scripts/bench.mjs.

    --op create

    1. Resolve --repo path; reject if missing.
    2. Shell to metaharness-darwin bench create <repo> [--out <suite.json>].
    3. Default output path: <repo>/.metaharness/bench/suite.json (chosen by upstream).
    4. Suite shape (per upstream): array of { input, expectedOutput, weight } tasks derived from existing test cases.

    --op verify

    1. Resolve --suite path; reject if missing.
    2. Shell to metaharness-darwin bench verify <suite.json>.
    3. Exit 1 if any task malformed (upstream's signal).

    Output shape

    {
      "success": true,
      "data": {
        "op": "verify",
        "taskCount": 42,
        "wellFormed": true,
        "durationMs": 870
      }
    }
    

    Exit codes

    Code Meaning
    0 OK (or degraded — Darwin absent)
    1 --op verify and suite malformed
    2 Config error or upstream invocation failure

    Graceful degradation

    When @metaharness/darwin is absent, emits the standard {degraded: true, reason: 'metaharness-darwin-not-available'} payload and exits 0.

    Reproducido de ruvnet/ruflo bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Se degrada con normalidad si @metaharness/darwin no está instalado.

    Detalles

    Creador
    ruvnet
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    ruvnet/ruflo
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de ruvnet/ruflo

    Este repo incluye 275 skills. Si instalas uno, normalmente ya tienes los demás.

    Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución.

    Costo de contexto al activarse
    833 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    herramientas desarrollo

    Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento.

    Costo de contexto al activarse
    566 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde.

    Costo de contexto al activarse
    627 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado.

    Costo de contexto al activarse
    443 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 26 días
    devops infraestructura

    Skills relacionados

    Añade descripciones de modelos nuevos del router de HuggingFace a la configuración de chat-ui (prod.yaml y dev.yaml).

    Costo de contexto al activarse
    600 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo