# Harness Bench > Gestiona los conjuntos de evaluación de @metaharness/darwin: bench create genera una suite JSON desde los tests de un repo y bench verify comprueba que esté bien formada. Fuente: https://skillsagentes.com/skills/ruvnet/ruflo/harness-bench Markdown: https://skillsagentes.com/skills/ruvnet/ruflo/harness-bench.md Repositorio: https://github.com/ruvnet/ruflo Autor: ruvnet Licencia: MIT Actualizado: hace 2 meses Coste de contexto: 99 tok instalada, 588 tok al activarse, 588 tok con todos los archivos del bundle Bundle: 1 archivo, 2 KB Permisos que pide: bash ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add ruvnet/ruflo --skill harness-bench --agent claude-code # Cursor npx -y skills add ruvnet/ruflo --skill harness-bench --agent cursor # Codex npx -y skills add ruvnet/ruflo --skill harness-bench --agent codex # Gemini CLI npx -y skills add ruvnet/ruflo --skill harness-bench --agent gemini # Windsurf npx -y skills add ruvnet/ruflo --skill harness-bench --agent windsurf # Cline npx -y skills add ruvnet/ruflo --skill harness-bench --agent cline ``` ## Qué hace - Ejecuta `bench create ` para generar una suite JSON de evaluación a partir de los tests existentes del repositorio. - Ejecuta `bench verify ` para comprobar que la suite esté bien formada. - Sirve de corpus fijo contra el que harness-evolve puntúa las variantes. ## Cuándo usarla - Vas a montar un pipeline de evolución para un repo cuyo npm test es inestable, lento o insuficiente. - Quieres verificar en CI que la suite versionada sigue bien formada en cada PR. - Vas a bifurcar un harness a un nuevo dominio y necesitas adaptar la evaluación sin perder comparabilidad. ## Qué la activa - "Crea una bench suite para este repo" - "Verifica que la suite de evaluación esté bien formada" ## Antes de instalar - Se degrada con normalidad si @metaharness/darwin no está instalado. - runs shell commands ## Archivos - SKILL.md — 2 KB ## SKILL.md Reproducido tal cual desde ruvnet/ruflo bajo MIT. Esta sección es el documento original y está en inglés. Surfaces `metaharness-darwin bench ` — the supporting verb for `harness-evolve --bench`. Use when you want evolution scored against a fixed corpus (independent of `npm test`) so champion fitness is comparable across commits or across forks of the same harness. ## When to use - Setting up a new evolution pipeline for a repo whose `npm test` is flaky, slow, or undersized — scaffold a deterministic bench suite once, then evolve against it repeatedly. - CI: `bench verify` the checked-in suite on every PR that touches it (cheap; ~5s). - Forking a harness to a new domain: copy and edit the suite to retarget the evaluation without losing comparability to the parent. ## Algorithm Implementation: [`scripts/bench.mjs`](../../scripts/bench.mjs). ### `--op create` 1. Resolve `--repo` path; reject if missing. 2. Shell to `metaharness-darwin bench create [--out ]`. 3. Default output path: `/.metaharness/bench/suite.json` (chosen by upstream). 4. Suite shape (per upstream): array of `{ input, expectedOutput, weight }` tasks derived from existing test cases. ### `--op verify` 1. Resolve `--suite` path; reject if missing. 2. Shell to `metaharness-darwin bench verify `. 3. Exit 1 if any task malformed (upstream's signal). ## Output shape ```json { "success": true, "data": { "op": "verify", "taskCount": 42, "wellFormed": true, "durationMs": 870 } } ``` ## Exit codes | Code | Meaning | |---|---| | 0 | OK (or degraded — Darwin absent) | | 1 | `--op verify` and suite malformed | | 2 | Config error or upstream invocation failure | ## Graceful degradation When `@metaharness/darwin` is absent, emits the standard `{degraded: true, reason: 'metaharness-darwin-not-available'}` payload and exits 0. ## Dónde encaja - Categoría: [Herramientas para desarrolladores](https://skillsagentes.com/categorias/herramientas-desarrollo.md) — Skills que cambian cómo tu agente escribe, revisa y despliega código. - Creador: [ruvnet](https://skillsagentes.com/creators/ruvnet.md) — 275 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Harness Gepa](https://skillsagentes.com/skills/ruvnet/ruflo/harness-gepa.md): Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución. - [Deepseek Reason](https://skillsagentes.com/skills/ruvnet/ruflo/deepseek-reason.md): Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde. - [Deepseek Chat](https://skillsagentes.com/skills/ruvnet/ruflo/deepseek-chat.md): Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento. - [Adr Index](https://skillsagentes.com/skills/ruvnet/ruflo/adr-index.md): Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP. - [Agntcy Status](https://skillsagentes.com/skills/ruvnet/ruflo/agntcy-status.md): Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)