¿Qué es el harness engineering?
El harness engineering es el trabajo iterativo de diseñar, medir y mejorar el harness de un agente: ejecutar tareas reales, revisar las trazas, encontrar el fallo que se repite y arreglar el entorno para que ese fallo deje de ser posible.
- Última revisión
También: Ingeniería del harness · Engineer the harness
En corto
- No es montar el harness una vez: es el ciclo de medir, ajustar y volver a medir.
- La regla de fondo: cuando el agente falla, se arregla el entorno, no el prompt.
- Necesita trazas de las ejecuciones que fallan y un conjunto de tareas repetibles con las que comparar.
Por qué el arreglo va en el entorno
Una frase añadida al prompt es una preferencia que el modelo puede no aplicar en la vuelta cuarenta de una sesión larga. Un script que ejecuta bien la suite de pruebas, una tool cuyo error dice dónde estaba el problema o un hook que bloquea una ruta son deterministas. El mismo fallo, resuelto en el entorno, no vuelve.
De ahí el orden de trabajo habitual: escribir el archivo de contexto a partir de errores ya vistos y no de reglas preventivas, convertir en tool lo que se repite, fijar criterios de aceptación verificables antes de arrancar, decidir qué se ejecuta sin preguntar, y guardar las trazas de lo que falla.
Cómo se mide
Con un puñado de tareas representativas ejecutadas antes y después de cada cambio. Es la versión mínima de un eval y ya detecta regresiones, que es exactamente lo que la impresión personal sobre dos o tres intentos no detecta.
Términos relacionados
Seguir por aquí
Fuentes
- My AI Adoption Journey — Mitchell Hashimoto. Comprobado el .
- Effective harnesses for long-running agents — Anthropic Engineering. Comprobado el .
- The anatomy of an agent harness — LangChain. Comprobado el .