Skills Agentes

¿Qué es el harness engineering?

El harness engineering es el trabajo iterativo de diseñar, medir y mejorar el harness de un agente: ejecutar tareas reales, revisar las trazas, encontrar el fallo que se repite y arreglar el entorno para que ese fallo deje de ser posible.

Última revisión

También: Ingeniería del harness · Engineer the harness

En corto

  • No es montar el harness una vez: es el ciclo de medir, ajustar y volver a medir.
  • La regla de fondo: cuando el agente falla, se arregla el entorno, no el prompt.
  • Necesita trazas de las ejecuciones que fallan y un conjunto de tareas repetibles con las que comparar.

Por qué el arreglo va en el entorno

Una frase añadida al prompt es una preferencia que el modelo puede no aplicar en la vuelta cuarenta de una sesión larga. Un script que ejecuta bien la suite de pruebas, una tool cuyo error dice dónde estaba el problema o un hook que bloquea una ruta son deterministas. El mismo fallo, resuelto en el entorno, no vuelve.

De ahí el orden de trabajo habitual: escribir el archivo de contexto a partir de errores ya vistos y no de reglas preventivas, convertir en tool lo que se repite, fijar criterios de aceptación verificables antes de arrancar, decidir qué se ejecuta sin preguntar, y guardar las trazas de lo que falla.

Cómo se mide

Con un puñado de tareas representativas ejecutadas antes y después de cada cambio. Es la versión mínima de un eval y ya detecta regresiones, que es exactamente lo que la impresión personal sobre dos o tres intentos no detecta.

Términos relacionados

Seguir por aquí

Fuentes

Todos los términos del glosario