¿Qué es un eval de agente?
Un eval es una prueba repetible que mide si un agente hace bien una tarea concreta: un conjunto de casos con el resultado esperado y una forma automática de comprobarlo. Es lo que permite saber si un cambio en una skill mejora algo o solo lo cambia.
- Área
- Modelos y coste
- Última revisión
También: Evaluación · Evals · Banco de pruebas
En corto
- Sin eval, «ha mejorado» es una impresión formada sobre dos o tres intentos.
- Los casos importantes son los que ya fallaron una vez: un eval crece con cada fallo real.
- La comprobación tiene que ser automática, o no se ejecuta lo suficiente para servir.
Cómo se empieza sin montar una infraestructura
Con cinco casos guardados en el repositorio y un comando que los ejecuta. La versión mínima funciona: la misma petición, el mismo estado inicial, y una comprobación que devuelve pasa o falla. A partir de ahí, cada regresión encontrada a mano se convierte en el caso número seis.
Términos relacionados
Fuentes
- Claude Agent SDK overview — Anthropic. Comprobado el .
- Claude Code: Best practices for agentic coding — Anthropic Engineering. Comprobado el .