Evaluadores de calidad para Agentes de IA (Evals)
De qué va: El gran olvidado al entregar un agente: probarlo de forma masiva y demostrar su calidad con datos. Cómo montar el evaluador nativo de n8n.
Highlights:
- Rama de evaluación: se duplica el agente real (mismo modelo, memoria y herramientas); se evalúa el agente del paciente, que es el crítico.
- Evaluation Trigger: fuente de datos en Google Sheets o Data Table nativo. El dataset (generado con ChatGPT) incluye caso, mensaje, respuesta esperada, herramienta esperada, categoría y columnas vacías para respuesta real y tool usada.
- Memoria aislada: el
session_idde cada prueba es un índice tipoeval0. - Métricas (incluidas custom): acierto de herramienta, correctness (evaluador factual con modelo juez), helpfulness (IA, prompt traducible al español) y tool usage.
- Resultados: se guardan de vuelta en el Sheet. La ejecución masiva (Evaluations → Run test) devuelve tokens, coste, tiempo y todas tus métricas, con gráfica de evolución entre versiones de prompt.
Por qué importa: te posiciona como experto. Cuando un cliente se empeña en algo que baja la calidad, las métricas lo justifican. Evalúa siempre antes de entregar.