Evaluadores de calidad para Agentes de IA (Evals)

De qué va: El gran olvidado al entregar un agente: probarlo de forma masiva y demostrar su calidad con datos. Cómo montar el evaluador nativo de n8n.

Highlights:

  • Rama de evaluación: se duplica el agente real (mismo modelo, memoria y herramientas); se evalúa el agente del paciente, que es el crítico.
  • Evaluation Trigger: fuente de datos en Google Sheets o Data Table nativo. El dataset (generado con ChatGPT) incluye caso, mensaje, respuesta esperada, herramienta esperada, categoría y columnas vacías para respuesta real y tool usada.
  • Memoria aislada: el session_id de cada prueba es un índice tipo eval0.
  • Métricas (incluidas custom): acierto de herramienta, correctness (evaluador factual con modelo juez), helpfulness (IA, prompt traducible al español) y tool usage.
  • Resultados: se guardan de vuelta en el Sheet. La ejecución masiva (Evaluations → Run test) devuelve tokens, coste, tiempo y todas tus métricas, con gráfica de evolución entre versiones de prompt.

Por qué importa: te posiciona como experto. Cuando un cliente se empeña en algo que baja la calidad, las métricas lo justifican. Evalúa siempre antes de entregar.