Qué son las evals
Probar una IA con tres preguntas y «ver que va bien» no es evaluar. Las evals convierten esa intuición en medición: un conjunto fijo de casos con resultados esperados y una forma de puntuar las respuestas. Así puedes comparar versiones y detectar regresiones.
Tipos de evaluación
- Con respuesta exacta: clasificaciones o extracción de datos, comparando con un ground truth.
- Con criterios: una persona o un modelo evaluador puntúa según una rúbrica (claridad, tono, precisión).
- De seguridad: comprobar que la IA rechaza lo que debe rechazar.
- De coste y velocidad: tokens y tiempo por respuesta.
Ejemplo real
Una empresa tiene un chatbot de soporte. Antes de cambiar de modelo, pasa 200 preguntas reales por la versión actual y por la nueva y compara aciertos, tono y coste. La nueva es más barata pero falla más en devoluciones, así que ajusta el prompt antes de cambiar.
Para qué te sirve en tu negocio
Si tienes IA en producción, las evals son tu red de seguridad: te permiten mejorar prompts, cambiar de modelo o de proveedor sin romper nada.
Errores comunes
- Evaluar con muy pocos casos o casos demasiado fáciles.
- No repetir las evals después de cada cambio.
- Fiarse solo de un modelo evaluador sin revisar una muestra a mano.
Preguntas frecuentes
¿Qué diferencia hay entre evals y benchmark?
Un benchmark es una prueba estándar para comparar modelos; las evals, pruebas diseñadas para tu caso.
¿Cuántos casos hacen falta?
Para empezar, entre 50 y 200 casos representativos.
¿Qué es LLM-as-a-judge?
Usar un modelo de IA para evaluar las respuestas de otro según criterios definidos.
