Letra E Nivel: Avanzado Lectura: 1 min

¿Qué es Evals (evaluaciones)?

Definición rápida

Las evals (evaluaciones) son conjuntos de pruebas diseñados para medir de forma sistemática la calidad de un modelo o de una aplicación de IA: si acierta, si sigue el formato, si respeta los límites o si empeora al cambiar un prompt o un modelo.

Por Carlos Miñana · Actualizado el 24 de septiembre de 2026
¿Qué es Evals?

Qué son las evals

Probar una IA con tres preguntas y «ver que va bien» no es evaluar. Las evals convierten esa intuición en medición: un conjunto fijo de casos con resultados esperados y una forma de puntuar las respuestas. Así puedes comparar versiones y detectar regresiones.

Tipos de evaluación

  1. Con respuesta exacta: clasificaciones o extracción de datos, comparando con un ground truth.
  2. Con criterios: una persona o un modelo evaluador puntúa según una rúbrica (claridad, tono, precisión).
  3. De seguridad: comprobar que la IA rechaza lo que debe rechazar.
  4. De coste y velocidad: tokens y tiempo por respuesta.

Ejemplo real

Una empresa tiene un chatbot de soporte. Antes de cambiar de modelo, pasa 200 preguntas reales por la versión actual y por la nueva y compara aciertos, tono y coste. La nueva es más barata pero falla más en devoluciones, así que ajusta el prompt antes de cambiar.

Para qué te sirve en tu negocio

Si tienes IA en producción, las evals son tu red de seguridad: te permiten mejorar prompts, cambiar de modelo o de proveedor sin romper nada.

Errores comunes

Preguntas frecuentes

¿Qué diferencia hay entre evals y benchmark?

Un benchmark es una prueba estándar para comparar modelos; las evals, pruebas diseñadas para tu caso.

¿Cuántos casos hacen falta?

Para empezar, entre 50 y 200 casos representativos.

¿Qué es LLM-as-a-judge?

Usar un modelo de IA para evaluar las respuestas de otro según criterios definidos.

¿Tienes un proyecto con IA en mente?
Te ayudo a aterrizarlo en tu negocio.
¡Te escucho!