Qué es el ground truth
Para saber si un modelo funciona, necesitas compararlo con la realidad. Si tu IA clasifica emails, el ground truth es un conjunto de emails cuya categoría correcta ha verificado una persona experta. Sin esa referencia, no puedes medir nada.
Cómo se construye
- Se selecciona una muestra representativa de casos reales.
- Personas expertas asignan la respuesta correcta a cada caso.
- Se revisan los desacuerdos entre personas para fijar el criterio.
- Se usa para entrenar y, por separado, para evaluar.
Ejemplo real
Una agencia quiere usar IA para clasificar keywords por intención de búsqueda. Primero clasifica a mano 300 keywords con su equipo SEO: ese es su ground truth. Después compara la clasificación de la IA con la suya y descubre que acierta el 88 %. Ahora sabe cuánto puede confiar en ella.
Para qué te sirve en tu negocio
Antes de automatizar una tarea con IA, crea un pequeño ground truth con casos reales. Es la única forma objetiva de saber si la IA hace bien el trabajo y de comparar modelos o prompts.
Errores comunes
- Evaluar la IA «a ojo» con cuatro ejemplos.
- Un ground truth con casos demasiado fáciles.
- Etiquetas de referencia mal revisadas: si la referencia está mal, la evaluación también.
Preguntas frecuentes
¿Qué diferencia hay entre ground truth y dataset?
El ground truth es la parte del dataset con respuestas verificadas que sirve de referencia.
¿Cuántos casos necesito?
Para evaluar una tarea concreta, unos cientos suelen ser suficientes para empezar.
¿Qué son las evals?
Evaluaciones sistemáticas de un modelo, que suelen apoyarse en un ground truth.
