Qué es el etiquetado de datos
Para que un modelo aprenda a detectar spam, alguien tiene que marcar antes miles de correos como «spam» o «no spam». Ese trabajo, muchas veces manual, es el etiquetado. Es una parte poco visible de la IA, pero de la que depende buena parte de su calidad.
Tipos de etiquetado
- Clasificación: asignar una categoría («queja», «consulta», «devolución»).
- Anotación de imágenes: marcar objetos con recuadros o contornos.
- Extracción: señalar datos concretos en un texto (nombre, fecha, importe).
- Valoración: puntuar respuestas de una IA, como en RLHF.
Ejemplo real
Una empresa quiere clasificar automáticamente sus tickets de soporte. Dos personas del equipo etiquetan 2.000 tickets siguiendo una guía común. Con ese dataset se entrena un modelo que después clasifica los nuevos tickets. Hoy, además, un LLM puede hacer una primera propuesta de etiqueta que las personas solo revisan.
Para qué te sirve en tu negocio
Si quieres entrenar o evaluar un modelo con tus datos, necesitarás ejemplos etiquetados. Y aunque uses modelos de terceros, etiquetar un pequeño conjunto de casos reales te sirve para comprobar si la IA acierta en tu negocio.
Errores comunes
- No tener una guía clara de etiquetado: cada persona etiqueta a su manera.
- Etiquetar solo casos fáciles.
- No revisar la calidad del etiquetado.
Preguntas frecuentes
¿La IA puede etiquetar datos?
Sí, cada vez más, pero conviene revisar una muestra.
¿Qué es el ground truth?
El conjunto de etiquetas correctas que se toma como referencia.
¿Cuántos datos hay que etiquetar?
Depende del problema; para evaluar, a veces bastan unos cientos.
