Qué es el sesgo algorítmico
Los modelos aprenden de datos históricos. Si esos datos contienen sesgos —porque el pasado fue injusto o porque faltan ejemplos de ciertos grupos—, el modelo los reproduce e incluso los amplifica, con la apariencia de objetividad de un sistema automático.
Causas habituales
- Datos sesgados: reflejan decisiones históricas injustas.
- Datos incompletos: algunos grupos están poco representados.
- Variables indirectas: el código postal puede funcionar como indicador del origen o del nivel económico.
- Objetivos mal definidos: optimizar solo una métrica puede perjudicar a otros.
Ejemplo real
Se han documentado casos de herramientas de selección de personal que penalizaban currículums con señales asociadas a mujeres porque se entrenaron con contrataciones históricas mayoritariamente masculinas. El sistema no «quería» discriminar: reproducía el pasado.
Para qué te sirve en tu negocio
Si usas IA en decisiones sobre personas —selección, crédito, precios, segmentación—, revisa que no discrimine. Además del daño a personas y a tu reputación, la Ley de IA de la UE exige controlar los sesgos en usos de alto riesgo.
Errores comunes
- Pensar que un algoritmo es neutral por definición.
- No revisar los resultados por grupos.
- Eliminar variables sensibles y creer que el problema está resuelto (pueden colarse por otras variables).
Preguntas frecuentes
¿Los LLM tienen sesgos?
Sí, reflejan los sesgos de los textos con los que se entrenaron.
¿Se puede eliminar el sesgo?
Se puede reducir con buenos datos, pruebas y supervisión, pero no eliminar del todo.
¿Cómo lo detecto?
Comparando los resultados del sistema entre distintos grupos.
