Qué es el F1 score
La exactitud (porcentaje de aciertos) engaña cuando los datos están desequilibrados. Si solo el 1 % de las transacciones son fraude, un modelo que dice «nunca es fraude» acierta el 99 % y no sirve para nada. El F1 score evita esa trampa porque obliga al modelo a ser bueno encontrando los casos positivos y a no dar falsas alarmas.
Cómo se calcula
- Precisión: de todo lo que el modelo marcó como positivo, ¿cuánto lo era?
- Recall: de todos los positivos reales, ¿cuántos encontró?
- F1: la media armónica de ambas: 2 × (precisión × recall) / (precisión + recall).
La media armónica castiga los desequilibrios: si una de las dos es muy baja, el F1 también lo es.
Ejemplo real
Un modelo detecta reseñas falsas en una tienda online. Marca 100 reseñas como falsas y 80 lo son (precisión 0,8). Pero en total había 200 falsas, así que solo encontró el 40 % (recall 0,4). Su F1 es de unos 0,53: detecta con acierto, pero se le escapan muchas.
Para qué te sirve en tu negocio
Si alguien te vende un modelo de clasificación (detectar fraude, clasificar tickets, filtrar leads), pregunta por su F1 score o por la precisión y el recall, no solo por el porcentaje de aciertos. Te dirá mucho más sobre si de verdad funciona.
Errores comunes
- Evaluar solo con la exactitud en datos desequilibrados.
- Ignorar qué error es más caro en tu negocio: a veces importa más no dejar escapar ningún caso que tener falsas alarmas.
- Comparar el F1 de modelos probados con datos distintos.
Preguntas frecuentes
¿Qué es un buen F1 score?
Depende del problema. En tareas difíciles, 0,7 puede ser bueno; en otras se espera más de 0,9.
¿Qué diferencia hay entre precisión y recall?
La precisión mide falsas alarmas; el recall, casos que se escapan.
¿El F1 sirve para evaluar un LLM?
Para tareas de clasificación o extracción, sí; para textos abiertos se usan otras evaluaciones.
