Qué es un benchmark
Cada vez que se lanza un modelo, verás tablas con puntuaciones en distintos benchmarks. Sirven para comparar modelos de forma objetiva en las mismas condiciones. Los hay de conocimiento académico, de programación, de razonamiento, de uso de herramientas o de preferencia humana, como los rankings basados en votaciones.
Limitaciones
- Contaminación: si las preguntas se filtran a los datos de entrenamiento, el modelo «se sabe» el examen.
- Saturación: cuando todos los modelos sacan casi el máximo, el benchmark deja de distinguir.
- Distancia de tu realidad: que un modelo sea el mejor en matemáticas no dice nada de cómo redacta tus fichas de producto.
Ejemplo real
Un modelo nuevo encabeza varios rankings de programación. Una agencia lo prueba con sus tareas reales —redacción de contenido SEO en español— y descubre que su modelo actual sigue siendo mejor para ese uso concreto.
Para qué te sirve en tu negocio
Úsalos como primer filtro para elegir candidatos, pero decide con tus propias pruebas (evals) sobre tus tareas y en tu idioma.
Errores comunes
- Elegir modelo solo por la tabla de benchmarks.
- Comparar puntuaciones de pruebas distintas.
- Olvidar el coste y la velocidad, que no aparecen en los benchmarks.
Preguntas frecuentes
¿Qué benchmark es más fiable?
Ninguno por sí solo; conviene mirar varios y, sobre todo, probar con tus casos.
¿Qué es un ranking de preferencia humana?
Una clasificación basada en votos de personas que comparan respuestas de modelos a ciegas.
¿Qué diferencia hay con las evals?
El benchmark es estándar y público; las evals, específicas para tu uso.
