Qué es la cuantización
Un modelo es, en el fondo, una enorme lista de números. Guardarlos con mucha precisión ocupa mucha memoria. La cuantización los «redondea»: los representa con menos bits. Un modelo que no cabía en tu ordenador puede pasar a caber y responder con fluidez.
Cómo funciona
- Se toma un modelo entrenado.
- Sus pesos se convierten a un formato de menor precisión (8 bits, 4 bits…).
- Se ajusta para minimizar la pérdida de calidad.
- El resultado ocupa una fracción del tamaño original.
Por eso en Ollama o Hugging Face verás versiones del mismo modelo con etiquetas como Q4 o Q8.
Ejemplo real
Un modelo abierto mediano que en su versión completa necesita una GPU de servidor puede ejecutarse, cuantizado a 4 bits, en un portátil con buena memoria. Para tareas como resumir o clasificar, la diferencia de calidad apenas se nota.
Para qué te sirve en tu negocio
Es lo que hace viable usar LLM en local o en hardware modesto. Si vas a ejecutar modelos en tus equipos, elegir bien el nivel de cuantización es clave para equilibrar velocidad y calidad.
Errores comunes
- Cuantizar demasiado: por debajo de ciertos niveles, la calidad cae mucho.
- Comparar modelos sin saber con qué cuantización se probaron.
- Pensar que la cuantización cambia lo que el modelo sabe: cambia su precisión.
Preguntas frecuentes
¿Qué nivel de cuantización usar?
Q4 o Q5 suele ser un buen equilibrio para uso local.
¿Afecta al idioma?
Puede afectar algo más a idiomas con menos datos, como el español frente al inglés.
¿Qué es GGUF?
Un formato de archivo muy usado para modelos cuantizados en local.
