Qué es la inferencia
La vida de un modelo tiene dos fases: el entrenamiento, en el que aprende (muy caro, se hace pocas veces), y la inferencia, en la que se usa (más barata por petición, pero ocurre millones de veces). Gran parte del coste real de la IA a escala está en la inferencia.
Qué influye en la inferencia
- Tamaño del modelo: los modelos grandes son más lentos y caros.
- Longitud de la entrada y la salida: más tokens, más coste y tiempo.
- Hardware: GPU, TPU o NPU.
- Optimizaciones: cuantización, caché de prompts o técnicas como el speculative decoding.
Ejemplo real
Una tienda online usa IA para responder a clientes. El modelo se entrenó una vez (lo hizo el proveedor), pero cada conversación es una inferencia que se paga por tokens. Con 10.000 conversaciones al mes, elegir un modelo más pequeño para las preguntas sencillas reduce mucho la factura.
Para qué te sirve en tu negocio
Para entender costes y velocidad de la IA que usas y optimizarlos: modelo adecuado para cada tarea, prompts concisos y respuestas acotadas.
Errores comunes
- Usar el modelo más potente para todo.
- No medir coste por tarea en automatizaciones con volumen.
- Confundir inferencia con entrenamiento.
Preguntas frecuentes
¿Qué diferencia hay entre entrenamiento e inferencia?
El entrenamiento crea el modelo; la inferencia lo usa.
¿Por qué tarda en responder la IA?
Porque la inferencia genera la respuesta token a token.
¿Puedo hacer inferencia en local?
Sí, con modelos abiertos y herramientas como Ollama.
