Qué es la arquitectura MoE
En un modelo tradicional, todos los parámetros trabajan en cada paso. En un MoE, un componente llamado router decide qué expertos son los más adecuados para cada token y solo esos se ponen a trabajar. El modelo puede tener un número enorme de parámetros totales pero usar solo una fracción en cada cálculo.
Cómo funciona
- El token llega a una capa MoE.
- El router elige, por ejemplo, 2 de 16 expertos.
- Solo esos expertos procesan el token.
- Sus resultados se combinan y el proceso continúa.
Modelos como los de Mistral (Mixtral) o DeepSeek han popularizado este enfoque.
Ejemplo real
Un modelo MoE con cientos de miles de millones de parámetros puede responder con una velocidad y un coste parecidos a los de un modelo mucho más pequeño, porque en cada paso solo trabaja una parte. Por eso algunos proveedores ofrecen modelos muy capaces a precios más bajos.
Para qué te sirve en tu negocio
No lo configuras tú, pero explica por qué algunos modelos ofrecen mucha calidad a bajo coste por token, un factor clave al elegir proveedor para automatizaciones con mucho volumen.
Errores comunes
- Pensar que cada experto domina un tema humano concreto (uno de cocina, otro de leyes): la especialización es mucho más abstracta.
- Comparar modelos solo por número total de parámetros.
- Olvidar que necesitan mucha memoria aunque calculen menos.
Preguntas frecuentes
¿Qué ventaja tiene un MoE?
Más capacidad con menos cálculo por respuesta.
¿Qué es el router?
La parte del modelo que decide qué expertos se activan.
¿Qué modelos usan MoE?
Varios modelos de Mistral y DeepSeek, entre otros; muchos laboratorios no detallan su arquitectura.
