Qué es un transformer
Lo presentaron investigadores de Google en 2017 en el artículo «Attention Is All You Need». Antes, los modelos leían el texto palabra a palabra, en orden, y se les olvidaba el principio de las frases largas. El transformer procesa todo el texto en paralelo y decide en cada caso qué partes son relevantes para qué otras.
Cómo funciona
- El texto se divide en tokens y cada uno se convierte en un vector.
- Se añade información sobre la posición de cada token.
- Las capas de atención calculan qué tokens deben «fijarse» en cuáles.
- Tras muchas capas, el modelo predice el siguiente token.
La letra «T» de GPT significa justamente Transformer.
Ejemplo real
En la frase «El cliente devolvió el pedido porque estaba roto», el transformer relaciona «estaba roto» con «pedido» y no con «cliente». Esa capacidad de captar relaciones a distancia es lo que hace que los modelos entiendan el contexto.
Para qué te sirve en tu negocio
No vas a construir uno, pero explica por qué la IA actual entiende el contexto, por qué tiene una ventana de contexto limitada y por qué necesita tanto cálculo.
Errores comunes
- Pensar que «transformer» es un producto: es una arquitectura.
- Creer que solo sirve para texto: también se usa en imagen, audio y vídeo.
- Confundirlo con otros usos de la palabra.
Preguntas frecuentes
¿Qué significa GPT?
Generative Pre-trained Transformer: transformer generativo preentrenado.
¿Quién inventó el transformer?
Un equipo de investigadores de Google, en 2017.
¿Todos los LLM son transformers?
La inmensa mayoría, aunque se investigan arquitecturas alternativas.
