Qué es el mecanismo de atención
Cuando lees «Ana le dio el libro a Marta porque ella lo había pedido», sabes que «ella» es Marta. Para un modelo no es obvio. La atención calcula pesos entre todas las palabras: «ella» presta mucha atención a «Marta» y poca a «libro». Así el modelo construye el significado de cada palabra en función de su contexto.
Cómo funciona
- Cada token genera tres vectores: consulta (qué busco), clave (qué ofrezco) y valor (qué información aporto).
- Se compara la consulta de cada token con las claves de todos los demás.
- Esas comparaciones dan pesos de atención.
- Cada token se enriquece con la información de los tokens más relevantes.
Cuando un token se fija en el resto de tokens del mismo texto se habla de self-attention.
Ejemplo real
Al traducir «The bank of the river» o «The bank closed my account», la atención ayuda al modelo a mirar «river» o «account» para decidir si «bank» es «orilla» o «banco».
Para qué te sirve en tu negocio
Explica por qué los modelos entienden tan bien el contexto y por qué cuestan más cuanto más largo es el texto: la atención compara cada token con todos los demás.
Errores comunes
- Confundirla con la atención humana: es un cálculo matemático.
- Pensar que el modelo presta la misma atención a todo el prompt: lo importante debe estar claro.
- Creer que más contexto siempre es mejor.
Preguntas frecuentes
¿Qué es self-attention?
Atención de un texto sobre sí mismo: cada palabra se relaciona con las demás de la misma secuencia.
¿Por qué los textos largos cuestan más?
Porque la atención compara muchos pares de tokens.
¿Qué artículo introdujo el transformer?
"Attention Is All You Need" (2017).
