Antes dos Transformers, redes neurais processavam texto palavra por palavra em sequência, o que dificultava capturar relações entre palavras distantes numa frase. O mecanismo de atenção permite que o modelo pese a importância de todas as palavras de uma vez, em paralelo.
Essa arquitetura, apresentada em 2017 num artigo científico do Google, é a base de praticamente todo LLM relevante hoje, incluindo a família Claude.