Como funcionam os transformadores em IA: atenção, tokens e camadas
Do mecanismo de self-attention aos blocos de encoder e decoder, o que acontece dentro do modelo quando você digita uma frase.
Até 2017, a maioria dos modelos de linguagem usava redes recorrentes (RNN) ou LSTMs.
O processamento era sequencial: a primeira palavra entrava, gerava um estado, esse estado ia para a segunda palavra, e assim por diante.
Isso criava dois limites concretos.
O primeiro é a perda de contexto em frases longas, porque a informação do início precisa sobreviver por muitos passos até o fim.
O segundo é a lentidão: como cada passo depende do anterior, a GPU não conseguia processar tudo em paralelo.
Oito pesquisadores do Google publicaram em 2017 o paper "Attention is All You Need".
A proposta era radical.
Abandonar a recorrência por completo e deixar o modelo olhar para todas as palavras ao mesmo tempo.
A arquitetura ganhou o nome de transformer, ou transformador. ## Self-attention: cada palavra olha para todas as outras O coração do transformador é o mecanismo de atenção.
Funciona assim: cada token da frase gera três vetores, chamados Query (Q), Key (K) e Value (V).
O Query de uma palavra é comparado com o Key de todas as outras, gerando uma pontuação de relevância.
Essa pontuação passa por uma função softmax, que transforma os valores em pesos que somam 1.
O resultado final é a soma ponderada dos vetores Value.
Na prática, ao processar a palavra "banco" em "sentei no banco do parque", o modelo dá peso alto para "parque" e baixo para palavras distantes e irrelevantes.
Isso é self-attention: o próprio texto define quais partes importam para entender cada trecho.
Os transformadores usam multi-head attention, ou atenção multi-cabeça.
Em vez de um único cálculo de atenção, rodam vários em paralelo, cada um com pesos diferentes.
Uma cabeça pode capturar relações gramaticais, outra relações de sentido, outra padrões de posição.
O resultado de todas é concatenado. ## Tokens e embeddings: o texto vira número O modelo não lê letras nem palavras inteiras.
O texto é quebrado em tokens, pedaços que podem ser uma palavra curta, um pedaço de palavra ou um sinal de pontuação.
Modelos como os da família GPT usam um método chamado byte-pair encoding (BPE), que aprende do próprio corpus quais combinações de caracteres viram um token.
Cada token é convertido em um vetor de números, o embedding.
É nesse espaço vetorial que o modelo calcula proximidade de significado.
Palavras com uso parecido ficam com vetores próximos. ## O detalhe que faltava: posição Sem recorrência, o transformador perde uma informação óbvia: a ordem das palavras.
"Cachorro morde homem" e "homem morde cachorro" teriam a mesma representação se nada indicasse a posição.
A solução é a codificação posicional, um vetor somado ao embedding de cada token para marcar onde ele está na sequência.
Modelos mais recentes usam variações como RoPE (rotary positional embedding), que codifica posição de forma relativa. ## Encoder, decoder e por que existem dois caminhos O transformador original tinha duas pilhas: o encoder, que lê a entrada inteira e constrói uma representação, e o decoder, que gera a saída token por token.
Essa divisão deu origem a três famílias de modelos: - **Somente encoder.** Usado para entender texto, não gerar.
O BERT é o exemplo mais conhecido, voltado para classificação, busca e análise de sentimento. - **Somente decoder.** Usado para gerar texto.
GPT, Llama e a maioria dos chatbots atuais seguem esse caminho. - **Encoder-decoder.** Usado quando há entrada e saída, como tradução e resumo.
O T5 é um exemplo. ## Por que isso escalou tão rápido Como todas as palavras são processadas em paralelo, a GPU trabalha de forma muito mais eficiente do que com RNNs sequenciais.
Isso abriu caminho para treinar modelos cada vez maiores.
O GPT-3, lançado pela OpenAI, tem 175 bilhões de parâmetros.
A ideia por trás dessa escala é que mais parâmetros e mais dados levam a melhor desempenho, um padrão conhecido como scaling laws.
Cada bloco do transformador repete a mesma estrutura: uma camada de atenção, seguida de uma rede neural feedforward, com normalização e conexões residuais entre elas.
Um modelo grande empilha dezenas desses blocos.
O GPT-3, por exemplo, usa 96 camadas. ## Perguntas que aparecem com frequência **O transformador entende o que escreve?** Não no sentido humano.
Ele calcula probabilidades de qual token vem em seguida, com base nos padrões vistos no treinamento.
A sensação de compreensão vem da consistência estatística desses padrões. **Preciso saber cálculo para entender a atenção?** Ajuda, mas não é obrigatório.
O conceito central, cada palavra pesando a relevância das outras, pode ser entendido sem as fórmulas de produto escalar e softmax. **Transformer e LLM são a mesma coisa?** Nao.
Transformer é a arquitetura.
LLM (large language model) é um modelo grande treinado sobre essa arquitetura.
Nem todo transformer é um LLM, e existem LLMs que combinam transformers com outras técnicas.
