Shreyas Naphad, autor do trabalho abaixo, desvendou as entranhas de como funciona GPT.

Acompanhei a jornada de um minúsculo token

Por um momento, imagine que a OpenAI nos entregue um cartão de embarque e nos permita entrar no GPT pelos próximos minutos.
Aqui, você pode acompanhar a jornada de qualquer componente de IA sobre o qual tenha curiosidade genuína.
Neste tour, vou escolher um pequeno token e acompanhar sua jornada por onde quer que ele vá depois que você digitar um prompt e pressionar Enter.
Para onde exatamente o token vai primeiro? Como ele é convertido em um número? E, por fim, como tudo isso leva o ChatGPT a gerar uma resposta?
Essa jornada tem como objetivo responder a todas as perguntas que você já teve.
O Portão de Entrada

E assim estamos prestes a entrar em um mundo onde vemos claramente como as coisas funcionam dentro do GPT.
O cartão de embarque permite que você digite algo e pressione Enter.
Então, vamos começar com um prompt simples.
O céu está azul.
Um prompt simples para começar. E você pressiona Enter.
Você sentiu alguma coisa? Houve alguma mudança na sua perspectiva? Bem, talvez não tenha havido nenhuma. Mas acredite em mim, a verdadeira jornada acaba de começar.
Assim que você pressionou Enter, a frase foi dividida em unidades menores. Essas unidades são chamadas de tokens. São os blocos de construção que o GPT usa para processar a linguagem.
Então, agora sua frase foi dividida em tokens como “O”, “céu”, “é”, “azul”.
Como eu disse, vamos acompanhar a jornada de um único token. Então, vamos escolher o token “céu” e acompanhar sua jornada.
Os enormes portões do GPT estão se abrindo e nosso minúsculo token “céu” está entrando correndo.
Escritório de Identificação
À medida que nosso token passa pelo primeiro portão, ele percebe que não pode se chamar “céu”, porque, neste mundo, ninguém entende inglês.
O modelo de IA só entende números. É tudo uma questão de números, não de texto. Portanto, nosso token está prestes a ganhar uma identidade totalmente nova.
E o que é isso?
Essa nova identidade é uma representação matemática chamada “embedding”.

Nosso token “sky” acabou de ser transformado em um vetor de alta dimensão. Portanto, esse vetor consiste em uma longa lista de números.
Esses números capturam o significado da palavra de uma forma que o modelo de IA consegue entender.
Esses números podem parecer sem sentido para nós, mas, para o modelo de IA, eles ajudam a compreender o significado de cada palavra.
Portanto, o vetor da palavra “céu” ajuda o modelo de IA a compreender seu significado.
Curiosamente, palavras com significados semelhantes acabam tendo representações semelhantes.
Por exemplo, nosso token “céu” fica mais próximo de palavras como nuvem, sol e atmosfera do que de maçã ou banana.
Em termos simples, “céu” e “nuvem” acabam tendo representações semelhantes porque estão fortemente relacionados.
A Sala de Atenção
Depois de receber uma nova identidade, nosso token entrou em uma sala e, curiosamente, essa deve ser uma das salas mais movimentadas que você já viu.
À medida que nosso token entra, ele é cercado por milhares de tokens.
E adivinhe só? Cada token está fazendo uma pergunta simples:
Em quem devo prestar atenção?

Esse é o famoso mecanismo de atenção.
O token “céu” não é quem decide o significado de toda a nossa frase. Ele analisará todos os outros tokens da frase original e, então, fará a mesma pergunta que os outros tokens estão fazendo.
Então, se você se lembra, nossa frase original era:
O céu é azul
Aqui, “céu” estabelece uma forte relação com o token “azul”. Isso ocorre porque esses dois tokens estão intimamente relacionados nesta frase.
Se houvesse uma frase diferente, como:
O céu sobre Marte parece diferente.
Como os tokens ao redor mudaram, o contexto da palavra “céu” também muda.
O mecanismo de atenção permite que cada token aprenda com todos os outros tokens relevantes presentes na frase
Nosso token “céu” compreendeu seu contexto e agora não representa mais apenas a palavra “céu”.
Agora, ele representa “céu” no contexto da sua solicitação.
Seguindo em frente, nosso token agora está diante do edifício mais alto do ChatGPT.
É a Transformer Tower.
Transformer Tower

Aqui estamos, em frente ao coração do GPT. Uma torre composta por dezenas de andares.
Este é o Transformer. É a arquitetura por trás dos modelos de linguagem modernos.
Nosso token entra diretamente na torre e chega ao primeiro andar.
Curiosamente, todos os andares parecem iguais. Mas não são.
Cada vez que o token sobe, ele compreende um pouco melhor o prompt original.
Em cada andar, duas coisas acontecem
A primeira é a atenção. Nosso token analisa todos os outros tokens novamente. Isso ajuda a decidir quais são os mais importantes e como eles se relacionam.
Em seguida, há uma rede feed-forward que refina ainda mais o token. Ela o ajuda a compreender padrões mais complexos.
Você também pode ver alguns sistemas de suporte que mantêm tudo funcionando perfeitamente. As conexões residuais garantem que informações importantes sejam retidas de form e. A normalização de camadas mantém os cálculos estáveis à medida que o token se move pela rede.
O token sobe para o próximo andar.
Depois, para outro e outro.
Andar após andar, o token continua se aprimorando. Agora, nosso token não se parece mais com a simples incorporação que recebeu na entrada.
Em vez disso, ele absorveu gradualmente o significado e o contexto de todo o prompt.
O que você precisa entender é que nenhuma camada isolada é responsável pela gramática, pelo raciocínio ou pelos fatos. Cada camada do transformador é responsável por aprimorar o token e criar uma compreensão mais rica dele.
Assim que o token chega ao topo da torre, ele não é mais o token simples que entrou neste mundo.
O token agora carrega tudo o que o modelo compreendeu sobre essa palavra dentro do contexto do seu prompt.
Pela última vez, o elevador à frente se abre.
Resta apenas uma sala.
A Câmara de Previsão
Chegamos ao destino final.
A Câmara de Previsão.

Foi toda uma jornada, desde a inserção do prompt até a saída da torre do transformador. Você pode pensar que o ChatGPT está pronto para responder à sua pergunta.
Mas ainda há mais uma surpresa.
Seguindo em frente, o modelo faz algo ainda mais simples.
Ele pergunta: “Qual é a próxima palavra provável?”
É isso.
Assim, usando tudo o que aprendeu dentro da Torre do Transformer, o modelo atribui uma probabilidade a cada token seguinte possível.
Por exemplo:
azul — 72%
claro — 12%
cinza — 8%
verde — 1%
Dependendo de parâmetros internos, o modelo pode escolher o token com maior probabilidade. Há momentos em que o modelo chega a selecionar um menos provável para produzir uma resposta mais criativa.
Um token é escolhido.
Esse token sai da câmara.
Então, algo interessante acontece.
A jornada recomeça do zero.
O novo token é adicionado ao prompt e passa pelo portão de entrada, pelo escritório de identificação, pela sala de atenção e pela Torre Transformer mais uma vez.
Esse ciclo se repete até que o modelo tenha gerado a resposta completa.
Portanto, podemos concluir que o ChatGPT nunca escreve um parágrafo inteiro de uma só vez.
Ele constrói cada frase, um token de cada vez.
O Portão de Saída
Mais tokens chegarão e completarão a mesma jornada. Aos poucos, eles formam palavras.
Essas palavras se transformam em frases e, depois, em parágrafos.
Por fim, elas se transformam na resposta que você vê na tela.
O que você vê como uma única resposta é, na verdade, milhares de pequenas previsões feitas uma após a outra. Cada uma delas segue a mesma trajetória e constrói o contexto a partir das outras.
Nosso token finalmente completou sua jornada.
Os portões do ChatGPT se abrem mais uma vez.
É hora de partirmos.
Conclusão
Agora que estamos de volta ao mundo real, tenho certeza de que o ChatGPT não parece mais tão misterioso.
O que acontece com o ChatGPT é que, por trás de cada resposta, há um sistema projetado.
Esse sistema usa matemática, probabilidade e padrões para prever um token após o outro.
Acompanhamos a trajetória do token “sky”.
Mas a verdade é que todo token seguirá a mesma trajetória.
De agora em diante, sempre que você digitar um prompt e pressionar Enter, saberá o que esperar.
Você viu a jornada do pequeno viajante neste mundo do GPT.
Esses viajantes são os tokens. Os tokens recebem suas identidades.
Em seguida, trocam informações dentro da Sala de Atenção antes de subir a Torre do Transformer.
Por fim, chegam à Câmara de Previsão.
Tudo isso acontece em uma fração de segundo.
E toda resposta começa com um único token.