Entenda como os transformers funcionam desmistificando a matemática por trás deles

Transformers, a arquitetura central por trás dos modelos de linguagem modernos, são vistos como algo enganadoramente simples no código e enormemente complexo no comportamento, o que leva a pedidos por explicações que unam tutoriais intuitivos e matemática rigorosa. Os comentadores trocam recursos sobre interpretabilidade mecanicista, positional encodings e attention, ao mesmo tempo em que corrigem concepções erradas sobre backpropagation, terminologia de redes neurais e problemas numéricos como a estabilidade do softmax. Além das clarificações técnicas, um tema recorrente é se o escalonamento dos atuais “preditores de próximo token” pode algum dia produzir “IA de verdade”, ou se serão necessárias novas arquiteturas com grafos de computação aprendíveis e capacidades de raciocínio mais fortes.

Reações de Alto Nível

  • Muitos acham difícil realmente “entender” transformers: modelos simples são interpretáveis, mas não são úteis, enquanto modelos úteis parecem grandes demais para compreender.
  • Comparações com “tutoriais de monads”: você precisa lutar com eles, e, quando finalmente os entende, fica difícil explicá-los claramente.
  • Alguns apreciam o artigo; outros acham que a formulação “a matemática por trás” exagera o nível de profundidade matemática.

Transformers, Attention e Grafos de Computação

  • Uma visão: o “mistério” é בעיקר trocar pesos estáticos de camadas por matrizes Q/K/V aprendidas e forte paralelismo; attention é vista como estruturalmente simples, mas rígida.
  • Contraponto: o que há de especial é o acesso total e sem perdas a todos os tokens anteriores, ao contrário de RNNs, que comprimem o histórico.
  • Debate sobre se o progresso futuro exige tornar o próprio grafo de computação aprendível; são levantadas questões sobre a discreteness do espaço de grafos e o treinamento baseado em gradientes.
  • As sugestões incluem algoritmos genéticos, architecture search diferenciável e mecanismos do tipo Hebb para conectar subgrafos.

Progresso, “IA de Verdade” e Uso de Ferramentas

  • Alguns argumentam que os LLMs atuais estagnam em torno de GPT‑3.5/4 e fornecem principalmente “compressão de informação” eficiente, não “IA de verdade”.
  • Outros argumentam que a funcionalidade melhorou claramente e que aprendizado de conceitos e raciocínio em múltiplas etapas (por exemplo, com ReAct/Tree-of-Thoughts) já vai além de simples consulta.
  • “IA de verdade” é definida de várias formas: raciocínio robusto em problemas inéditos, construção autônoma de planos ou sistemas capazes de projetar artefatos complexos do início ao fim.
  • Há forte apoio a aumentar os LLMs com ferramentas externas e simuladores, em vez de tentar emular CPUs/gates NAND dentro da rede.

Relação com o Cérebro e Redes Neurais

  • Há visões mistas sobre se o cérebro “usa transformers”: alguns dizem que não; outros apontam trabalhos mostrando representações parecidas com transformers, semelhantes a células de grade e de lugar do hipocampo.
  • Esclarecimento de que transformers são redes neurais treinadas com backpropagation, apesar de alguma confusão no thread sobre isso.
  • Algoritmos forward-forward e outros esquemas de aprendizado mais biologicamente plausíveis são mencionados como inspirações alternativas.

Matemática, Embeddings e Positional Encoding

  • Vários comentários pedem tratamento mais aprofundado de:
    • Tokenization versus embeddings e “dequantization”.
    • Positional encodings, por que sin/cos, escolhas de frequência e encodings aprendíveis versus fixos.
    • Papéis detalhados de dot products, softmax, scaling e residuals em attention.
  • Alguns elogiam uma folha de “Transformer em equações” de uma página como o tipo de matemática concisa que queriam.

Preocupações de Implementação e Questões Numéricas

  • Leitores apontam possíveis problemas de código nas conexões residuais do decoder e a ausência de layer norms.
  • Uma seção que atribui NaNs a “gradient explosion” é criticada; o problema real é descrito como ativações grandes e softmax numericamente instável.
  • Há pequena confusão sobre as fórmulas de positional encoding e a indexação; variações em relação ao código do artigo original são observadas, mas consideradas não críticas.

Next-Token Prediction e Generalização

  • Pergunta: como “apenas” preditores de próximo token conseguem lidar com identificadores inéditos ou seguir novos exemplos em contexto?
  • As respostas destacam:
    • Conceitos latentes de alta dimensão aprendidos (incluindo “gibberish/placeholder”) nos quais novas strings de tokens se mapeiam.
    • In-context learning e correspondência de padrões sobre sequências de tokens.
    • Ponto teórico: uma distribuição condicional correta de próximo token define implicitamente uma distribuição sobre sequências completas, capaz de representar comportamentos ricos.