O reversal curse em LLMs é real?
Afirmações de que modelos de linguagem grandes sofrem de uma “reversal curse” — falhando em inferir “B é A” a partir de “A é B” (por exemplo, mapear de “Tom Cruise é filho de Mary Lee Pfeiffer” de volta para “Mary Lee Pfeiffer é a mãe de Tom Cruise”) — provocaram debate sobre o que esses sistemas realmente aprendem. Comentadores discutem se isso é uma falha fundamental de dedução lógica, um artefato de como o treinamento armazena associações ou simplesmente um reflexo da ambiguidade da linguagem natural, em que “A é B” muitas vezes não implica uma relação reversível. O thread também explora paralelos com a memória humana, a diferença entre raciocínio em contexto e conhecimento “embutido” no treinamento, e os limites de usar modelos comerciais opacos e em constante mudança como o GPT-4 para tirar conclusões científicas gerais sobre as capacidades dos LLMs.
Realidade e Significado da “Reversal Curse”
- Muitos veem a “maldição” (falhar ao passar de “A é B” para “B é A”) como algo pouco surpreendente, dado o funcionamento de modelos de next-token e a assimetria da linguagem.
- Outros argumentam que, em casos de identidade (“X foi o nono chanceler”), a maioria dos usuários espera reversibilidade, então as falhas são um bug do ponto de vista de produto.
- Alguns dizem que o artigo exagera: o efeito é real, mas tem mais a ver com recuperação/representação do que com incapacidade de fazer dedução lógica.
Semântica de “é” e Linguagem Natural
- Vários comentários enfatizam que “A é B” geralmente não implica “B é A” na linguagem natural (“um pássaro é um animal” vs “um animal é um pássaro”).
- Distinções levantadas: “é de identidade” vs “é de predicação”; “A é B” vs “A é um B”; artigos definidos vs indefinidos.
- Outros respondem que o artigo foca formas claramente reversíveis como “X é o Y” ou papéis únicos (mãe/filho, chanceler número).
Treinamento vs Comportamento em Contexto
- Há forte consenso de que LLMs conseguem inverter relações de forma confiável quando ambos os lados aparecem no prompt; o problema surge na generalização no momento do treinamento.
- Alguns enquadram isso como “o modelo pode inferir B a partir de A, mas o processo de treinamento não armazena fatos de forma simétrica.”
- Debate sobre se treinamento é apenas “otimização burra” ou algum tipo de meta-aprendizado “inteligente”.
Comparações com a Cognição Humana
- Múltiplas analogias: flashcards de aprendizado de idiomas, direcionalidade do Anki, tip-of-the-tongue, memória assimétrica de papéis em filmes, “força = massa × aceleração” versus usar a fórmula ao contrário.
- Alguns argumentam que humanos também não obtêm reversões “de graça”, apenas após inferência explícita e prática.
- Outros contrapõem que, para muitas relações factuais simples, humanos são muito mais robustos e quase invariantes à ordem.
Prompting, Dados e Fine-Tuning
- Vários comentaristas enfatizam que fatos sub-representados, prompts ambíguos e conjuntos pequenos ou mal desenhados de fine-tuning amplificam o efeito.
- Exemplos mostram que a formulação (“é” vs “foi”, “oitavo” vs “nono”) e contexto extra podem mudar respostas de erradas para corretas.
- Alguns temem que isso torne modelos ajustados por fine-tuning frágeis para recuperação factual, mesmo que modelos base lidem com reversões em contextos ricos.
Contagem, Numeração e o Caso do Chanceler Alemão
- Um longo subthread examina respostas erradas sobre “o oitavo/nono chanceler federal da Alemanha”.
- Surgem divergências sobre se um titular “interino” deveria contar; alguns dizem que o modelo está claramente errado, outros dizem que a ambiguidade explica a escolha.
- De forma mais ampla, nota-se a dificuldade dos LLMs com questões posicionais/ordinais (por exemplo, “a quinta palavra de uma lista”) como uma fraqueza relacionada.
Explicações Mecanicistas e Arquiteturais
- Uma linha de discussão cita trabalhos que mostram camadas feed-forward funcionando como armazenamentos de chave-valor: tokens de sujeito fornecem chaves, valores armazenam fatos, e atenção mais frases de relação recuperam-nos.
- Nessa visão, reversões não são gratuitas: “B é A” precisa do seu próprio mapeamento chave-valor separado, então o armazenamento assimétrico é esperado.
- Alguns especulam que modelos bidirecionais (por exemplo, estilo BERT) poderiam se sair melhor, mas isso permanece incerto no thread.
Implicações Mais Amplas e Ceticismo
- Céticos dizem que o problema da reversão reforça que LLMs não “entendem” nem fazem dedução lógica geral, apenas completam padrões estatísticos.
- Outros argumentam que LLMs de fato aproximam raciocínio em contexto, mas o treinamento não explora essa capacidade para impor generalização simétrica.
- Há frustração com a extração de conclusões científicas fortes a partir de modelos proprietários e em constante mudança; surgem pedidos por estudos mais abertos e mecanicistas.
- Alguns concluem que o efeito é mais um detalhe a se ter em mente do que uma acusação devastadora; outros o veem como emblemático de limites mais profundos.