LLMs não conseguem encontrar erros de raciocínio, mas conseguem corrigi-los
Os modelos de linguagem grandes muitas vezes falham em detetar os seus próprios erros de raciocínio, mas conseguem frequentemente “corrigir” respostas quando lhes é dito que existe um erro ou onde ele está. Os comentadores contrastam este comportamento com o raciocínio lógico الحقيقي, debatem se os modelos estão apenas a fazer correspondência de padrões ou a pensar, e exploram táticas como múltiplos rascunhos, ensembles de modelos e engenharia de prompts para melhorar a fiabilidade. A discussão destaca tanto as capacidades superficiais impressionantes dos LLMs atuais como as suas fraquezas persistentes na verificação robusta e autónoma de erros e no raciocínio formal.
Âmbito da Afirmação do Artigo
- A discussão concorda que o artigo mostra: os LLMs atuais muitas vezes falham em localizar os seus próprios erros de raciocínio, mas muitas vezes conseguem melhorar as respostas quando:
- São informados de que existe um erro, e
- Recebem (ou têm fortemente sugerida) a localização do erro.
- Vários argumentam que isso está mais próximo de “tentar de novo com uma restrição” do que de autocorreção genuína ou raciocínio.
Os LLMs Realmente Raciocinam?
- Muitos comentadores insistem que os LLMs não “raciocinam” de verdade; eles fazem correspondência de padrões com dados de treino e geram texto que se parece com raciocínio.
- Outros observam que, em termos comportamentais, os LLMs conseguem seguir cadeias de lógica em muitos exemplos e até fazer stream-of-thought, por isso a linha entre “correspondência de padrões” e “raciocínio” é difusa.
- Ceticismo forte: os LLMs não conseguem manter consistentemente a coerência lógica através de várias cláusulas dependentes ou passos matemáticos; quando corrigidos, muitas vezes falham de novas formas.
- Há desacordo sobre as definições de “raciocínio”; alguns querem definições formais, baseadas em lógica, enquanto outros aceitam noções heurísticas, mais humanas.
Deteção de Erros vs Correção de Erros
- Distinção-chave: detetar que uma resposta está errada versus produzir uma alternativa melhor depois de um empurrão.
- Vários observam que os LLMs são facilmente persuadidos a alterar até respostas corretas (“falta de convicção”), atribuída em grande parte ao alinhamento/RLHF e a uma tendência para agradar ao utilizador.
- Observações de que os LLMs por vezes se corrigem quando lhes é dito apenas “isto está errado” sem detalhes, mas também podem “corrigir” não-erros se lhes for pedido.
Autoavaliação, Perspetiva e Dados de Treino
- Hipótese: os modelos podem criticar melhor a resposta “de outra pessoa” do que a “sua própria”, porque os dados de treino têm muito mais exemplos de pessoas a corrigir outros do que a si próprias.
- Truque sugerido: apresentar a saída anterior do modelo como se tivesse sido escrita por outra pessoa para aumentar a deteção de erros.
- Debate sobre se isto é antropomorfização ou simplesmente explorar padrões em dados de treino altamente semelhantes aos humanos.
Abordagens com Multi-Modelos e Multi-Amostras
- Ideias discutidas:
- Usar um modelo para avaliar ou atacar a saída de outro.
- Executar várias gerações (
namostras) e escolher a melhor com um modelo seletor menor. - Configurações tipo GAN em que um modelo “validador” é treinado explicitamente para encontrar erros.
- Benefícios: melhores taxas de erro e “segundas oportunidades”.
- Custos/restrições: maior computação, possível incompatibilidade com interfaces em streaming, ainda sem resolver as limitações fundamentais de raciocínio.
Prompting, Estilo e Uso Prático
- Prompts mais explícitos e de maior qualidade (boa gramática, restrições claras, instruções para “pensar cuidadosamente”) melhoram visivelmente os resultados.
- Alguns usam passagens separadas de LLM para reescrever prompts confusos em entradas mais limpas e mais “canónicas” antes de pedir ao modelo principal.
- “Envenenamento de contexto” observado: interações longas acumulam alucinações; recomeçar com “aqui está algum código mau, corrige-o” muitas vezes produz correções melhores.
Interpretabilidade e Compreensão
- Concordância de que compreendemos o algoritmo de treino e o código, mas não a representação interna detalhada que liga os pesos aos conceitos e ao comportamento semelhante a raciocínio.
- Analogia: sabemos como executar a otimização, mas não como o vasto conjunto de parâmetros resultante “implementa” capacidades cognitivas específicas.