LLMs por Taxa de Alucinação

Afirmações de que o GPT‑4 e outros grandes modelos de linguagem agora alucinam em apenas 3% das vezes em tarefas de sumarização geram debate sobre o quanto tais benchmarks realmente significam. Comentadores questionam a metodologia (incluindo usar um modelo para julgar outro), discutem se “alucinação” ou “confabulação” é o conceito correto e observam que o desempenho cai fortemente fora de tarefas estreitas como sumarização. Muitos veem as alucinações como inerentes às arquiteturas autoregressivas atuais e destacam a necessidade de melhores formas de detectar, contextualizar ou redesenhar o problema antes de confiar em LLMs para usos de alto risco.

Natureza das “alucinações” de LLMs

  • Visão central: a previsão autoregressiva token por token produz inerentemente palpites; você não pode eliminar totalmente as fabricações.
  • Alguns argumentam que LLMs estão sempre fazendo o mesmo processo, então ou eles estão “sempre alucinando” ou o termo é enganoso.
  • Outros enfatizam que, embora o mecanismo seja o mesmo, os resultados diferem na correção factual; “taxa de alucinação” ainda é uma métrica útil.

Comparações com a Cognição Humana

  • Vários comentários observam que os humanos também “preenchem lacunas”, interpretam mal perguntas ou afirmam falsidades com confiança; suposições são necessárias para uma comunicação eficiente.
  • Há desacordo sobre se a inteligência exige preencher lacunas ou saber quando dizer “não sei”.
  • Alguns comparam o comportamento das LLMs às histórias de crianças pequenas ou a “brancos do cérebro” e confabulações, especialmente quando a memória/contexto é limitado.

Arquiteturas e Mitigações

  • Alternativas propostas: modelos que trabalham internamente por um tempo e então emitem uma resposta inteira em vez de fluxos autoregressivos.
  • Técnicas discutidas: chain-of-thought, autocrítica ao alimentar as saídas anteriores de volta, verificação iterativa até “convergência”.
  • Desejo por modelos que digam “não sei” com mais frequência, mas ceticismo de que as LLMs de hoje representem de fato conhecimento ou verdade internamente.
  • Ideias como um “token de backspace” ou RLHF mais agressivo para penalizar fabricações são levantadas, mas os dados e a implementação não são claros.

Debates de Terminologia

  • Muitos argumentam que “alucinação” é a metáfora errada; “confabulação” ou “palpite estatístico” é preferível.
  • Objeção de que “alucinação” antropomorfiza sistemas que apenas modelam linguagem, não percepção ou verdade.

Escopo e Metodologia do Benchmark

  • O leaderboard é apenas de sumarização, que os comentaristas dizem ser uma tarefa relativamente baixa em alucinações; os números podem não se generalizar.
  • A detecção de alucinação usa outro modelo; críticos observam que, se a detecção baseada em modelo fosse totalmente confiável, em grande parte resolveríamos o problema.
  • É mencionada uma crítica externa à metodologia do benchmark; por isso, alguns atribuem peso limitado às porcentagens reportadas.
  • Observa-se que ~17% dos documentos foram rejeitados por pelo menos um modelo devido a filtros de conteúdo.

Diferenças entre Modelos e Confiabilidade Prática

  • A taxa de alucinação de ~3% do GPT‑4 em sumarização é amplamente posta em dúvida; usuários relatam taxas de erro muito maiores em perguntas de nicho ou técnicas, especialmente código (bibliotecas/funções inexistentes).
  • Alguns observam que Mistral e outros modelos produzem facilmente “absurdo plausível”, possivelmente por escolhas de RLHF.
  • Os comentaristas enfatizam que, para aplicações críticas, mesmo as melhores taxas atuais ainda são inaceitavelmente altas sem supervisão humana.