ChatGPT gera conjunto de dados falso para apoiar hipótese científica
Modelos de linguagem como o GPT‑4 agora conseguem gerar conjuntos de dados científicos com aparência realista que parecem apoiar uma hipótese escolhida, levantando preocupações sobre o quão facilmente pesquisadores poderiam fabricar evidências para artigos. Os comentaristas observam que fraude de dados e p-hacking antecedem a IA há muito tempo, mas argumentam que automatizar falsificações plausíveis pode ampliar problemas para a revisão por pares, paper mills e esforços de replicação já sobrecarregados. Outros apontam que dados sintéticos também têm usos legítimos e veem o problema central como incentivos acadêmicos quebrados e verificação fraca, não as ferramentas em si.
Âmbito da discussão
- A discussão foca menos em “alucinações” e mais em como os LLMs podem gerar rapidamente conjuntos de dados com aparência plausível que apoiam qualquer hipótese desejada, e no que isso significa para a prática científica.
“Isso é realmente novo?”
- Muitos dizem que a fabricação de conjuntos de dados não é novidade: há muito tempo as pessoas falsificam dados normalmente distribuídos ou outros dados simples com planilhas ou geradores de números aleatórios.
- Alguns argumentam que os LLMs בעיקר reduzem a barreira de esforço e de habilidade; quem frauda já tinha ferramentas fáceis.
- Outros contrapõem que tornar a fraude muito mais fácil e escalável (por exemplo, para paper mills) é uma mudança não trivial.
Impacto na integridade científica
- Vários observam que a maior parte das fabricações descobertas foi tecnicamente ruim; falsificadores competentes provavelmente passam despercebidos, então ferramentas melhores podem tornar a fraude de alta qualidade mais difícil de identificar.
- Alguns afirmam que uma grande parte da literatura existente já é fraca, sofre p-hacking ou é irreprodutível; isso é visto como um problema sistêmico de incentivos e revisão por pares, não algo específico de IA.
- Uma visão: a falsificação mais fácil talvez finalmente force a comunidade a adotar padrões robustos de reprodutibilidade.
- Outra visão: isso só aumentará o “lixo digital”, tornando a verdade ainda mais difícil de encontrar e verificar.
LLMs, verdade e confabulação
- Ponto repetido: LLMs são otimizados para produzir continuações plausíveis, não a verdade; “confabulação” é proposto como um termo melhor do que “alucinação”.
- Alguns enfatizam que esse comportamento é esperado, não um bug.
- Outros argumentam que os desenvolvedores de modelos estão tentando reduzir fabricações e tornar ferramentas específicas de domínio mais confiáveis.
Usos legítimos de dados sintéticos
- Vários observam que dados sintéticos são uma técnica estabelecida e valiosa em ML e em contextos de preservação de privacidade; dados falsos, mas plausíveis, são um recurso nesses casos, não um problema.
- A preocupação é especificamente com dados sintéticos não rotulados ou enganosos entrando no registro científico.
Possíveis mitigação e preocupações mais amplas
- Sugestões: maior ênfase em replicação/reprodutibilidade em vez de depender apenas da revisão por pares; melhores ferramentas (incluindo IA) para verificação automatizada de artigos e detecção de erros/fraudes.
- As preocupações incluem: argumentos cheios de citações, mas enganosos (“CheatGPT”), sobrecarga de informação e uma assimetria no estilo da lei de Brandolini, em que dados ruins se espalham mais rápido do que podem ser refutados.