ChatGPT 生成支持科学假设的伪造数据集

像 GPT‑4 这样的语言模型现在可以生成看起来很真实的科学数据集,并使其似乎支持某个选定的假设,这引发了人们对研究者是否会更容易伪造论文证据的担忧。评论者指出,数据造假和 p-hacking 早在 AI 之前就已存在,但认为将看似可信的伪造自动化会让同行评审、paper mills 以及本就承压的可复现性工作面临更大的规模化问题。另一些人则指出,合成数据也有正当用途,并认为核心问题在于有缺陷的学术激励和薄弱的验证,而不是这些工具本身。

讨论范围

  • 讨论线程较少聚焦于“幻觉”,而更多关注 LLM 如何快速生成看起来可信、并且支持任何既定假设的数据集,以及这对科学实践意味着什么。

“这真的新吗?”

  • 许多人表示,伪造数据集并不是什么新鲜事:人们长期以来就会用电子表格或随机数生成器伪造服从正态分布或其他简单分布的数据。
  • 有人认为,LLM 主要只是降低了作恶的门槛和技能要求;原本不诚实的人早就有很容易使用的工具了。
  • 也有人反驳说,把造假变得更容易并可规模化(例如用于 paper mills)并不是微不足道的变化。

对科研诚信的影响

  • 几位评论指出,被抓到的数据造假往往在技术上都很拙劣;真正熟练的造假者可能不会被发现,因此更好的工具可能让高质量造假更难识别。
  • 有人认为,现有文献中相当大一部分本来就很薄弱、经过 p-hacking,或者无法复现;这被看作是激励机制和同行评审的系统性问题,而不是 AI 特有的问题。
  • 一种观点是:更容易造假也许最终会迫使学界转向更严格的可复现性标准。
  • 另一种观点则是:这只会增加“数字垃圾”,让真相更难被找到和验证。

LLM、真相与编造

  • 一个反复出现的观点是:LLM 的优化目标是生成看起来合理的延续,而不是真相;与“幻觉”相比,“编造(confabulation)”可能是更合适的术语。
  • 有人强调,这种行为是预期之中的,并不是 bug。
  • 也有人认为,模型开发者正在努力减少伪造,并让特定领域工具更可靠。

合成数据的正当用途

  • 几位评论指出,合成数据在机器学习和隐私保护场景中是一项成熟且有价值的技术;在这些场景里,虚假但可信的数据反而是一个特性,而不是缺陷。
  • 令人担忧的地方特指未经标注或带有欺骗性的合成数据进入科学记录。

可能的缓解措施与更广泛的担忧

  • 建议包括:比起仅依赖同行评审,更强调重复实验/可复现性;以及使用更好的工具(包括 AI)进行自动化论文审查和错误/造假检测。
  • 担忧还包括:充满引用但误导性的论证(“CheatGPT”)、信息过载,以及类似 Brandolini 定律的非对称性——坏数据传播的速度往往快于对它的反驳。