为 LLM 辅助的生物威胁创建构建早期预警系统

OpenAI 关于构建“早期预警系统”以识别大型语言模型辅助生物威胁创建的研究,引发了人们对当前模型实际能力以及公司动机的怀疑。评论者指出,GPT‑4 在帮助专家完成实验室式生物任务方面只带来很小且在统计上不显著的提升,而现实中的生物武器开发仍面临很高的实际障碍。许多人认为这项工作被过度炒作,或是为了监管俘获与公关;不过也有人认为,研究未来更强大的 AI 系统如何放大严重生物风险,仍然是有必要的。

感知到的动机与监管俘获

  • 许多人认为这项工作更像是面向监管者的公关和“制造恐慌”,而不是真正的风险分析。
  • 常见说法是:OpenAI 夸大危险,是为了证明实施严格监管的合理性;这种监管会偏向封闭的 SaaS 式模型,并提高竞争对手,尤其是开放权重项目的合规成本。
  • 有人把这与过去试图监管加密技术的做法相比,并把围绕大流行的“FUD”视为监管俘获的工具。
  • 也有人反驳,认为在更强大的 AI 出现之前先在较弱系统上练习是理性的,而把所有 x-risk 担忧都当作营销噱头来否定是浅薄的。

研究结果、统计与能力

  • 评论者指出,测得的改进(准确性/完整性)在统计上并不显著,这削弱了关于当前生物威胁提升能力的强烈说法。
  • 有人提到 OpenAI 自己的文本也承认了这一点,但论文标题和措辞仍然显得危言耸听。
  • 还有人批评研究设计:没有像“能访问一个小型研究图书馆”这样的强控制条件,设置无法复现,而且 GPT-4 没有工具/浏览能力。

LLM 辅助生物威胁的现实性

  • 几位生物学家 / 实验室相关人士强调,“指令”并不是瓶颈;真正困难的是实验室执行、污染控制、设施访问和测试。
  • 培养细胞和基础病毒学步骤被描述为本科生水平;从 OpenAI 的 SVG 图片中恢复出的被遮盖内容被认为很平淡,遮盖可能更多是出于观感而非真正敏感性。
  • 也有人反驳说,成本下降(例如按服务订购合成)降低了门槛,而且序列筛查并不完整或不一致,因此提高门槛仍然很重要。

AI 能力、推理与炒作

  • 许多人认为当前 LLM 在合成化学等领域会严重幻觉,难以胜任复杂技术工作,更像是“华而不实的自动补全”或“实习生”,最适合做模板性工作、头脑风暴和文档编写。
  • 另一些人则认为它们已经能在需要推理的任务上带来真实提升,并且现在就否定它们未来可能带来的危险为时过早;把 GPT-4 的局限外推为“AI 永远做不到 X”被指出是天真。
  • 围绕 LLM 是“推理”还是只是模拟推理的长期元争论仍在继续,没有共识。

更广泛的 AI 风险与即时危害

  • 有些人认为对存在风险的关注缺乏证据,并且分散了对虚假信息、偏见固化和劳动替代等具体问题的注意力。
  • 也有人认为,即使是极小概率的灾难性 AI 结果,也足以证明开展准备性工作是合理的,同时承认当前模型还没有构成这些威胁。