美国军方在使用生成幻觉情报报告后险些酿成大祸

一份 AI 生成的情报报告近日险些让美国军方准备武装拦截一艘被其错误认为载有运往伊朗的核材料的中国船只,这重新引发了人们对高风险战争中自动化系统的担忧。评论者将这次险情与此前 AI 辅助目标选择的错误联系起来,例如伊朗女生学校爆炸案,并认为军事和政治领导人可能会用“AI 犯了错”来推卸战争罪和错误决策的责任。这场讨论凸显了对过度信任不透明 LLM 的更深层担忧、人类监督的削弱,以及有缺陷或带偏见的机器输出可能在任何假想超级智能出现之前就引发现实世界灾难的风险。

AI 在目标识别与情报中的使用

  • 讨论聚焦于一起据称的事件:美国军方几乎基于一份 AI 生成的、错误的情报报告拦截一艘中国船只。
  • 许多人认为,这证明把高风险决策交给 LLM 是鲁莽的,尤其是在操作者过度信任输出时。
  • 也有人认为,AI 只是长期以来有缺陷的情报工具链中的最新一环;核心问题在于人类误用以及机构层面对“寻找目标”的压力。

问责、战争罪与“遮羞布”

  • 强烈担忧是,AI 会成为暴行的替罪羊(“是 AI 给了错误情报”),从而进一步削弱本已薄弱的战争罪问责。
  • 另一些人回应说,审查确实存在,但问责并不存在;AI 并不会从根本上改变这种动态。
  • 关于伊朗近期学校爆炸的争论:
    • 一方称,AI 辅助目标选择(Palantir/Project Maven)锁定了该目标,且审查单元已被拆除。
    • 其他人怀疑这是“AI 洗白”:引用 AI 只是为故意或至少是疏忽的打击提供遮掩,或者怀疑 AI 根本没有参与。

升级风险与历史类比

  • 有人将其与核战争边缘的险情相比(例如苏联早期预警误报)以及第一次世界大战的导火索;一份幻觉出来的货运清单差点引发冲突,被视为同样荒诞且危险。
  • 几位评论者指出,如果处理不当,这本可能引发美中对抗,说明威慑体系有多么脆弱。

可靠性、“幻觉”与技术争论

  • 关于 LLM 的“幻觉”是什么,下面展开了长篇讨论:
    • 有人说,这只是下一 token 预测中的统计误差,是其固有属性。
    • 也有人认为,“幻觉”只是营销话术,淡化了真实错误并转移责任。
  • 对 LLM 被理解到什么程度存在分歧:从“简单的向量数据库,失败模式已知”到“深度不透明、其涌现行为我们几乎难以理解的系统”。
  • 共识是:在关键领域,没有经过严格的人类验证,就不应把它们当作权威。

更广泛的 AI 治理与社会问题

  • 担忧在于,AI 带来的灾难未必来自其变得超级智能,而可能来自它让过于自信、懒惰或受政治驱动的人更快做出更糟的决定。
  • 有人将此联系到更广泛的美国军国主义、情报政治化(例如伊拉克大规模杀伤性武器)以及当前政治领导层。
  • 也有人强调必须始终让人类牢牢参与其中,要求审计轨迹/思维痕迹,并抵制把“AI 干的”正常化为借口。