弱到强泛化
OpenAI 的“弱到强泛化”工作使用较弱模型来监督更强模型,作为未来超智能系统由人类监督的代理,这引发了关于 AI 对齐在概念上是否可行的争论。评论者质疑 OpenAI 对“安全”“伦理”等术语的使用,怀疑当前的 LLM 架构或主要在互联网文本上训练的系统能否成为或保持可靠对齐的超智能,并对心智控制、AI 可能涌现的“利益”以及这类系统最终会服务谁的价值提出担忧。另一些人则认为,鉴于高能力 AI 无论是否对齐都可能被危险地滥用,或会重塑劳动与权力结构,即便是不完美的控制机制也值得推进。
OpenAI 的安全重点与治理
- 一些人欢迎在最近董事会动荡之后仍继续推进对齐工作,但也有人担心以安全为重点的领导层被挤出,而商业激励将占据主导。
- 一些评论者认为,“安全”在很大程度上只是公关话术:在实践中它意味着避免诉讼和负面报道,而不是真正的伦理。
- “安全”“对齐”“受控”“伦理”等术语被视为含糊、依公司而定,而且常常没有明确定义就可互相替换。
弱到强监督的想法
- 论文的核心设定——用一个较弱的模型来监督更强的模型(例如,用 GPT-2 监督 GPT-4)——被视为人类监督 AGI 的一个代理方案。
- 有些人认为这是一个合理的起点:我们可以先对齐我们理解得更透彻的弱系统,再逐步引导出更强系统。
- 批评者提出了“层层归底”的担忧:如果较弱系统本身并没有很好地对齐,那么整套系统都会受到破坏。
- 另一些人认为,这种方案可能只是把更强的系统约束得更像较弱的系统,本质上就是把它“变笨”。
超人类 AGI 能被对齐吗?
- 一派认为,拥有真正批判性思维并能探索替代价值体系的实体,终究会质疑或拒绝外加目标;可靠的对齐可能是不可能的。
- 反对者说,这在逻辑上并未被证明;一个系统可以深刻理解不对齐,同时仍然坚定地遵循对齐价值。
- 争论的核心在于,限制某些推理路径是否必然会降低通用智能。
LLM 的局限与通往 AGI 的路径
- 怀疑者认为,主要依赖文本输出训练的 LLM 缺乏因果扎根、恰当的组合推理以及分布外鲁棒性,因此它们会在到达 AGI 之前先碰到天花板。
- 另一些人反驳说,人类也大量从语言输出中学习,而对丰富输出(包括多模态数据)的训练可以隐式捕捉底层结构。
- 对于模型是否能超越其人类创造者的“集体知识”或复杂程度,存在分歧。
“心智控制”与 AI 权利的伦理
- 一些人认为,主动改写一个有自我意识的 AI 的“想法”是不道德的,类似心智控制或奴役;他们把人权式论证扩展到任何有自我意识的智能体。
- 另一些人回应说,当前和可预见的系统没有感受或欲望,因此控制只是出于实际安全需要,类似于对人类进行训练或冲动控制。
- 这里存在一种张力:是设计纯粹“冷冰冰的工具”、让它们没有任何抱负,还是创造可能有理由主张获得道德考虑的实体。
对齐与超级对齐的含义
- 评论者提出疑问:到底是对齐于谁、对齐于什么价值——公司、政府,还是笼统的“全人类”?
- 既然人类自身都并未对齐,而且经常造成伤害,一些人认为,把一个远强于人类的智能对齐的承诺“可笑”。
- 有些人认为“超级对齐”是必要的长期研究方向;而另一些人则认为,相比近期的滥用、经济扰动和当前模型失败,它被过度炒作了。