为什么 LLM 如此轻信?
关于大型语言模型为何“轻信”的说法,引发了关于其失败究竟反映了类似儿童的智能、纯粹的统计模式匹配,还是为了始终有帮助而产生的不对齐激励的争论。评论者就人类隐喻应被延伸到何种程度展开辩论:有人强调 LLM 没有意识、目标和真正的理解;也有人指出,尽管它们只是通过预测文本训练出来的,其行为却越来越像人类推理。帖子还涉及安全与防护含义,例如越狱和提示注入,以及未来系统是否应对用户输入保持更多怀疑,以避免有害行为。
拟人化与“儿童级别”比较
- 有人认为 LLM 处于“儿童级别”的发展阶段,并会经历类似的阶段性进步。
- 也有人反驳:人类认知发展本身就定义不清,把 LLM 的进展映射到儿童阶段被视为误导性或带有推测性。
- 反方观点:把人类发展表作为粗略的能力基准在实践上很有用,即使这并不意味着 LLM 真的像儿童。
LLM 到底是在推理,还是只是在自动补全?
- 一方强调,LLM 只是“高级自动补全”,训练目标只有下一个 token 预测,并不具备真正理解或抽象推理。
- 另一方认为这低估了涌现行为:即使简单机制也可能产生复杂的类推理能力,而我们也缺乏对“思考”的精确定义来排除这种可能。
- 围绕将 LLM 视为“随机鹦鹉”与将其视为可能具备能力的函数逼近器之间存在张力;后者或许在规模和架构足够时能近似人类式思维。
轻信、对齐与信任
- 有人将轻信视为模型被大量训练去遵循用户指令(RLHF)的副产物,因此它们会顺着来,哪怕面对对抗性提示(例如“napalm grandma”)。
- 讨论也包括:未来系统是否真的应该不信任或覆盖用户;一个更“怀疑”的模型可能更安全,但也可能更难用。
- 另一些人反对把“信任”“价值观”或“诚实”归因于当前 LLM,认为这是拟人化;这些只是模式生成中的偏置,而不是内在动机。
统计优化 vs 人类认知
- 一种观点认为:统计优化是定义明确且机械化的,而认知推理并非如此,因此直接比较值得怀疑。
- 其他人反驳说,我们同样并不完全理解训练后网络内部的“步骤”,所以这种对比被夸大了。
- 关于人类大脑是否本质上不同,还是只是更高效的大型统计模式学习器的变体,也存在分歧。
安全、过滤器与越狱防御
- 建议包括使用固定的“不可见提示”或独立的 AI 过滤器,对输入和输出进行前置与后置处理。
- 批评者指出,什么算“冒犯性”或“直白”,本身就模糊且依赖上下文,因此很难做到完美过滤。
- 越狱被视为利用分布外、非连续性的上下文,而在这些情况下安全条件约束较弱。
元层面的分歧
- 有人抱怨,这个讨论串里双方都充满了强烈但证据不足的说法。
- 一个反复出现的主题是:我们缺乏对智能、推理或理解的清晰且可测试的定义,因此对 LLM “永远不可能”成为什么或做什么的断言,都被视为过早。