扩展规模会奏效吗?
关于仅靠扩展大型语言模型是否能带来通用人工智能的争论,核心集中在数据限制、架构缺口,以及“智能”究竟意味着什么。怀疑者指出,LLM 对数据需求极高、规划和推理能力薄弱、缺乏持续学习,并对“涌现能力”是否真实持怀疑态度,认为需要新的架构或具身系统。乐观者则反驳说,更好的数据、多模态训练、工具使用和自我博弈——再加上未来的算法进步与巨额投入——仍可能推动当前路线走向或超越人类水平的能力。
争论范围
- 讨论集中在,扩展当前的 LLM(更多数据、参数和算力)是否能通向 AGI,还是会遇到需要新思路的硬性上限。
- 许多人区分“有用的工具”(已经实现)和“AGI”(定义不清,往往隐含为类人或超越人类)。
扩展、数据与限制
- 一方强调“苦涩的教训”:更多数据和更大的模型持续带来更强能力;当前模型很可能训练不足,而且主要只是文本模型。
- 另一些人认为数据是硬瓶颈:有人声称距离缩放定律所暗示的数据量还差几个数量级,而 100,000× 更多数据并不是小事。
- 对于私有公司数据(邮件、文档、通话、会议)以及合成数据是否足以弥补这一差距,存在分歧。
- 也有人指出,数据质量、整理、排序,以及合成数据蒸馏(例如更小的模型击败更早的大模型)在此阶段可能比单纯的数据量更重要。
架构、推理与泛化
- 怀疑者称,用下一词预测训练的 transformer 主要是在插值、记忆和模式组合;它们缺乏真正的外推、稳健推理、规划和长期记忆。
- 规划任务、PR review 基准上的失败,以及脆弱的推理能力,被用作仅靠扩展规模可能无法解决这些缺口的证据。
- 其他人则以实际体验反驳:LLM 能解决新的编码任务,能处理私有代码库,并表现出跨语言和多模态行为,看起来像真正的泛化。
- 关于“涌现能力”也存在争论:有人认为那只是由指标选择造成的幻象;也有人指出了清晰的质变(例如多语言响应、代码生成)。
人类智能 vs. LLM
- 对比强调,人类从少得多的数据中学习,且来自丰富的多模态流,并通过多种学习范式(无监督、RL、主动学习等)进行学习。
- 有人认为人类本质上就是高级序列模型;只要规模足够大、输入更丰富,机器中也可能出现类似属性。
- 另一些人则指出,大脑复杂性、具身性、本能、情感和意识在本质上不同;他们怀疑文本预测器若没有新机制(规划循环、在线学习、与物理世界交互)就无法达到 AGI。
炒作、影响与发展轨迹
- 普遍认同 LLM 已经带来重大价值:自然语言接口、摘要、语义搜索、代码辅助以及任务自动化。
- 对炒作周期的看法分歧:有人认为我们仍在攀升;也有人认为对 AGI 的过度承诺是为了维持融资。
- 一个常见的中间观点是:未来“类 AGI”系统很可能是复合体——LLM 加上工具、记忆、模拟器和推理引擎——而不是单纯依赖某个更大的单一模型。