立场:LLM 无法“跳跃”

一篇主张大型语言模型无法做出爱因斯坦式“直觉飞跃”的立场文章,引发了关于当前 AI 系统是否结构性地只能做模式匹配和演绎推理的讨论。评论者质疑“溯因式、改变世界的洞见”是否真的需要感官锚定或物理直觉,并指出多模态模型、智能体系统以及近期数学成果表明能力可能会继续扩展。许多人认为,真正悬而未决的问题是如何严格定义和衡量这种“跳跃”,以及未来是否需要新的架构或训练范式,而不只是更大的 LLM,才能实现它们。

“LLM 无法跳跃”这一主张的范围

  • 讨论的核心是:当前 LLM 是否能进行类似广义相对论关键洞见那样的“溯因”式飞跃(提出新的基础性假设)。
  • 许多人认为这篇论文主要是一篇立场文章,并没有定量基准或对“跳跃”的明确操作化支撑。
  • 也有人喜欢演绎、归纳、溯因的框架,但质疑溯因是否足够定义清楚,以至于能支持“结构性无能力”的说法。

感官锚定、世界模型与直觉

  • 一种论点是:重大的理论飞跃(例如相对论)依赖具身的、由感官锚定的思想实验;纯文本 LLM 缺少这一点。
  • 反对意见包括:
    • 人类在数学和计算机科学中会在几乎没有直接感官联系的情况下做出抽象飞跃。
    • LLM 可以运行基于文本的思想实验,并且在某种程度上已经能处理物理直觉。
    • 多模态模型,以及带有工具或模拟器的智能体系统,可能已经接近世界模型。
  • 几位评论者认为,专门的世界模型和物理反馈回路很有前景,但当前结果总体上对通用推理来说仍然喜忧参半,甚至“糟透了”。

历史与物理细节争议

  • 多位评论者认为,论文过于简化了相对论、洛伦兹变换以及爱因斯坦影响来源的历史。
  • 关于等效原理究竟有多“直观”也存在争论;有些人觉得它显而易见,另一些人则认为它极其反直觉。
  • 更广泛的一点是:许多伟大突破都是在活跃研究生态上逐步推进的结果,而不是某种孤立的神秘飞跃。

实证测试与数据/时间限制

  • 提议的实验包括:
    • 只用 1980/1990 年前或维多利亚时代的文本训练现代 LLM,看看它能否“重新发明” LLM 或现代物理。
    • 用具有更早截断时间的未来 LLM 去复现近期的“跳跃”论文。
  • 讨论中指出的挑战包括:互联网前训练数据稀缺、现代概念泄漏,以及历史文献在保存上存在的回溯偏差。

能力、局限与“不断挪动门槛”

  • 有人认为,过去每一次“LLM 做不到……”最终都变成了“LLM 能做到,只是做得不好,随后随着规模扩大变得更好”,因此笼统的不可能论值得怀疑。
  • 另一些人坚持认为,目前仍有明确限制:长篇数学证明、无监督代码库维护、可靠的自生成训练数据(模型崩塌),以及在幽默或科学中产生真正的新颖性。
  • 还有人把 LLM 看作强大的“语言计算器”,它们增强的是人类的直觉与创造力,而不是替代它们;即使模型本身不能,人类+LLM 也许会共同完成这些飞跃。