新理论表明 LLMs 可以理解文本

一套宣称大型语言模型可以“理解”文本的新理论框架,重新点燃了围绕 AI 中的理解与智能究竟意味着什么的长期争论。评论者一方面权衡证据:模型会构建隐式世界模型,并能灵活组合抽象“技能”,这种能力不太可能仅靠训练数据记忆得来;另一方面则批评它们仍只是强大的模式匹配器,在没有落地、自我意识或目标的情况下重组人类写作内容。整场讨论凸显了关于涌现、人类例外论,以及仅凭功能性行为是否足以把推理或理解等概念归于当前与未来 AI 系统的更深层张力。

链接和背景

  • 评论者补充了核心论文的缺失链接,以及几篇主张 LLMs 并不 理解的关键论文。
  • Quanta 这篇文章被视为一份通俗易懂的总结;讨论的重点在于这项理论究竟真正说明了什么。

“理解”是什么意思?

  • 许多人认为并没有一个严格、统一认可的定义;任何“LLMs 理解了”的说法都取决于所选择的操作化方式。
  • 有人说“达到人类水平的表现”是一个实用替代指标,但也有人反驳说人类之间差异很大,而且我们自己的认知也很难量化。
  • 还有少数人认为理解是分层次的,而不是二元的,并且它与任务表现相关,而不是某种内在本质。

世界模型、压缩与涌现

  • 一派观点认为,在信息论和压缩原则下,下一词预测器必然会隐式编码一个世界模型。
  • 另一些人承认确实存在某种世界模型,但强调其质量未知,而且主要仍然扎根于文本。
  • 有人引入“涌现”:复杂行为可以从简单的下一词预测中出现,就像心智会从神经元中涌现一样。

来自行为和论文技能模型的证据

  • “技能图” / “技能混合”框架被概述如下:文本需要多种抽象技能的组合;更大的模型在更多这样的节点上表现成功。
  • GPT-4 能够在新主题上混合多种推理风格(例如隐喻、物理、偏见)被引用为证据,说明它不只是一个“随机鹦鹉”。
  • 有人认为这是一种严谨的方式,可以展示可组合、可泛化的能力;也有人说这仍然无法解决“理解”问题。

怀疑观点:鹦鹉学舌、数据与落地

  • 一条强烈的批评线索是:智能存在于经过筛选的训练语料库中;LLMs 只是压缩并重放它,而没有觉知、目标或“为什么”。
  • 担忧包括:缺乏明确的自我知识(“你知道什么?”)、没有真正的有状态反馈循环、不能选择保持沉默、没有时间感,也没有物理落地。
  • 有人打比方说,这像填色书、泰国图书馆的文本工作者、指南针或手表:行为复杂,但并不意味着理解。

与人类认知的比较

  • 有人指出,人类在某种程度上也作为统计性的下一词预测器在运作,经常在没有完全反思性理解的情况下说话。
  • 另一些人强调差异:具身经验、丰富的多模态输入,以及未来可能出现的架构(多模态、持续学习、具身化)也许会缩小这种差距。

元层面与社会影响

  • 一些人把当前双方的论点都称为“信仰式”的;他们希望看到更多实证测试和理论。
  • 还有人认为这场争论在学术上意义有限:人们会把 AI 伴侣当作理解自己一样来对待,无论哲学上的结论如何。
  • 观点在“AI 恐慌”与“通向超人、通用能力的清晰轨迹”之间尖锐分化。