我不同意 Geoff Hinton 关于“华丽版自动补全”的说法

关于大语言模型是否只是“华丽版自动补全”的说法,讨论将其与这样一个反驳进行比较:高度准确的下一个词预测可能需要真正的内部意义模型或“理解”。评论者探讨理解、智能和世界模型究竟意味着什么,把 LLM 与人类认知、博弈型 AI 和传统软件进行比较,并强调当前的缺口,如长期记忆、规划、目标导向行为和可靠抽象。尽管许多人同意如今的模型仍未达到类似人类的推理水平,但对于通过扩展规模和更好的训练是否最终能弥补这一差距,或是否需要根本不同的新架构,存在分歧。

ChatGPT 风格与提示词

  • 一些评论者不喜欢 ChatGPT 默认的冗长和列表化风格。
  • 讨论中的缓解方法包括:自定义指令(“请非常简洁”)、明确的语气/长度提示,或后续要求“改写得不那么啰嗦”。
  • 有人指出基础模型本身更不啰嗦,而 RLHF 会放大礼貌和篇幅。

“自动补全”与“理解”

  • 一方观点:下一词预测可以仍然只是统计性的;准确预测并不需要“理解”。
  • 另一方认为,高度有能力的预测实际上需要构建内部抽象和世界模型,这本身就是一种理解。
  • 多人指出“理解”定义并不明确;根据定义不同,人类和 LLM 可能都理解,也可能都不理解。
  • 有人说,坚持只有人类才能“真正”理解,只是人类中心主义或语义争论。

人类认知的类比

  • 许多人指出,人脑在语言和感知中也会进行预测处理;日常说话的很多部分感觉就像“自动补全”。
  • 这里区分了快速联想式思维(System 1)和缓慢审慎的推理(System 2);有人认为 LLM 主要表现出类似 System 1 的行为,但偶尔会涌现出类似 System 2 的推理。
  • 也有人强调,人类有目标、长期记忆,并且能在说话前提前规划;而 LLM 缺乏内在目标和持续记忆。

能力、泛化与局限

  • LLM 表现良好的例子:新的数学题、编程帮助、逻辑谜题(有时)、在对话中学习新语法。
  • 反例:对谜题的轻微变化就脆弱失效、视觉抽象基准(例如 ConceptARC),以及表明其概念理解浅薄的“低级”数学或代码错误。
  • 有几位评论者提到缺乏洞察力:人类有时会重构或直接拒绝问题(例如建议采用更简单的非编码方案),而 LLM 往往会停留在既定任务内。
  • 幻觉以及难以说出“我不知道”被强调为关键局限。

架构、马尔可夫过程与信息论

  • 关于 transformer 是否“只是马尔可夫链”的争论:
    • 一方认为,有限上下文和对下一步的依赖看起来是马尔可夫式的。
    • 另一方认为,内部状态以及对整个上下文的注意力违反了简单的马尔可夫假设;把它们称为马尔可夫链被认为过于简化。
  • 有人认为,在文本上最小化交叉熵并结合正则化,实际上会迫使模型朝向对世界底层“信息图谱”的压缩表示。

世界模型、语义与真理

  • 关于 LLM 是在建模世界,还是只是在建模人类文本中的模式,存在分歧。
  • 一种观点认为,它们是在“映射地图”(关于现实的文本),而不是现实本身,类似于一个复杂的中文房间。
  • 也有人回应说,人类也只能通过有限的感官数据和语言接触世界;两种系统都从间接证据中构建内部模型。
  • 讨论还涉及 LLM 跟踪真与假的能力,并引用了线程内关于校准与不确定性的工作;怀疑者则回应说,这些模型仍然缺乏对真理的扎根概念。

AGI、标准后移与类比

  • 大多数人同意当前的 LLM 不是 AGI;尽管基准分数很强,它们仍会以“很蠢”的方式失败。
  • 有人认为,批评者在能力达成后不断“移动门槛”(例如要求发明新的数学)。
  • AlphaZero/围棋被用作类比:带有明确目标的自我对弈展示了强大的预测和模式识别能力,但也有人提醒,游戏是封闭世界,不同于开放式的语言和现实。

元讨论:“自动补全”框架是否有用

  • 有人认为“华丽版自动补全”虽然带有贬义,但在技术上与强智能并不矛盾:足够强大的“自动补全”也可以包含深层推理。
  • 也有人觉得,与其争论标签(“自动补全”“理解”“智能”),不如更关注对能力和失败模式的具体、经验性评估。