AI 拥有远比人脑大得多的工作记忆

AI 系统正越来越多地通过利用远超任何人类可处理的“工作记忆”和穷举搜索来解决数学问题,这引发了一个问题:它们究竟是在真正胜过数学家,还是只是更擅长记忆与执行。评论者争论,若机器生成的证明冗长到人类无法内化、也无法形成共享理解,那么它们是否仍具有科学价值;以及数学的真正瓶颈究竟是证明生成,还是人类的解释与信任。讨论还延伸到更广泛的问题:LLM 如何改变软件开发、什么才算智能或理解,以及在 AI 赋能的研究生态中,学术激励与负面结果如何发挥作用。

AI“智能”与记忆的性质

  • 核心争论:AI 与其说是在“胜过”数学家,不如说是在“记忆力更强”和“更能干”地压过他们,凭借巨大的上下文窗口和不知疲倦的穷举搜索。
  • 也有人认为这种区分是错误的:工作记忆和回忆本就是智能的核心部分,因此,远超人类的记忆与速度,实际上就是更高的智能。
  • 还有人指出,LLM 仍然存在工作记忆限制(上下文窗口、二次方注意力成本),而人类则通过纸张、符号系统和抽象能力来扩展自己的工作记忆。

数学证明、价值与可理解性

  • 对于那种极其冗长或高度复杂、以至于任何人类都无法消化的 AI 证明是否有价值,存在强烈分歧。
  • 一方观点:数学的价值在于人类共享的理解;一个没人能理解的证明等同于噪声。
  • 另一方观点:即便只有极少数或没有人类能理解其细节,黑箱但正确的结果(例如证明、被破解的密码系统、设计方案)在经济上仍可能有价值。
  • 还有几位强调,现代数学本就致力于压缩与抽象复杂性,以便更多人随着时间推移理解结果;AI 也许能帮助实现这一点,而不只是生成不可读的证明。
  • 讨论还涉及激励机制:人类很少发表负面结果,而 AI 系统可以大规模积累并复用失败的证明轨迹。

当前 LLM 的优势与不足

  • 优势:
    • 知识面极广;能跨子领域连接想法,并扫描大规模文献。
    • 在存在外部验证器(编译器、Lean、测试)时,代码和证明生成效果不错。
  • 不足:
    • 幻觉、缺乏常识、不一致,以及过度复杂或重复的代码/证明。
    • 不擅长抽象压缩(提取辅助函数、命名、简化设计)。
    • 在没有清晰奖励信号时,很难处理诸如追踪“谁说了什么”或微妙逻辑错误之类的细腻任务。

人类角色、“半人半机”系统与工作的未来

  • 许多人预见“半人半机”(human + AI)组合才是真正前沿:人类负责引导、判断和抽象;AI 负责搜索、机械性工作和大规模重组。
  • 有人担心人类会在认知上被边缘化,类似驯化或“智愚化社会”;也有人欢迎把认知劳动像体力劳动一样外包出去。
  • 对于“人类很快将无法对科学做出有意义贡献”的说法,存在怀疑;而另一些人则认为,从长期看这很可能成立。

对文章的元评论与批评

  • 有人把“不是在 out-thinking,而是在 out-remembering”这种表述称为修辞或心理安慰;也有人觉得它很有启发性。
  • 少数人指出,作者的网站更广泛的内容包含有争议的“种族科学”式材料,因此对其框架持怀疑态度,不过大多数讨论仍然集中在 AI 和数学上。