了解更多关于 Claude 的数学能力

据报道,Anthropic 的一款未发布 Claude 模型通过重新组合近期人类成果,并在 Lean 中形式化证明,将与黎曼 zeta 函数相关的一个关键下界从 41.6% 提高到了 67.2%,即进一步提升了满足黎曼假设的零点比例。评论者争论这一数学进展究竟有多实质,究竟体现了真正的创造力还是极快的启发式搜索,以及除了简单的“鼓励”提示外,人类到底参与了多少。讨论进一步扩展到对 AI 拟人化的质疑、模型推动未来各领域突破的潜力,以及公司是否会将最强的研究型系统私有化保留。

数学进展及其背景

  • 讨论的焦点是一款尚未发布的 Claude 模型,它将临界线上 zeta 零点已被证明的下界从 41.6% 提高到了 67.2%。
  • 评论者指出,这建立在大量既有的人类工作之上;一篇 2025 年的预印本在额外假设下已经达到了 >66%,而 Claude 的关键一步是移除了这一条件。
  • 有人认为这“非同寻常”;也有人认为这只是数值上的渐进改进,而不是对黎曼假设本身的概念性突破。

蛮力与数学洞察

  • 争论点在于这究竟是“蛮力”还是启发式探索。
  • 许多人强调,在这里不可能进行穷举搜索;相反,模型重新组合了已有文献,生成了想法,并运行了大量脚本/检查。
  • 另一些人则认为,大规模搜索仍然占主导,只不过相较于人类而言是“时间压缩版”。

拟人化与“鼓励”

  • 文章中将人类主要发送鼓舞信息(“相信自己”“继续加油”)的描述引发了强烈反应。
  • 批评者认为这是拟人化且“令人反感”,并指出这贬低了人类经验。
  • 支持者则表示,这只是自然语言中的另一种引导信号;没人认为模型是一个人,而语言本身就天然带有拟人化色彩。
  • 有几条评论指出,模型往往会“过早放弃”,而鼓励似乎能推动它们超越训练数据中学到的悲观倾向。

AI 能力、创造力与局限

  • 一些人认为这表明我们正在接近,甚至已经处于“奇点”之中,预计 AI 很快就能处理重大的开放问题,甚至改进自己的算法。
  • 另一些人则反驳说:
    • 黎曼假设极其困难;这个结果并不意味着完整证明已经近在眼前。
    • 目前模型似乎仍局限于分布内的重组,而不是真正新的数学或创意文学。
    • Transformer 架构面临理论下界;提速和新范式都非同小可。

验证、发表与署名

  • Lean 形式化被视为防止“精心包装的幻觉”的保障,因此具有重要价值。
  • 有人担心 Anthropic 自托管的 PDF 以及非传统的作者/署名方式挑战了标准数学出版规范。
  • 也有人承认,公司里的数学家在实际上扮演了密集审稿人的角色,而非共同作者。

更广泛的影响与实际问题

  • 有人推测,顶级实验室可能会保留最强模型,以利用金融、医疗等领域的经济收益;但这又受到监管和竞争压力的制衡。
  • 反复出现的评论提到成本、token 用量以及多智能体系统的作用。
  • 一些用户还分享了自己用 Claude 解决数学/CS 问题的类似收获,但也指出了过度自信、催促“发表”以及需要严格外部验证等问题。