数学和理论计算机科学的十项进展
AI 系统如今正在自主证明数学和理论计算机科学中的长期开放问题,其中一些结果被人类专家认为足以达到费尔兹奖级别。评论者一方面对进展的显著加速感到兴奋,另一方面担忧数学家的职业前景、方法学的不透明、权力的集中,以及当证明由专有模型生成并在 Lean 等工具中验证时,如何归属作者身份或责任。许多人认为这表明通用 AI 能力已经跨过了一个重要门槛,同时也呼吁在“AI 驱动”的数学中建立更透明的评估与发表新规范。
对数学家和职业生涯的影响
- 有些人认为这是一场令人兴奋的数学扩展,它让数学走向主流,并在某些特定猜想一旦被解决后开启许多新方向。
- 另一些人担心“数学会走上国际象棋的道路”:少数顶尖研究者和 AI 实验室获得关注与资金,而大多数数学家失去职业路径和地位。
- 人们担心,传统上建立信誉的方式(例如出色的学生论文)会在结果更多地与算力获取相关而非个人才能相关时被贬值。
- 一个反复出现的主题是:数学(以及科学)并不是为了雇用人而存在,但人类层面的代价和“梦想的失落”却非常真实。
国际象棋及其他类比
- 许多发帖者拒绝将国际象棋作为类比:国际象棋是一个有限的观赏性游戏;数学则是广阔、开放且深度嵌入经济体系的。
- 另一些人则以国际象棋、围棋、编程作为先例:先是失望,然后出现新的“人机协作”形式。
成本、效率与透明度
- 引用的“低于 2000 美元”的 token 成本被认为在缺少总体实验背景时具有误导性:尝试了多少问题、重试次数以及人力投入都没有说明。
- 有人认为只有边际推理成本加监督成本才重要;也有人坚持,在与人类研究经费对比时,完整成本(包括人员、基础设施)才相关。
- 多位评论者呼吁严格披露方法学:尝试了多少个问题、每个问题的预算、以及运行框架细节。
证明助手、漏洞与可靠性
- Lean 形式化被视为强有力的保证,但这只针对形式化翻译;把非正式陈述映射到 Lean 的责任仍在于人类。
- 最近 Lean 内核漏洞的讨论(涉及一个伪造的 Collatz 反例)凸显了即便是证明助手也可能存在脆弱性,而且 AI 可能会利用微妙漏洞。
- 有人指出在 Lean 中仍然可以“作弊”(例如使用占位符),因此验证不存在此类捷径并不简单。
署名、归因与自我意识
- 对“系统的贡献”是否应当获得明确署名,还是应像计算器或起重机一样把 AI 纯粹视为工具,存在强烈分歧。
- 一派认为提示词很简单,而模型才是在进行真正的智力重活;把全部作者身份给人类是误导性的。
- 另一派强调人的意图、问题选择、解释以及更广泛的理解,才是数学署名的核心。
- 还有一场旁支争论是当前模型是否可能“有自我意识”;没有共识,而且连定义本身也存在争议。
这些进展的重要性与性质
- 几位熟悉计算机科学和群论的评论者表示,至少有些被解决的问题是重大、长期存在且由顶尖专家持续研究的;对人类而言,解决它们足以达到最佳论文甚至费尔兹奖级别。
- 另一些人则追问,这些成果究竟是真正的新思想,还是对已知技术的巧妙重组/穷举搜索。
- 有人指出,一旦已知某个反例,扩展它可能更容易,从而可能为新理论播下种子。
发表规范与可复现性
- 有人呼吁 AI 驱动的数学发展出自己的发表文化:像实验科学一样实现完整可复现性(模型、随机种子、提示词、编排方式)。
- 另一些人认为,如果 Lean 证明是可靠的,那么来源(提示词、模型版本)主要对 AI 基准测试有意义,而不太影响数学本身。
- 也有人担心,如果方法学不标准化,黑箱式证明可能在数学中制造一场“可复现性危机”。
更广泛的影响与优先事项
- 对社会影响的看法不一:有些人认为这清楚表明通用智能正在迅速进步;另一些人则将其淡化为狭窄的、重算力的能力。
- 也有人质疑,为什么如此多的 AI 努力投入到抽象数学,而不是现实中的危机(气候、粮食不安全);回应指出,这些更多是政治和协调问题,而不仅仅是技术问题。
- 还有关于这些成就是否已经符合 AGI 的争论,或者说 AGI/超级智能是否应当保留给那种能够例如自主发现新物理规律或持续自我改进的系统。
元话题:社区反应与“不断改靶”
- 有人观察到,每次出现新的 AI 里程碑后,人们都会反复提高对“什么才算真正智能”的标准。
- 另一些人则为这种做法辩护,认为在一个定义并不清晰的领域里,这只是合理的重新校准,而非恶意。
- 还有人注意到该帖子似乎被降权/下调排名,并将此解读为不适或否认;另一些人则指出 HN 排名机制本就不透明,提醒不要过度解读。