FunSearch:使用 LLM 在数学科学中发现新成果
DeepMind 新推出的 “FunSearch” 系统使用大语言模型迭代生成并演化简短的 Python 程序,在自动评分函数的引导下解决 cap sets 和 bin packing 这类困难的组合优化问题。评论者对于这是否体现了 LLM 带来的真正数学新洞见意见不一,还是主要体现了进化搜索只保留最佳代码变体的力量;他们指出,类似思路在遗传编程和归纳程序综合中早已存在。这场讨论也引出了更广泛的问题:在混合系统中应如何公平地归功于 LLM,它们到底在多大程度上“推理”,需要怎样的实验才能证明其相对传统方法的价值,以及这条路线对未来科学发现和 AI 能力意味着什么。
对 FunSearch 的总体反应
- 许多人认为结果令人震惊:LLM 引导的搜索为 cap sets 和 bin packing 产生了最先进的解法,击败了先前的计算求解器。
- 也有人认为这只是对遗传编程 / 启发式搜索的渐进式改进,而不是一场革命或“自火以来”的时刻。
LLM 实际在做什么
- 普遍认为真正的重活是进化搜索 + 评估器;LLM 主要是在提出代码编辑,而不是随机突变。
- 支持者认为 LLM 之所以关键,是因为它:
- 生成语法正确、看起来合理的程序。
- 避免了“冷启动”——此时大多数随机程序的适应度为零。
- 充当一种“有点像专家”的代码变异器,是编程层面的通用问题解决者。
- 怀疑者指出:
- LLM 只看到代码片段和类型签名;它并不是组合数学领域的专家。
- 消融实验的对比对象是一个极弱的随机突变基线,而不是强大的、已有的遗传编程系统。
- 目前仍不清楚优势有多少是 LLM 特有的,又有多少来自纯粹的算力和搜索。
新颖性、外推与“随机鹦鹉”之争
- 有人认为这反驳了 LLM 只是复读训练数据的观点,理由是它展示了高维外推和明显新的数学构造。
- 也有人指出存在记忆化的证据,并强调“生成大量坏候选再用过滤器筛选”并不等同于真正推理。
- 大家普遍同意,即使 LLM 缺乏“真正理解”,它们仍然可以在实践中有用。
范围、限制与扩展
- FunSearch 在以下情况下效果最好:
- 存在快速且丰富的评估器。
- 问题可以被表述为在固定骨架内演化一个小代码内核。
- 该方法明确不适合诸如证明生成之类的问题,因为那里很难定义丰富的数值评分。
- 若干评论希望系统能够演化形式化证明(例如在 Lean 中),或者整合更多符号推理和经典程序综合。
- 也有人指出一些缺失的实际部分:仓库里没有 LLM 接口的参考实现,而且目前还没有明确的第三方复现。
更广泛的含义
- 有些人将其视为对“LLM + 工具”或神经符号混合路线正确性的验证。
- 也有人强调这虽然令人印象深刻,但离奇点还很远;它主要是一种强大的搜索加速技巧。