ARC-AGI 排行榜

一个新的 ARC-AGI 排行榜显示 Anthropic 的 Opus 5 远超其他模型,这引发了人们对 AI 基准仍有多可靠的质疑。评论者怀疑模型是否通过训练类似谜题、隐藏提示脚手架或泄露的测试数据被“benchmaxx”,并争论 ARC-AGI 的游戏化任务究竟是在有效衡量通用智能,还是只是在测某个狭窄体裁的表现。讨论串还涉及对闭源模型数据保留承诺的担忧、官方分数中排除 harness 和 agent 的问题,以及令人印象深刻的基准结果与前沿模型日常实用性之间日益扩大的差距。

Opus 5 的 ARC-AGI-3 表现与可信度

  • 评论者指出,Opus 5 与其他模型在 ARC-AGI-3 上存在巨大差距;一些人在亲自尝试这些任务后觉得这“太离谱了”。
  • 也有人质疑其可行性:据报道,当前公开尝试(例如 Kaggle)在大量算力加持下也只能拿到约 2%,而一些在公开子集上的“99%”说法被视为未经证实。
  • 还有人怀疑,这更像是对 ARC-AGI-3 风格任务的定向训练,而不是广义“通用智能”的跃迁。

Benchmaxxing、污染与私有数据集

  • 持续存在的担忧是,基准很容易通过记忆、特定体裁训练或隐藏指令来“benchmaxx”。
  • 有人认为 Opus 5 的表现(在模板化任务上完美,在新颖任务上更差)更像是在训练特定体裁的数据,而不是获得了更强的通用推理能力。
  • 也有人指出证明污染很困难;虽然存在私有/半私有划分,但仍可能通过痕迹、harness 读取或用户共享数据泄漏。

Harness 与单提示评估

  • 争论焦点在于是否允许模型外部的“harness”(使用工具的封装)。
  • 一方认为:harness 主导了性能,因此基准测到的是封装而不是模型;允许 ARC 特定的 harness 会破坏 AGI 中的“G”。
  • 另一方认为:人类本来就会使用工具;禁止 harness 会让基准与真实世界的智能体系统相关性变差。有人建议让模型在会话中自行构建工具。

数据保留、Fable 与信任

  • Fable 没有出现,是因为据称其数据保留政策使其无法安全使用半私有集合。
  • 多位评论者不信任大型实验室“不会用于训练”的保证,不过也有人指出,零保留的说法曾在法庭上得到支持。
  • 有人提出,区分“从未存储”与“先存储后删除”本身就很困难。

用户体验 vs 基准提升

  • 一部分用户觉得新模型在基准上更强,但实际用起来并没有比旧模型更有用,甚至因为限制和含糊其辞而感觉“更差”。
  • 另一些人则报告了明确改进(例如在小众技术推理上),并将“停滞感”归因于享乐适应。

ARC-AGI 是个好基准吗?

  • 批评者认为 ARC-AGI-3 过度偏向游戏化谜题,假定了人类的游戏惯例,并且与以文本为中心的 LLM 优势不太匹配。
  • 支持者则认为,游戏化、全新的交互任务正是检验泛化与无工具推理所需要的。

成本、激励与 AGI 话术

  • 有人对据报的评估成本表示反感(高达数万美元)。
  • 也有人 cynically 地认为,巨大的财务 stakes 和“AGI/ASI”营销会强烈激励人们在基准上过拟合或作弊。
  • 少数人认为 AGI 仍然要 10–20 年才会到来,而当前系统只是先进的模式匹配,不是真正的通用智能。