OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上的表现
据报道,OpenAI 的 GPT‑6 “Astra” 模型在 ARC‑AGI‑3 推理基准上达到了近乎完美的表现,这引发了关于此类结果究竟意味着人工通用智能的到来,还是只是另一个狭窄测试被饱和的争论。评论者探讨 ARC‑AGI‑3 作为“智能”代理到底有多大意义,将 AI 的成本与能力同人类进行比较,并指出更好的推理反而可能通过减少重试次数来降低总算力成本。讨论进一步扩展到 AGI 本身是否是一个连贯的概念、应如何定义(例如以经济价值工作还是通用问题解决为标准),以及像开放的 Erdős 数学问题或具身机器人等更困难的基准是否仍在当前模型之外。
成本、Harness 设计与性能
- “反向”的成本/得分曲线可由 ARC-AGI-3 的基于重试的设置来解释:每一步推理更多,就能用更少的尝试解出谜题,从而减少总 token 数并降低成本。
- 官方 ARC harness 会丢弃先前的推理/上下文,迫使模型在每一局中都“重新学习”。OpenAI 的自定义 harness 加入了标准的上下文压缩与复用,显著提升了得分。
- 有人指出,“在合适的 harness 下”Astra 可达到约 99.9%,由此有人声称这实际上已经在这个基准及其他基准上达到了 AGI;也有人指出,harness 设计在其中起了很大的作用。
人类 vs AI 的成本与效率
- 文章将人类每次会话的报酬与大脑能量成本进行比较,引发争论:有人赞赏生物效率;也有人认为只比较大脑能耗忽略了训练、教育以及有限的工作时长。
- 一些人强调,人类时间本身就具有内在价值,不能直接与廉价的 AI token 相比较。
这是 AGI 吗?定义与目标漂移
- 许多人认为 AGI 的定义不清,或者大多只是营销术语;人们会把自己的含义投射到这个词上。
- 提到的定义包括:“在认知任务上与人类智能相当或超越人类的系统”以及“在大多数具有经济价值的工作上胜过人类的高度自主系统”,这两者都被批评为过于模糊。
- 有人说,如果一个 harness 能把模型在 ARC-AGI-3 上推到 99.9%,那我们实际上就已经到了 AGI;也有人坚持,只有当我们再也想不出任何对人类简单、对机器却困难的任务时,才算 AGI。
基准测试到底在衡量什么?
- 争论在于,解决一个类似贪吃蛇的益智游戏或 ARC 风格的逻辑任务,究竟能说明多少关于“智能”或现实世界效用的东西。
- 批评者指出,人类是按速度优化的(被告知有时间限制),而模型是按正确率和成本优化的,这使得比较并不对称。
- 一些人预计纯软件基准会逐渐饱和;有人提议用机器人任务或长周期目标(例如赚钱、改进指标)作为更有意义的测试。
智能、IQ 与替代指标
- 讨论 IQ 的长串分支中,有人认为 IQ 测试在人类内部是可靠的,并且与结果相关;也有人说它很难捕捉“智力”、社交技能,或非人类智能(例如海豚、章鱼)。
- ARC 谜题被类比为 IQ/空间能力测试:它对某一种“智能形式”有用,但显然不是全部。
- 有人更偏好开放的数学基准(例如 Erdős 问题),因为它们更不容易过拟合,也更能代表前沿推理能力。
基准饱和、难题与算力
- 一派认为“任何可验证的东西最终都会被模型解决”;另一派则举出一些容易验证但很难学会的任务(例如赚钱、安全驾驶、优化订阅)。
- 讨论指出,在许多领域,瓶颈不是算力,而是收集现实世界回报的成本与风险(例如自动驾驶中的碰撞)。
信任、作弊与资金顾虑
- 有人猜测可能存在过拟合,甚至私下外泄 ARC 测试题,理由是相关激励与大型实验室过去的行为;但这仍未被证实,并被标记为怀疑而非事实。
- 也有人追问是谁支付了可观的算力成本;一种回答是,OpenAI 为这些评估提供了几乎无限的 API 访问。
意识与实际可用性
- 另一个分支在问:对于某些类型的问题解决,是否曾经需要意识或感受痛苦的能力;大多数回复都认为意识与智能是正交的。
- 少数评论者表达了实际层面的怀疑:在系统还能自主处理现实世界中那些乱糟糟的任务(例如修漏水水龙头)之前,高基准分数仍然显得很抽象。