当 AI 基准测试进入平台期:一项关于基准饱和的系统性研究
关于大型语言模型因为在标准 AI 基准上逐渐饱和而“走到尽头”的说法,正遭到研究人员和从业者的强烈反驳。许多人认为,看似停滞反映的是基准本身的缺陷——小型、静态、可被操纵的测试集,包含标注错误或信号很弱的项目——而不是模型能力的硬性上限,并指出缩放定律和更新的评估仍显示出稳定进展。该讨论凸显出一种日益明显的转向:采用更稳健、不断演化、且更具领域针对性的评估,例如多智能体环境和专有测试套件,以更好地捕捉现实世界的实用性并避免基准刷分。
基准饱和及其含义
- 许多基准现在都显示模型准确率聚集在 80–90% 左右,有些人把这看作“撞上了墙”,另一些人则认为这表明这些基准本身噪声很大或存在缺陷。
- 几位评论者认为,标注错误的项目、含糊不清的问题,以及基准固有的混乱,使得 90% 成为一个合理的上限,而这并不意味着模型本身存在极限。
- 也有人指出,基准有成千上万种;有些很快就会饱和,而另一些(例如更新的“最后考试”式测试)仍然具有区分能力。
- 一种观点认为:“饱和”在某种程度上是选择效应——一旦容易的任务被解决,剩下的只有困难、嘈杂的离群项,使得进步更难被衡量。
这就是 LLM 的终点了吗?
- 怀疑者认为,快速饱和表明当前“对文本做回归”方法存在根本局限;他们认为进展正在转向狭窄的、追逐基准分数的增益。
- 反对者认为这种说法为时过早且缺乏数据支持,并指出总体能力指数一直在稳步提升,而缩放定律仍然成立。
- 有些人觉得前沿模型在“通用性”上已经停滞,但在数学和编码等特定领域仍在进步。另一些人则报告说,最近在编程辅助方面取得了显著提升。
理解 LLM 与智能
- 一方坚持认为我们“完全知道” LLM 在机制层面如何运作(注意力、矩阵乘法),因此拒绝“神秘”的说法。
- 另一些人认为,知道底层机制并不等同于理解涌现行为,这类似于知道量子方程却并不完全理解材料或认知。
- 还有几位指出,“智能”本身就很模糊,因此关于其上限的说法很难有牢固基础。
评估、刷分与新基准
- 担忧在于:固定、公开的基准会变成“benchmaxxing”目标,类似于 PC 硬件曾针对特定游戏基准进行调优。
- 建议的应对措施包括:
- 专有或持续演进的基准,以减少训练污染和刷分。
- 多智能体、开放式环境以及更像游戏的任务,以更好地捕捉现实世界中的编码与“社交”能力。
- 警惕样本量过小,不要过度解读细微的排名差异。
实际有用性与未来进展
- 一些用户表示,较新的模型在写作或通用任务上的体验反而更差,尽管分数更高。
- 另一些人强调,在使用 LLM 的“技能”以及高度可验证的任务(编码、形式数学)上,仍能看到强劲且持续的改进。
- 对于 RL 和人类反馈能否继续扩展,还是会遇到经济与数据限制,存在分歧。