顶尖 AI 仍然会在 IQ 测试中失利
“顶尖 AI 仍会在标准 IQ 测试中失利”的说法引发了争论:这类测试是否真的能衡量机器智能。评论者认为,大语言模型是强大的下一个词元预测器,泛化能力令人印象深刻但仍偏浅层,受制于视觉和推理限制、以记忆为主的“推理”,以及对真正新颖问题的困难。许多人认为,与其纠结 IQ 分数和 AGI 标签,不如关注现实中的实用性,以及能力快速提升的速度——这可能很快就会让现有基准过时。
IQ 测试对 AI 的相关性
- 许多人认为 IQ 测试并不是评估 LLM 的好方法:它们是为人类设计和验证的,尤其是在一个狭窄的能力区间内,而不是为具有不同架构的机器系统设计的。
- 也有人指出,IQ(以及 g 因子)仍然是目前对人类智能和人生结果最强的经验证代理,因此至少是一个有意思的基准。
- 分歧主要集中在 IQ 主要衡量的是模式识别,还是更广泛的能力,如创造力、解决问题能力以及“流体智能”。
- 有些人认为 LLM 在 IQ 测试中的糟糕表现更说明测试本身有问题;另一些人则认为这清楚地表明 LLM 并不“智能”。
LLM“智能”的本质
- 一种观点:LLM 只是“下一个词元预测器” / 对网络文本的有损压缩存储,擅长模仿但不会思考。
- 反对观点:如果要做到完美的下一个词元预测,就必须对底层过程有深刻理解;而当前模型已经展现出某些涌现式推理能力。
- 还有人指出,当人类超出自身理解范围时,也会“幻觉”出看似合理的胡说八道,这模糊了人类与机器行为之间的界限。
- 关于智能并没有公认的定义,因此围绕 LLM 是否符合条件,或者是否已经达到“AGI”,本质上是在进行语义争论。
视觉与测试格式问题
- 许多人认为,具体的 IQ 示例主要是在测试视觉/编码,而不是推理。
- 建议:将 Raven 风格的问题以文本、JSON 或 ASCII 图的形式呈现,而不是图片;一些实验表明,这样模型往往就能正确解决,尽管结果是随机性的。
- 把图像题做错,比喻成用纯视觉谜题测试盲人的 IQ。
能力、局限与幻觉
- LLM 在某些文本型 IQ 类任务和一些数学基准上可以与人类持平甚至超越人类,但在精确算术、超出训练数据的泛化,以及稳健的抽象推理方面仍然吃力。
- 引用的研究表明,很多“推理”实际上是模式记忆,不过也可能存在某些真正的推理。
AGI、炒作与未来轨迹
- 观点范围从“我们已经拥有平均人类模仿水平的 AGI”到“LLM 被过度炒作,只是浅层的模式机器”。
- 有些人强调实际用途(“它能干活吗?”)而不是哲学标签。
- 另一些人强调快速进展、参数量仍远低于大脑,并预计近期会有显著进步,尤其是在视觉方面。