基准测试 GPT-4 Turbo——一个警示故事
将 OpenAI 新的 GPT‑4 Turbo 模型与原始 GPT‑4 进行比较的基准测试表明,Turbo 在某些编程练习上可能略逊一筹,原因很可能是它“记住”的训练样本更少,但同时提供更快、更便宜的推理以及长得多的上下文。评论者就对标准化题目的成功究竟反映真正的推理还是仅仅记忆展开争论,也讨论了在模型已从海量互联网数据上训练过的情况下,如何设计公平的测试。其他人分享了从轻微质量下降到明显改进不等的真实使用结果,并指出评估中的统计严谨性、开发者工作流程的变化,以及复用开源基准设置的伦理问题。
总体主题
- 讨论的重点在于 Exercism 基准测试在 GPT‑4 与 GPT‑4 Turbo 上到底测量了什么,以及差异究竟反映的是记忆能力、推理能力还是噪声。
- 许多人认为 Turbo 是“更快但稍微笨一点”;也有人认为证据很弱,或者 Turbo 在他们的使用场景中实际上更好。
记忆 vs 推理
- 有些人将结果解读为:GPT‑4 记住了更多基准题目;Turbo “忘得”更多,但在未见过的任务上推理能力相近。
- 另一些人则认为,仅凭标题加函数桩来识别题目,很多时候靠的是通用知识,而不需要精确记忆。
- 几位评论者强调,记忆是智能(无论人类还是机器)的核心组成部分,并不天然算“作弊”。
- 也有人担心,当 LLM 解出基准题时,它们可能主要是在回忆训练数据,而不是展示广泛能力。
LLM 真的能编程吗?
- 争议很大:有人认为在已知题目上的成功只是“作弊”,因此不能证明编程能力。
- 也有人给出轶事,称 LLM 成功地为新颖的私有代码库和领域编写了测试与实现。
- 还有人指出,人类编程很大一部分本身也是模式回忆;因此 LLM 的辅助依然有价值。
基准设计与统计力度
- 多条评论指出样本量(约 67 道题)太小;按二项分布置信区间来看,GPT‑4 与 Turbo 的差距统计上并不强。
- 大家呼吁更大、更真实的基准测试(例如多文件任务、长上下文编码),并进行多次运行以处理随机性。
用户报告的体验
- 一些用户表示,在复杂 SQL、机器学习论文分析以及自定义视觉问答数据集上,GPT‑4 优于 Turbo。
- 另一些人报告,在 OCR 转结构化文本或通过其他工具进行类似 Exercism 的编码任务时,Turbo 略微更准确且快得多。
- 据称,Aider 的另一项 Exercism 基准(Python)显示 Turbo 的表现优于更早版本的 GPT‑4,这与原博客中的模式相矛盾。
上下文窗口、成本与行为
- Turbo 的长上下文受到称赞,但几位评论者指出,在大约 3 万到 4 万 token 之后可靠性会下降。
- 也有人疑问:既然上下文很大,为什么完成长度还被限制在 4,096 tokens;回复认为这是出于成本和延迟限制。
- 有人猜测 Turbo 可能是一个更小/蒸馏后的模型,以部分质量换取速度和更便宜的推理。
伦理、许可与评估问题
- 人们担心测试污染:封闭模型很难检查是否与训练集重叠,可能会在公开基准上过拟合。
- 另一条分支讨论了开源署名以及基准工具之间的代码复用。
- 还有人批评模型在用户付费后被“削弱”,并将 LLM 的基准投机与硬件基准优化相类比。