Kimi K3,以及我们从鹈鹕基准测试中仍能学到什么
一个长期流传的玩笑基准——要求大型语言模型生成“鹈鹕骑自行车”的 SVG——在这里被用来检验像中国的 Kimi K3 这样的新模型在创造力、代码生成、成本和速度方面的表现。评论者争论这个测试是否因为出现在训练数据中而已经“失效”,它到底还能在多大程度上反映通用能力而不是过拟合,以及什么样的真实世界任务基准(如工具使用、代码库重构或复杂规划)会更好。讨论还涉及模型经济学和地缘政治,指出中国实验室在算力受限情况下依然快速进步,并对不同 AI 提供商的可持续性与可靠性提出疑问。
鹈鹕基准测试的性质与价值
- 许多人把“鹈鹕骑自行车”的 SVG 任务看作一个轻松、非严肃的基准测试,它之所以持续存在,主要是因为它是一个长期玩笑和共享的“hello world”。
- 也有人认为它仍然能有效测试新概念的组合、SVG 生成能力,以及模型的“品味”或审美判断。
- 几位评论者认为它已经太“污染”了,因此没有什么意义:它被广泛传播,很可能出现在训练数据中,并且可能成为显式优化的目标。
训练数据、过拟合与风格趋同
- 关于实验室是否会刻意用鹈鹕 SVG 进行训练,还是它们只是偶然出现在大规模网页爬取数据中,讨论仍在继续。
- 有人报告称,模型在“鹈鹕骑车”上的表现明显优于其他同样荒诞的提示词(例如“树懒滑滑板”),这似乎说明可能存在过拟合或针对该基准的 RL。
- 也有人反驳说,SVG 和图像能力的整体提升,以及广泛训练数据,足以解释这些进步。
- 人们注意到强烈的风格趋同:从左到右的运动、相似的配色、通用的卡通外观,即使提示词并未指定风格也是如此。
基准测试、成本与实际用途
- 一些参与者对前沿模型的基准测试总体上都持怀疑态度,更倾向于个人测试(例如视频生成、Web/UX 设计、复杂工作流)。
- 对小幅成本差异的重要性存在分歧:有人说 10 倍的 token 价格差在大规模场景下非常重要;也有人认为与人工劳动相比,这些都很便宜。
- 对于如何演进基准测试,有人建议:
- 用随机化的“生物-载具” SVG 任务替代固定的鹈鹕。
- 使用更现实的任务(代码库、重构、删除死代码、长周期工具/智能体)。
- 采用混合测试,例如带有间歇性 SVG 干扰的 SWE 风格编码。
中国模型、规模与竞争
- 讨论中的 Kimi K3 在某些任务上被认为与西方高端模型大致具有竞争力,但速度更慢,并且在语言和部署方面存在注意事项。
- 关于中国实验室如何在算力和资金约束下训练大型 MoE 模型,存在争论;一些想法包括架构优化、国产芯片以及规避出口管制的办法。
- 仅凭参数量被认为是衡量质量的薄弱指标;注意力机制、专家规模/密度以及 RL 都很重要。
社区反应与元讨论
- 一些用户喜欢这个长期存在的鹈鹕“梗”,并希望看到作品集;另一些人则觉得重复发帖像是在刷屏或推广。
- 有几位强调了古德哈特定律:一旦某个可爱基准成为目标,它作为一般能力衡量标准的价值就会下降。