Kimi K3 与 Fable 竞争激烈;Kimi K3 和 Fable 已达到 SoTA

关于中国开权重模型 Kimi K3 与 Anthropic 顶级模型 Fable 具有竞争力的说法,再次引发了关于 AI 是否正在商品化、以及基准测试在多大程度上能反映真实世界编程和 agent 工作负载的争论。评论者剖析了 Fireworks.ai 的“oracle routing”方法,质疑其潜在营销偏向,并比较了 K3、Fable 和其他前沿模型在成本、速度、token 效率与护栏方面的差异。该讨论串还凸显了更广泛的张力:开权重与闭源、美国与中国 AI 生态、数据隐私与安全权衡,以及越来越强大但控制不足的系统是否应被广泛开放使用。

整体性能 / SoTA 声称

  • 许多人认为 Kimi K3 接近前沿水平,大致可与 Fable/Mythos 以及更早的前沿模型(Opus 4.8、GPT‑5.5)相提并论。
  • 也有人认为 Fable/Sol 仍然明显领先,尤其是在更难的数学题(例如 FrontierMath Tier 4)和一些复杂编程任务上。
  • 若干评论者表示,开源中文模型已经“benchmaxxed”,在真实世界任务和 token 效率上落后;也有人报告 K3 在某些编程问题上优于 Sol/Fable。
  • Arena.ai 和其他排行榜有时与 Fireworks 的排名相矛盾,这引发了怀疑。

Oracle 路由与实际路由

  • Fireworks 的“oracle routing”被批评为一个理论上限:他们在两个模型上都运行任务,然后事后选择最便宜的正确答案。
  • 评论者指出,这假设你能可靠地检测正确性,而这往往和原任务一样难。
  • 有些人希望改为评估真实、预测性的路由器;但也有人仍然认为展示优化上限是有价值的。
  • 对公司而言,路由可能显著节省成本;对个人而言,按任务路由可能损害缓存利用和一致性。

成本、token 与效率

  • 主要矛盾在于按 token 计价与完成每个任务所需的总 token 数:K3 往往比 Fable 使用更多的 token 和轮次,因此单任务成本和延迟可能向任一方向变化。
  • 提示缓存(多轮 agent 中的高命中率)即使在 token 更多的情况下,也可能让 K3 便宜得多。
  • 有些用户很快就用光了 Kimi 订阅额度;另一些人则发现它在类似工作上只有 Fable 一半的成本。

开权重 vs 闭源实验室

  • 对开权重的热情很强:可自行托管、模型被弃用或“阉割”的风险更低,并对美国前沿实验室形成竞争压力。
  • 也有人认为,开权重实际上通过蒸馏和架构洞见帮助了闭源实验室。
  • 对于中文模型究竟主要是在复制/蒸馏美国模型,还是在独立创新,存在分歧。

隐私、治理与司法辖区

  • Kimi 平台的 TOS 默认允许使用用户内容进行训练;不像 Claude 那样有简单的退出选项,这让人担忧专有代码的安全。
  • 有些人更偏好通过聚合器走零数据保留(ZDR)路线;另一些人则希望在欧盟或非美国地区托管,以避开美国和中国的监管体系。

安全、拒答与“人格”

  • 前沿模型(尤其是 Anthropic)因在安全、生物学,甚至涉及认证/权限范围的常规后端代码上过度拒答而受到批评。
  • 中文/开源模型因更少拒答和更高自主性而受到赞扬,但也有人担心这会在安全上演变成“向下竞赛”。
  • 许多人不喜欢“奉承”、拟人化或保姆式的语气(例如模型因脏话而训斥用户);有些人明确希望助手表现得简短,甚至“粗鲁”一些。

工具、路由器与自托管

  • 提到的常见网关/路由器包括:OpenRouter、Bifrost、LiteLLM、OmniRoute、oh‑my‑openagent、OpenCode,以及各种编码 harness(Claude Code、Kimi Code、ZCode 等)。
  • 自托管完整的 K3 级模型通常被认为只有拥有大规模 GPU 集群的大型组织才可行,不过量化版本降低了需求。

地缘政治与市场

  • 多条评论将中文开权重的进展视为削弱美国 AI 主导地位,并可能使前沿能力商品化。
  • 有些人认为中国的开放策略是在战略上削弱美国超大规模云厂商;另一些人则强调这只是“geeks doing geeky stuff”。
  • 关于为什么股市不再强烈反应也有争论:新鲜感已经消退,而围绕 DeepSeek 早期影响的叙事也受到质疑。