在 MI355X 上运行 Kimi K3 的每美元性能优于 B300
Wafer.ai 的一份基准报告声称 Kimi K3 模型在 AMD 的 MI355X GPU 上比在 Nvidia 的 B300 上更具成本效益,但因方法不透明、配置难以复现以及云租赁价格选择性取样而遭到大量质疑。评论者认为,性能表实际上显示 B300 在原始吞吐量上更强,质疑所列 GPU 小时价格和总拥有成本的现实性,并认为这篇文章更像营销而非严谨工程。围绕“仅发布模型权重是否算开源”的大讨论则凸显了传统软件自由概念在现代 AI 模型上如何适用这一尚未解决的张力。
文章质量与“AI slop”担忧
- 多位评论者将这篇文章形容为“slop”或草率写成,不过也有人指出它比典型的 AI 生成内容更易读。
- 有人用高级模型批评了这篇文章,并认为它暴露了严重缺陷;也有人认为在如此苛刻的提示下,任何文章都会被挑出毛病。
- 具体抱怨包括编辑不佳、prefill 部分不清晰,以及视觉设计薄弱(例如文字与背景对比度太差)。
基准测试方法与正确性
- 多位评论者质疑,在进行低层优化(例如 head-count padding)之后,Kimi K3 的设置是否仍然自洽,并询问是否运行了正确性基准测试。
- 一位 wafer 代表表示,像 tau/gpqa 以及 coherency/thinking 测试之类的基准,是在 OpenRouter 上提供托管所必需的。
- 有人批评使用 1024 token 的短输入上下文已经过时,且不能代表真实场景。
- 也有人指出,B200 的数据因跨节点通过 RoCE 做 all-reduce 而受限,而文中没有提到 Infiniband 等更好的互连方案。
每美元性能与定价假设
- 很多人质疑文中声称的 GPU 小时价格,尤其是将 MI355X 的 $2.50/小时 与 B300 的 $6/小时进行对比的说法。
- 批评者认为,MI355X 的定价是从某个特定聚合平台中挑选出来的,可能并不能反映真实、稳定可用的算力,而且忽略了自有硬件的 TCO、电力成本和折扣。
- 有人指出,现货/按需定价、稀缺性和承诺折扣使得大多数“GPU 价格讨论”都不可靠。
- 也有人怀疑,按这些价格租用 MI355X 不足以在现实寿命周期内覆盖硬件资本支出。
Wafer 的定位与声誉
- 一些人指责这篇文章实际上就是 AMD/Wafer 的广告,使用了夸大或不公平的比较,以及不可复现的基准测试。
- 还有人提到其过去曾出现过一个很快被放弃的 token 订阅产品,作为其炒作驱动行为的证据。
- 不过也有人认为,即便它带有宣传性质,优化推理经济性仍然具有社会重要性,因为大规模 LLM 服务的支出非常高。
“开源”与“开放权重”模型
- 围绕“只发布权重是否算开源”展开了长篇争论。
- 一方认为,权重是用于修改模型的“源”,对权重和代码采用开放许可证,已满足类似软件自由的标准。
- 另一方认为,训练数据和训练过程才是真正的“源”,权重更像二进制文件,因此“开放权重”才是更诚实的说法。
- 也有人区分“开放科学”(包括数据和过程在内的完全可复现)与仅仅开放权重的区别。