小米 MiMo 2.6 训练后实时仪表盘
小米推出了一个实时仪表盘,展示 MiMo 2.6 编程模型的训练后强化学习运行,公开了这个通常相当不透明的行业中的实时成本、进度和基准分数。评论者称赞了透明度以及早期 MiMo 模型很强的性价比,并将其与 DeepSeek、GLM、Qwen 和 Gemini 等竞争对手进行比较,同时也讨论了基准污染、数据组成,以及是否可能从前沿模型中蒸馏而来等问题。一些人怀疑仪表盘是否真的反映实时数据,但许多人认为,这与大型美国实验室的保密形成了显著对比,也表明中国 AI 公司正在变得越来越开放。
对仪表盘的总体反应
- 许多人认为这个训练后 / RL 实时仪表盘“出奇地透明”和“很酷”,尤其是在这个通常相当保密的行业里。
- 一些用户说,光是看这次运行,他们就学到了很多关于训练动态的东西。
- 也有人认为,这主要是一个巧妙的公关动作,而不是根本性的变化。
透明度、开放性与动机
- 有人疑惑为什么其他实验室(OpenAI、Anthropic、Google、IBM)不做类似的仪表盘;给出的原因包括:
- 美国大型实验室认为自己有“独门秘方”,公开方法论收获不大。
- 更小的 / 中国实验室从开放性中获益更多,因为这可作为差异化和营销手段。
- 还有人指出,中国政策现在似乎明确偏向开源模型和开放式开发,这为“可见的开放”创造了激励。
训练数据、RL 与基准测试
- 有人澄清,这是一轮训练后 RL 运行,而不是预训练,不过也有人提到,即使是预训练,常常也会使用 30–50% 的代码。
- 讨论集中在训练期间运行基准测试是否属于“污染”:
- 一种观点认为:基准测试充当验证 / 早停信号,会导致轻微过拟合,但远不如直接拿这些基准来训练。
- 另一种观点认为:即使只是作为停止条件,它们也会隐式地朝这些基准调参,并助长“benchmaxxing”。
- 基准测试也被视为发现退化或坏数据批次所必需的工具。
仪表盘的真实性与可靠性
- 一部分评论者怀疑这个仪表盘部分或完全是假的(例如刷新时进度倒退、重启与图表不匹配、“ticker” 行为)。
- 其他人反驳说,中间的 ticker 可能是合成的,而周期性的真实数据更新仍然是真实的,就像进度条一样。
- 总体而言,这个信息流是否完全实时且准确,被认为并不清楚。
模型质量与基准
- MiMo 2.6 的 DeepSWE 分数相较于 MiMo 2.5 Pro 据称 19% 的结果看起来非常高,使其在该基准上接近“前沿”编码模型。
- 有人认为 DeepSWE 现在已经趋于饱和,在顶端区分度变低;不过它仍然有助于区分中端与顶级模型。
定价、投资回报与实际使用
- 多位用户表示,MiMo 2.5(以及 2.5 Pro)是很强的编码主力模型,单位 token 成本极佳,尤其是相较于美国和其他中国模型。
- 常见用法是:用更强或更贵的模型做规划 / 设计,然后让 MiMo 负责听话地实现或执行后台任务。
- 讨论还把它与 DeepSeek、GLM、Qwen、Gemini 等进行比较,权衡质量、价格和速度。
- 一些人认为,开权重且更便宜的模型对企业的吸引力越来越大:性能可预测、可调优、隐私更好、在自有硬件上可采用固定价格。
地缘政治与行业对比
- 一些评论把中国实验室描述为通过更开放和更具实验性而“压过”美国实验室,而美国实验室则更聚焦于安全话术、闭源模型和估值。
- 也有人提出反驳,指出许多中国模型被视为对美国“前沿”模型的蒸馏,因此关于谁真正领先、谁在复制的争论由此产生。