Z.ai 确认 Ox Alpha 是新的 GLM 系列模型,并将发布其权重

中国的 Z.ai 已确认其 Ox Alpha 模型是新的 GLM 系列变体,并将发布其权重,使其成为 DeepSeek 以及西方实验室中端专有系统的开权重竞争者。评论者表示,基于其推定规模,它在长编码和 agentic 任务上的表现很强,但也存在不稳定行为,如“doom loop”、基准不一致、推理慢,以及可能的重度量化。此次发布被视为中国实验室更广泛战略推动的一部分:开放权重、发布高性能模型,加剧竞争,并降低能够自托管的开发者成本。

模型身份与权重发布

  • 讨论串一致认为 Ox Alpha 是 Z.ai 的一款新的 GLM 系列模型;据称公司已确认,并表示权重会在“今晚”发布(GMT+8,但时区造成了混淆)。
  • 有人将其具体关联到 GLM‑5.3 / “flash” 线;关于究竟会发布什么(完整版本还是更小的变体、许可证条款)仍不清楚。

模型规模与架构

  • 目前还没有官方参数量;社区猜测范围从约 18B 活跃参数(如果像 GLM‑5.3 flash)到 200–300B 总参数不等。
  • 几位评论者强调,实用性在很大程度上取决于规模与性能的关系:如果小而强,那意义重大;如果更接近超大模型,那就只是“不错,但不特别”。

性能与基准

  • 据报 DeepSWE 得分约为 63%;有人认为这很稳,但仍低于最顶尖的前沿模型。
  • 公开基准结果喜忧参半:在 LiveBench 上表现不如一些小型 GPT 模型,但其他(非官方)网站声称接近 Fable 级别;而这些非官方站点和跑分普遍被视为不可靠或样本量太小。
  • 多条评论指出,大多数 LLM 基准只在过少任务上运行,因此统计意义有限。

上手使用反馈

  • 很多人把 Ox Alpha 用于多天的编码和重构任务;共识是代码质量和长周期工作表现很强,往往优于同类 “flash”/廉价模型,但仍落后于顶级 Claude/GPT 级别。
  • 它在重写、解释、UI 工作以及结构清晰的文稿方面表现不错;几位评论者形容它“有趣”或比某些 Anthropic 模型更易读。
  • 也有人觉得它表现平平,尤其是在复杂 bash 管道或视觉任务上。

蒸馏与训练争论

  • 争论仍在继续:Ox Alpha 是否大量蒸馏自其他专有模型;有人认为很可能是这样,另一些人则希望看到更强证据。
  • 相关研究显示,黑盒蒸馏可以接近教师模型性能,但并不能解决关于推理/长周期行为的问题。

部署、harness 与 doom loop

  • 有人报告了明显的慢推理、超时和 “doom loop”(重复命令或工具调用)问题。
  • 一些人表示,这在 GLM 模型中很常见,而且会被激进量化或较弱的 agent harness 放大;另一些人则在设计更好的 harness 中报告了稳定的长时间会话。

生态、许可与地缘政治

  • 很多人把开权重发布视为对 DeepSeek 的竞争性回应,也是中国更广泛推动开源模型的一部分,可能还受国家政策鼓励。
  • 讨论涉及限制性许可证与真正开放许可证;一些人认为为了商业需要,保留限制也可以接受。
  • 有人观察到中国模型在初创公司中的采用在增加、可通过非 NVIDIA 硬件进行低成本本地托管,以及品牌混淆日益加剧(Qwen、Kimi、GLM、Ox 等),不过也有几位否认技术用户之间真的存在混淆。
  • 也有人提到围绕中国模型的炒作周期和协调推广;另一些人则认为模型已商品化,并预计用户会持续切换到最强/最便宜的方案。