GLM 如何构建自己的推理基础设施
中国实验室 Z.ai 已在超过 10 万块国产 AI 加速器上为其 GLM-5.3 系列模型搭建了大规模推理栈,引发了关于中国实现可与之竞争、且不依赖 NVIDIA 的基础设施后战略影响的讨论。评论者一方面衡量其技术成就和激进的软件优化,另一方面也抱怨定价、速度和 token 限额,并将 GLM 的开源权重路线与 Claude 这类美国闭源模型进行对比。该帖还深入讨论了涉嫌从 Anthropic 模型进行大规模蒸馏、美国芯片出口管制的有效性,以及这一转变是否会随着时间削弱西方在 AI 硬件和模型方面的主导地位。
中国 AI 加速器与地缘政治影响
- 许多人认为,将 GLM-5.3(-Flash) 运行在超过 10 万块中国加速器上,是一个重大的战略转变:如今中国既有自己的芯片,也有大规模推理能力。
- 有观点认为“多数用户不需要前沿模型”——性能强、便宜、稍微落后一代的模型,加上国产芯片,可能会对西方实验室造成“陨石撞击”式冲击。
- 关于中国电力是否更便宜也存在争论;有评论者引用数据称,工业用电实际上比美国更贵。
- 一些人认为美国的出口管制适得其反,迫使并加速了中国本土芯片开发和效率创新;另一些人则说,中国无论如何都会走这条路。
定价、Token 方案与价值
- 几位用户表示,Z.ai 早期的编码方案“补贴得离谱”,后来又大幅重新定价,现在感觉要么太贵,要么 token 限额太少。
- 也有人仍然觉得很有性价比,原因在于缓存和较高的 token 配额,尤其是 Max 方案;但他们指出,想要跑满配额,必须高度并行化和/或使用 Flash。
- 关于订阅层级到底提供多少 token 存在困惑;一些人将其与 Claude 相比后觉得不划算,另一些人则认为按正确方式换算后,每美元价值其实相近。
模型质量、使用模式与 Agents
- GLM-5.3 经常被称赞为开源权重模型中的顶级水平,推理能力不错、幻觉相对较少,但如果没有监督,也可能会“跑偏”。
- 重度 token 用户描述了多 agent 架构,例如代码生成、漏洞发现、搜索/优化流水线等,每月消耗数十亿 token。
- 共识是,当前所有模型都需要定期的人类或更高层级模型监督;GLM 也不例外。
蒸馏、合法性与伦理
- 讨论长时间围绕指控展开:包括 Z.ai 在内的中国实验室被指通过某个美国模型提供商非法路由流量,以进行大规模蒸馏。
- 关于合法性存在分歧:有人认为这是明确的欺诈和网络攻击;也有人认为违反 ToS 不一定违法,或者在西方实验室被指侵犯版权的前提下,这更像是“从小偷那里偷回来”。
- 对于这种蒸馏究竟能从有限对话中提取多少信息,很多人持怀疑态度;但也有人指出,攻击规模之大本身说明实验室相信它有效。
性能、基础设施与优化
- 一些用户说,尽管博客强调了优化,Z.ai 的服务体验仍然“慢得要命”;也有人认为这是刻意在吞吐量和省电之间做出的权衡。
- 讨论了 agentic 工作负载下较高的缓存命中率(90–97%),这让 token 配额看起来比原始数字更宽裕。
- 技术爱好者对 GLM-5.3 的完整 744B MoE 版本本地运行很感兴趣:通过从 SSD 流式加载专家实现,但 token/s 非常低。
- 也有多人指出,美国实验室同样在积极优化推理,甚至在自研芯片;这并非中国独有。
出口管制、保护主义与长期影响
- 关于出口禁令究竟是帮助美国实验室(更多获得 Nvidia 资源)还是伤害中国实验室,抑或反而为中国芯片供应商创造了一个受保护的追赶空间,存在争论。
- 一些人预测,未来廉价中国 GPU 的竞争会侵蚀 Nvidia 的利润率;另一些人则强调中国在光刻/EUV 方面仍有瓶颈。
- 更广泛的反思涉及产业政策、贸易战,以及大型新兴经济体在技术上追赶是不可避免的。