GLM-5.3:具备新兴网络能力的前沿编码
一款新的开源权重 AI 模型 GLM‑5.3 被誉为接近前沿水平的编码与网络安全系统,尽管参数少得多,却能与 Anthropic 的 Fable 和 OpenAI 的最新模型相抗衡,甚至逼近它们。评论者认为,它不受限制的“网络”能力以及即将发布的权重,与美国高度受护栏约束的模型形成鲜明对比,并指出开源中国模型正迅速将 AI 商品化,削弱西方实验室万亿美元估值的基础。讨论焦点很大一部分落在实际使用上——速率限制、harness 质量、本地部署和护栏——以及强大的安全工具被更广泛获取后,最终究竟更有利于防御者还是攻击者。
能力与基准
- GLM‑5.3 使用与 5.2 相同的基础模型;所有改进都来自扩展后的后训练(针对可验证任务的 RL、更好的 SFT 等)。
- 评论者表示,它在实际编码和安全工作上接近或仅略落后于前沿闭源模型(Sol、Fable),同时规模小得多(总计约 744B / 激活约 40B 的 MoE)且更便宜。
- 它被描述为开源权重编码模型中的 SOTA,优于之前的 GLM、DeepSeek v4 Pro,并且尽管参数少得多,仍可与 Kimi K3 抗衡。
- 一些用户发现 5.2 已经很强;据说 5.3 更能遵循指令、更会深挖细节,并能处理复杂仓库和 PR 规划,不过仍有人对让它负责完整实现心存顾虑。
网络安全、护栏与 CVD
- 关于“网络能力”的大段讨论:许多安全从业者表示,美国前沿模型越来越拒绝安全相关工作,迫使他们转向 Kimi、DeepSeek 或 GLM。
- 关于 Anthropic/OpenAI 批准项目的体验参差不齐:有些人能快速获批,但仍会遇到激进的拒绝,尤其是 Fable;其他人则被阻挡或石沉大海。
- 有人尖锐批评过度严格的护栏伤害防御者,并服务于监管俘获叙事;反方则强调美国政府压力以及对强大漏洞利用生成的真实担忧。
- GLM 的协调漏洞披露项目受到强调:他们正在扫描大型开源软件和商业软件,提交了大量 CVE(包括 RCE)。一些人指出,这削弱了只有 Mythos/Glasswing 才能做这类工作的说法。
开源权重、安全与许可
- Z.ai 承诺在“安全评估和加固”之后约两周发布 GLM‑5.3 权重。一些人担心这可能削弱其网络能力;另一些人猜测这指的是水印或抗消融能力。
- 之前的 GLM 版本使用了宽松(类 MIT)的许可证;评论者希望这一点能延续,不过也注意到中国模型正越来越多地转向更严格的商业许可证。
经济、地缘政治与竞争格局
- 许多人认为,中国的开源权重模型(GLM、Kimi、Qwen、DeepSeek)正通过以远低于成本、且没有护栏的方式提供“足够好”的能力,迅速侵蚀美国闭源实验室的护城河。
- 关于美国实验室万亿美元估值是否可持续的争论:有人预测 AI 泡沫及最终崩盘;也有人认为硬件产能、数据获取和联邦合同仍是强护城河。
- 有人猜测美国监管机构会禁止或限制中国模型,也有人提到情报机构对保留未公开漏洞的兴趣,以及是否应允许广泛的 AI 辅助修复。
本地推理与 Harness
- 在本地运行 GLM 级模型是可行的,但要求很高(多 GPU 的 “Sparks” 机器、大内存、仔细量化);量化通常更伤效率,而不只是原始能力。
- harness 的选择(Claude Code、Pi/oh‑my‑pi、OpenCode、各种自定义 agent)会显著影响工具调用可靠性、token 消耗和主观“手感”。据称 GLM 在多个 harness 上都能稳定工作,而且许多用户正在尝试用于编码和安全工作流的多 agent 设置。
未来模型进展
- 一些评论认为“数据耗尽”被夸大了:更好的数据整理、合成数据,以及在可验证领域上的大规模 RL 和 agentic 环境,仍可继续带来巨大提升。
- 另一个趋势是:预训练运行如今发生得相对不频繁,而后训练和“后训练扩展”(更大的 RL 管线、更多环境)才是当前大多数改进的来源。