GLM-5.3(开放权重)以 1/5 的成本击败 Anthropic/OpenAI 模型

一篇声称中国 GLM‑5.3 模型以极低成本超越领先的 OpenAI 和 Anthropic 系统的文章,引发了人们对大语言模型如何进行基准测试和比较的质疑。评论者质疑所引用测试的有效性(任务规模小、已饱和、常常很简单,且文章本身由 AI 生成),并指出安全拒绝、提示封装以及企业采购与合规,往往比原始分数更重要。有些用户表示 GLM‑5.3 在逆向工程等任务上确实表现出色,但许多人认为,开放或中国模型在通用能力上仍落后于美国前沿模型,而且还受到地缘政治与许可风险的影响。

基准测试的可信度与方法论

  • 许多人认为这个基准测试已经“饱和”:大约有 10 个模型得分超过 95%,这说明任务要么太简单,要么区分度不够。
  • 编程评测也被批评过于简单(只有少量、简单的 Python 任务;总共 28 个任务),因此不同模型之间的差异可能没有实际意义。
  • 一些人指出它与其他排行榜(例如 ArtificialAnalysis、LMSys Arena)存在不一致,而且像 Haiku 得分很高或 GPT 5.5 > 5.6 这样的结果被视为危险信号。
  • 有人提到 Fable 的低分主要是因为拒绝回答,而不是原始能力不足;也有人认为把拒绝当作失败计入,对“真实世界”评估来说是公平的。
  • 总体而言,很多评论者认为这份基准和文章都很“slop”,不足以作为选择模型的严肃依据。

GLM-5.3 的能力与成本

  • 多位用户表示 GLM-5.3(以及相关的 Kimi 模型)表现很强,尤其是在逆向工程、工具使用、规划,以及在 harness 中进行编码方面。
  • 有人说它可以在个人/开发工作负载上,以显著更低的成本替代更高端的闭源模型;也有人觉得它更慢、过度设计,或并不比 GLM-5.1 明显更好。
  • 另一项评估被引用,其中 GLM-5.3 排在大约第 6 位,而且在价格/性能上并非相对于 Grok 和 Sol 具有帕累托最优。

开放权重、安全性与拒绝

  • GLM-5.3 的权重尚未发布;延迟被归因于安全性削弱,一些人担心这会降低能力,但也有人认为可以通过微调修复。
  • 对美国模型的安全过滤和拒绝普遍感到沮丧,尤其是在安全、逆向工程以及“自主”编码任务方面。

企业与地缘政治考量

  • 有人认为,企业仍会因为集成、采购和合规而继续为美国大科技公司的模型付费,即使质量差距不大。
  • 也有人强调双向的供应链和政治风险:美国政府可以限制美国模型,也同样可能针对中国模型,从而影响承包商。
  • 非美国组织可能会觉得使用美国提供商的风险更高。

信任、AI 生成内容与宣传疑虑

  • 许多人认为这篇文章和网站大量或完全由 AI 生成,而且编辑很差;这严重削弱了对结果的信任。
  • 有人称之为“AI slop”,并担心 AI 生成内容淹没 HN。
  • 少数人提到可能存在为推广中国模型而进行的 astroturfing 或宣传,但除了语气和结果之外,这并没有得到证实。