Qwen3.8 Max 现已在 agentic index 中被评为最佳整体模型

Qwen 3.8 Max 是一款大型开放权重中文语言模型,曾短暂登上 Artificial Analysis 排行榜中的“agentic”模型榜首,引发了人们对这些综合基准如何构建和更新的关注。评论者将它的能力、成本以及吞 token 很猛的推理风格与 Anthropic 的 Opus、OpenAI 的 GPT 5.6、Kimi K3 和 DeepSeek 等竞争对手作比较,并指出在原始“智能”分数上,它仍落后于一些专有模型,而且运行成本高昂。一个反复出现的主题是:中文前沿模型和开放模型的质量现在已经接近到足以让价格、延迟、可自托管能力和交互风格等取舍,比基准分数上那一点点差异更重要。

基准测试与“最佳模型”说法

  • Artificial Analysis 有多个指数:
    • Agentic Index(GDPval‑AA v2、Tau³‑Banking)中,Qwen3.8 Max 曾短暂位居榜首,但在一次方法更新后现在排第 2。
    • Coding Agent Index(DeepSWE、Terminal‑Bench、SWE‑Atlas‑QnA)中,Qwen3.8 Max 只做了部分测试,并且在共享基准上落后于一些 OpenAI 模型。
  • 不少评论者认为最初“最佳整体”这种表述有点击诱饵嫌疑,并指出这次胜利范围很窄、且只针对特定基准。
  • 方法更新(包括新的评分模型)发生在大家都在关注的时候,导致分数/排序明显变化,也引发了人们对排行榜中立性的怀疑。

模型质量与用户体验

  • 许多人表示,Qwen 模型,尤其是 3.6/3.8 大型版本,在排障、agentic 工作流和通用编码方面表现出色;一些人认为它们在复杂调试上甚至优于 Anthropic 和 OpenAI。
  • 另一些人则觉得 Qwen/中文模型比较粗糙或不稳定:会在会话中途改变格式、遗漏要求的内容,或者需要更明确的提示词。
  • 原始“智能指数”排行榜仍常把 Opus 5 和其他专有模型排在前面;有些人不信任任何那种在日常使用中他们觉得更强的模型却输给 Opus 的基准。

成本、Token 与经济性

  • Qwen3.8 Max 是开放权重但规模巨大(约万亿级),因此大多只能云端使用,而且按任务计费几乎和顶级专有模型一样昂贵。
  • 评论者强调,推理密集型模型可能输出大量 token,使得中价位模型按任务计算的成本实际上和高端模型差不多。
  • 还有人强调更便宜但依然强劲的选项(例如 DeepSeek v4 Flash、Grok 4.5、降价后的 GPT‑5.6 Luna),并认为“单位质量成本”现在是主要差异化因素。

本地与更小的模型

  • 大家对即将推出的 Qwen 3.8 27B 以及现有的 Qwen 3.6 27B/35B A3B 作为在消费级 GPU 和 Apple silicon 上的“本地默认”候选很感兴趣。
  • 讨论到的取舍包括:27B 被认为更聪明但更慢、KV cache 开销更大;35B A3B 更快、也“更笨”,但足以用于结对编程。

Anthropic / Claude 与其他模型

  • 许多人形容用于编码代理的 Opus 5 过于冗长、过度规划、消耗大量 token,而且不太愿意真正执行工作;有些人于是回退到较旧的 Opus 4.6/4.8,或切换到 Qwen/DeepSeek/OpenAI。
  • 也有人表示,只要调整提示词和输出风格设置,Opus 5 在代码质量上就是明显升级,但仍然抱怨它的行文和“人格”表现。
  • Anthropic 的订阅和 API 定价被认为有些奇怪地失衡;有些人觉得在 agentic swarm 中 credits 消耗得非常快。

中国、蒸馏与偏见

  • 评论者认为中国实际上已经“追上了”;如今前沿模型之间的差距感觉很小,更多取决于使用场景、品牌和“人格风格”。
  • 对 DeepSeek、GLM、Kimi、Qwen 的体验差异很大:有人觉得它们有革命性提升、性价比高得多;也有人报告其可靠性比美国模型更差。
  • 讨论的焦点之一是:中文模型是否大量蒸馏自西方输出,以及这在伦理上是否不同于使用网页数据训练。
  • 有些人担心中文模型中的审查和叙事塑造;另一些人则反驳说,所有主要厂商(无论中西)都嵌入了各自的偏见。

Agentic Harness 与沟通

  • 多人强调,基准测试遗漏了编码代理的一个关键因素:模型如何清楚地解释自己做了什么。
  • 尤其是 Opus 5,被批评使用过于浓重的术语、杜撰术语,以及冗长曲折的更新内容,这让人工监督更困难,尽管它原始能力很强。
  • 不少人认为,我们或许已经进入了“够用”的智能平台期,此时速度、成本和沟通质量比极小的基准差异更重要。