Qwen 3.8

阿里巴巴发布 Qwen 3.8——一个 2.4 万亿参数的大型语言模型,并承诺提供开源权重——被视为中国实验室(Kimi、DeepSeek、GLM 等)与 Anthropic 的 Fable 和 OpenAI 的 GPT 系列等美国前沿模型展开升级竞赛的一部分。评论者讨论中国推动强大开源权重模型背后的战略动机——从将“智能”商品化、挤压美国 incumbents,到真正的开源理念——同时也权衡审查、护栏、成本、性能,以及能够本地运行的小模型需求等实际取舍。许多人认为,越来越多强大的开源权重模型既对美国闭源实验室构成竞争威胁,也为希望掌控自身 AI 基础设施的开发者和小型组织带来了重大利好。

公告与访问

  • Qwen 3.8-Max 被宣布为一个约 2.4T 参数的模型,目前通过阿里巴巴的云/token 方案和应用提供;开源权重承诺“即将”发布。
  • 评论者将其发布时间与上海世界人工智能大会联系起来,多个中国实验室(Qwen、Kimi 以及其他)在会上发布了前沿模型。
  • 也有人猜测,这同样是对近期其他中国开源权重发布(例如 Kimi K3、GLM 5.2+)的竞争性回应,不过也有人指出,这类模型训练往往需要数月时间。

规模、能力与对比

  • 2.4T 的体量被认为非常庞大;用户将其视为从“性价比”模型转向“巨大、缓慢、非常聪明”的中国模型的一部分。
  • 宣传中“仅次于”顶级美国前沿模型的说法引起了兴趣,但在实际测试前仍持怀疑态度。
  • 以往的 Qwen 模型评价不一:有些人觉得 3.6 27B/35B 在本地编码和 agent 方面非常出色;另一些人则认为 3.7 Pro/Max 冗长、跑偏,或不适合 SWE 工作。
  • DeepSeek V4、GLM 5.2、Kimi K3 以及美国前沿模型是常见参照;人们对谁是“最佳”看法不一,但许多人表示中国模型如今已经“足够好”,尤其是在性价比方面。

开源权重、策略与地缘政治

  • 许多人将中国的开源权重发布视为一种有意的“让模型商品化”策略:
    • 压低美国闭源实验室的利润和估值。
    • 推动对中国云、硬件和生态系统的使用。
    • 建立全球软实力,并减少对美国 API 的依赖,尤其是在中国境内。
  • 也有人强调国内竞争极其激烈(“内卷”):公司会积极补贴并开源模型以争夺用户,即使利润很低甚至为负。
  • 关于政府影响存在争议:有人提到习近平支持开源 AI 的言论和国家投资;另一些人则强调企业仍以盈利为目标,并将模型视为出售算力和应用的基础设施。

开源 vs 闭源、安全性与“减速”

  • 许多人强烈支持开源权重:
    • 本地控制,不会“突然翻脸”,也不会被安全限制锁死。
    • 例子:HuggingFace 上曾出现闭源 API 阻止安全取证的事件,迫使人们改用自托管开源模型。
  • 另一种观点认为:强大的开源模型可能降低前沿 CAPEX,并放缓进展(“减速”),一些人认为这有利于安全,另一些人则觉得这种说法被夸大,或过于以美国为中心。
  • 也有人担心美国实验室会寻求监管,以拖慢开源权重竞争对手。

本地模型与硬件

  • 许多人希望有中等规模的开源变体(例如 30–120B dense/MoE),优化到约 24–128GB VRAM,认为 Qwen 3.6 27B、35B MoE、Gemma 4 31B、Bonsai 是当前甜点区。
  • 量化、MoE、SSD offload 和多 token 预测等技术被讨论为在本地运行更大模型的方法,尽管会带来速度权衡。
  • 有人认为,即使巨型模型在基准测试中占优,小而强的模型在隐私、离线使用以及作为廉价 agent 方面仍然重要。

审查、偏见与信任

  • 多条评论称,托管版 Qwen 在政治敏感话题上是最受审查的中国模型之一;开源权重加上“越狱”提示可以减少拒答,但无法消除底层训练中的遗漏或偏见。
  • 一派担心细微的意识形态倾向(例如对天安门、维吾尔族、台湾的遗漏)会通过广泛采用的开源模型传播开来。
  • 另一些人反驳说:
    • 大多数用户不会用 LLM 讨论政治。
    • 西方模型也有自己的政治盲点。
    • 开源权重可以通过微调来抵消检测到的偏见,而闭源模型则无法被用户审计或修复。

开发者体验与用例

  • 体验差异很大:
    • 有些人认为 Qwen 在编码 harness 和 agent 设定中表现出色,尤其是在工具、记忆和谨慎提示的辅助下。
    • 另一些人则表示 Qwen 3.7 对 SWE 完全不可用,更偏好 DeepSeek V4 Pro/Flash、GLM 5.2 或美国前沿模型。
  • 成本性能:
    • DeepSeek V4(尤其是 Flash)因极低价格和极快速度而广受赞誉,不过基准测试显示其幻觉率更高。
    • 中国模型较长的冗余输出和“思考”轨迹,会在 agent 工作流中削弱其原始 token 价格优势。

元话题与文化张力

  • 有几条评论指出,HN 上关于中国模型的讨论很快就会从技术细节转向地缘政治、人权问题,以及对中国公司的不信任。
  • 一些来自中国的参与者表示,这种情况掩盖了技术评估和这项工作的“极客精神”,令人沮丧。