Qwen 3.8-Flash-Next 明天发布(125B a6B)
Alibaba 的 Qwen3.8-Flash-Next 模型因其大型 MoE(专家混合)架构而受到关注:总参数 125B、每个 token 激活 6B,设计目标是可在高端“消费级”硬件上运行,例如 128GB 的 Mac、Strix Halo 系统,以及 32GB+ VRAM 的 GPU。评论者认为它有可能成为适合本地运行、具备 Opus/Sonnet 级别的编程和“agentic”工作负载替代方案,但也指出其在速度、内存占用、量化质量,以及家庭环境中运行此类模型的实际可行性方面存在权衡。很多人将这次发布视为即将到来的 Qwen4 系列的早期技术预览,目的是在完整产品线到来前,让推理栈和工具链先跟上。
模型架构与目标
- 早期描述(现已移除)称:这是一个 125B 参数的多模态 MoE, 每个 token 约有 6B 参数激活,另外还有约 51B 的 n-gram embeddings 和一个新的 “Qwen Sparse Attention”。
- 据称它以约 1/9 的训练成本达到了接近 Qwen3.7-Plus 的能力,并且在编程和协作表现上更好。
- Qwen 团队表示,这主要是一个架构预览,方便推理栈为即将到来的 “full family” Qwen4 模型做准备,而不是一个完全打磨完成的正式版本。
参数数量、扩展性与“有效规模”
- 讨论中的一个经验法则是:MoE 的“有效 dense 规模”≈总参数与激活参数的几何平均数。对于 125B-a6B,这个值约为 27B,这也符合大家对其质量会类似 Qwen3.8 27B 的预期。
- 有些人预计它在编程和 Linux 任务上的能力大致可达 Sonnet/Opus-4.6 级别,但会带来额外的“过度思考”,可通过 temperature 和提示词来缓解。
硬件需求与性能
- 很多人认为 128GB 内存级别的机器(Mac Studio、Strix Halo、DGX Spark、大型 GPU)才是它真正的目标平台。
- 几个基准和经验分享:
- Qwen3.8 27B 在 5090 和双 GPU 台式机上运行良好;为了避免质量下降,推荐 32GB+ VRAM 和 ≥6-bit 量化。
- Strix Halo 在 27B dense 模型上表现吃力(通常约 10–30 tok/s),但 6B active 的 MoE 可能达到约 25–40 tok/s;prefill 延迟仍然是个痛点。
- M5 Max 相比 M4 在 prefill 上有明显提升;据报道,在 27B 上配合 MTP 和优化过的 MLX 运行时可达到 25–70 tok/s,不过也有人看到更接近 30–35 tok/s。
- 对完整模型来说,FP8 似乎对 96GB VRAM 来说仍然太大;建议消费者配置应预期使用 FP4/Q4。
本地 vs 云端,以及路由器
- 许多人喜欢高端本地模型,但相较于付费云 API,在交互式编程和 agent 工作流中仍觉得它们太慢。
- OpenRouter 因灵活性受到称赞,但也被批评:
- Qwen 端点不稳定或容量受限。
- 与直接走提供商相比,prompt caching 的经济性更差。
- 想要锁定稳定、便宜的提供商很困难,而且往往需要大量配置。
- 也有人更喜欢自托管路由器(例如带模型别名、本地/云端回退),因为更可预测,也更利于成本控制。
比较与生态影响
- 预计该模型会与 DeepSeek 风格的“flash” MoE 以及其他 27–35B 级别模型竞争(Qwen3.6/3.8、Gemma 4、Laguna、Ornith、GPT-OSS)。
- 情绪褒贬不一:一方面对一个强大、可在半消费级硬件上运行的 MoE 感到兴奋;另一方面也对速度、内存价格,以及它是否真的能取代 Claude/其他前沿 API 持怀疑态度。