Qwen3.8-Flash-Next
Qwen3.8-Flash-Next 是阿里巴巴推出的一款新的 mixture-of-experts 大语言模型,因其在性能上超过了更早的 Qwen 版本、而训练和服务成本又低得多,并且预示了 Qwen 4 计划采用的架构而引发关注。它将一个 125B 参数的主模型与一个大型 n‑gram “engram” 记忆结合,把事实回忆与推理分离,在较低激活参数下仍有很强质量,因此对高内存 Mac、AMD Strix Halo 系统和 DGX Spark 机器上的本地部署很有吸引力。评论者总体热情高涨,但也指出当前仍有局限:llama.cpp 和 vLLM 等工具刚刚开始支持,量化版本因 n‑gram 侧车而体积很大,而且与一些前沿托管模型相比,token 过度思考和冗长仍然是问题。
模型表现与定位
- 许多人认为 Qwen3.8-Flash-Next 在基准测试上超过了 Qwen3.8-27B 和 DeepSeek V4 Flash,尤其考虑到它是一个相对小型、按激活参数计的 MoE(每个 token 约 ≈6B)。
- 一些人对它能如此干净利落地“击败”稠密的 27B 感到惊讶;另一些人则指出,这对于更新的架构和 MoE 设计来说是意料之中的。
- 大家对它与专有“前沿”模型在每任务成本上的对比很感兴趣,也有人怀疑仅凭按 token 计费并不能说明全部问题。
架构:MoE 与 N‑gram / “engram” 嵌入
- 该架构被描述为 125B 主参数 + 约 51B N‑gram 嵌入,每个 token 激活 6B;有人将其视为未来 Qwen 4 家族的预览。
- N‑gram/engram 表被概括为:
- 一个事实回忆侧车,在不压垮稠密权重的情况下保留特定知识。
- 在精神上类似 RAG,但集成在网络内部,并不使用上下文窗口。
- 一种用额外内存换取更少每 token 计算量和更强长尾“世界知识”的方式。
- 有人澄清,这在实践中并不只是“1 位量化”;核心模型和 N‑gram 表的有效比特率不同。
本地部署与硬件
- Strix Halo、DGX Spark、高内存 Mac 以及 AMD/Apple 平台用户表现出强烈兴奋:128 GB 统一内存是一个常见目标。
- 报告的速度:
- Strix Halo:目前约 20–35 tok/s,预计借助更好的 kernel/MTP 可达到 50–60 tok/s。
- DGX Spark:解码约 12–20 tok/s,借助自定义引擎和 NVMe 分页的 N‑gram 预填充约 80–190 tok/s。
- 担忧在于:N‑gram 侧车(约 50 GB+)使其难以在 32–64 GB 系统上运行,从而削弱了最初“6B 激活 MoE 会更适合 CPU”的希望。
工具链、量化与生态
- 早期阻力:主线 llama.cpp 和 vLLM 最初都不支持;现在已有分支和特殊构建,PR 也在推进中。
- Unsloth 提供 GGUF 量化,并说明即便“1 位”也需要约 75+ GB RAM;更高比特的量化可能达到 ~90+ GB。
- 有人抱怨当前量化过度聚焦于极低比特(1–2 bit),可能低估模型质量;也有人展示了即便在 2-bit 下依然不错的结果。
推理风格、过度思考与 token 效率
- 多位用户报告,较早的 Qwen 3.8 模型在高推理等级下会“过度思考”,尤其是在开放式或单次任务上,导致输出缓慢且冗长。
- 一些人希望 Flash-Next 更直接;早期轶事说法不一:它有时仍会反复斟酌,但往往也能给出很强的结果。
- 有人担心中文“flash”模型(包括 GLM 和 DeepSeek)会通过很长的内部推理链浪费大量 token,而这对 API 成本很重要。
定价与经济性
- Qwen3.8-Flash-Next 的 API 定价(例如每百万 token $0.16 / $0.47)与 DeepSeek 和 OpenAI 的档位作比较。
- 对于这种价格下推理是否有利润存在争论:
- 一方认为推理显然是有正毛利的,价格也符合更广泛的市场水平。
- 另一方怀疑激进折扣、交叉补贴或上市前定位可能掩盖了真实成本。
知识 vs. 工具 vs. 架构
- 一些评论转而讨论:较小模型配合网页搜索或外部知识存储,能否匹配较大模型内置的“世界知识”。
- 有人认为:
- 大模型编码了广泛的书籍/知识,但并不具备完美回忆,因此检索和引用仍然重要。
- 当新鲜度和模块化知识库更重要时,带工具的小模型可能更合适。
- 也有人强调,“你不能搜索你不知道存在的东西”,因此内部的概念覆盖对于发现算法和技术仍然很重要。
开源动态与地缘政治
- 线程中提到,相较于美国实验室较为保守的做法,中国团队(Qwen、DeepSeek、GLM)则更激进、发布更频繁且更开放。
- 一些人认为,这种快速的开放发布周期推动了本地 LLM 创新,并让新架构(MoE + N‑gram、MTP 等)迅速变得可用。
- 潜在基调是:受严格控制的前沿 API 与开源权重的中文模型将并存,并共同推动领域前进。