Qwen 3.8 27B

Qwen 3.8 27B 是阿里巴巴 Qwen 团队推出的一款新的开源权重 27B 参数模型。它被视为一个里程碑,因为它在编码和 agentic 基准上接近 Claude Opus 4.6 级别的表现,同时仍可在高端消费级硬件上运行。评论者们分享了针对 GPU 和 Apple Silicon 的具体配置、量化选择与吞吐量数据,并将它与 Gemma 4、Muse Glimmer、DeepSeek V4 Flash 以及更早的 Qwen 版本进行比较。一个反复出现的主题是基准结果与“真实工作”之间的差距——尤其是过长的推理轨迹、世界知识限制以及 harness 质量——但许多人认为,这是第一个真正能在相当大比例的日常开发任务中替代付费云端模型的 dense 本地模型。

模型能力与基准宣称

  • Qwen 3.8 27B 被描述为本地模型的一大进步,据称在编码和 agentic 任务上的基准分数接近或达到 Claude Opus 4.6/4.7(例如 DeepSWE、Terminal Bench、computer use)。
  • 一些人认为这说明约 30B 的 dense 开源模型在许多任务上正接近上一代前沿模型的质量。
  • 也有人认为基准夸大了能力(“benchmaxxing”),尤其是在长程规划、意图推断和细腻的现实世界工作方面。

真实世界质量 vs SOTA

  • 一些用户表示 Qwen 27B 已经“够用”,或在编码、视觉和结构化任务上接近 Sonnet/Opus。
  • 反方观点是:前沿模型在从稀疏指令中推断用户意图、深层世界知识,以及长而复杂的工作流方面仍然更强。
  • 许多人强调,真正重要的只是任务特定的内部评测;公开基准可能具有误导性。

本地部署、速度与硬件

  • 可在高端消费级 GPU(4090、5090、Strix Halo、M 系列 Mac)上运行,但表现差异很大:根据量化、上下文和运行时(llama.cpp、vLLM、Ninfer、MLX),大约为 ~20–100+ tok/s。
  • FP8 / FP16 全权重需要较大的 VRAM;Unsloth GGUF 和 NVFP4 量化面向“每一台土豆机”设备;2–4 bit 量化则以质量换取适配性。
  • Mixture-of-Experts(例如 Qwen 3.6 35B A3B、AgentWorld、Gemma 4 26B-A3B、Muse Glimmer)由于激活参数更少,在相近感知质量下快得多,因此在带宽受限的硬件上通常更受欢迎。

思考模式、过度思考与模板

  • 3.8 默认启用推理并采用“xhigh” effort,这显著提升了基准表现,但也会导致很长的“thinking”轨迹、较高的 token 消耗,以及被感知为过度思考。
  • 用户报告更实用的做法包括:降低推理 effort(“medium/low”)、加入 thinking budget,或使用社区修正过的聊天模板(尤其是为修复工具调用和循环问题)。
  • 一些人认为长时间思考属于测试时扩展;另一些人则把它视为 harness 问题,而不是模型缺陷。

使用场景与工作流

  • 编码能力强(尤其是本地开发 agent)、SVG / HTML 生成、视觉任务(OCR、图像描述)、邮件垃圾过滤、听写后处理,以及小型 agent 子任务。
  • 较小的 Qwen/Gemma 模型经常作为工具或子 agent,与 DeepSeek、Luna、Gemini 等云端模型搭配使用。
  • 对许多人来说,云端前沿模型在速度和“首轮即正确”方面仍更受青睐;本地 Qwen 则用于隐私、成本控制或离线能力更重要的场景。

开放 vs 闭源与经济性

  • 线程突出了一个张力:快速进步的开源模型 vs 昂贵的闭源 API 与巨额资本投入。
  • 有人认为不断进步的 27B 级开源模型正在削弱前沿实验室的护城河;也有人认为企业仍会为最佳速度、可靠性、工具链和托管付费。