Qwen 3.8 27B 已在 Cerebras 上可用,速度达 1500 tokens/s
Cerebras 已为 Qwen 3.8 27B 模型推出超高速云推理,速度约为每秒 1,500 个 token,许多用户对其编码能力和响应速度印象深刻。然而,开发者也指出了显著缺点:上下文只有 128k,而非模型的全部潜力;每分钟 token 限制严格;提示缓存没有带来价格优势;成本相对较高,使持续性或 agentic 编码工作负载不切实际。许多人认为,这项服务更像是 Cerebras 硬件的展示,而不是一个能与更便宜的基于 GPU 或自托管部署相竞争的日常替代方案。
模型性能与速度
- Cerebras 上的 Qwen 3.8 27B 因在编码和推理方面非常强而广受好评,输出速度极快(最高约 1500 tok/s),延迟也很低。
- 一些用户表示,它在体验上“感觉”具有变革性(几乎即时的回答),尤其适用于搜索、摘要和快速代码任务。
- 也有人说,对于大型提示,输入处理仍然占用大部分时间,因此一旦把工具调用和 shell 命令算进去,相比 ~100–200 tok/s 的模型,整体墙钟时间收益可能并不大。
定价、缓存与 token 经济性
- 价格约为按需信用模式下输入 $0.99/M、输出 $1.49/M tokens(无订阅费,最低充值 $10)。
- 支持提示缓存,但:
- 缓存的输入 tokens 价格与新鲜 tokens 相同。
- 缓存 tokens 仍计入每分钟 token 限额。
- 许多人认为这是“只有营销意义”的缓存,因为它移除了主要的经济收益,使得 agentic 工作负载相比那些对缓存命中大幅打折的竞争对手要贵得多。
速率限制与对编码/agentic 工作负载的适用性
- 公共端点限制:未缓存 tokens 约 150k/分钟,总计 450k/分钟。
- 以 1500 tok/s 的速度,用户会很快碰到这些限制,尤其是在上下文很大且工具调用频繁时。
- 有多人反馈,在几分钟内就把免费额度烧完,并且在持续的 agentic 编码 60–90 秒内就触及限制。
- 共识:适合短促、突发型任务;对于长时间运行的编码 agent 和大型项目,经常“不可用”。
上下文窗口与模型配置
- 尽管该模型在其他地方支持更大上下文,Cerebras 仅暴露 128k 上下文。
- 许多人认为,一旦把系统提示、工具、历史记录和代码库都算上,128k 对严肃的编码/agentic 设置远远不够;上下文很快就会塞满,压缩又会成为瓶颈。
- 有人指出 Qwen 3.8 默认的“extra-high reasoning”会进一步增加上下文需求。
对比:其他提供商与本地托管
- 其他托管方(例如 OpenRouter、专用 GPU 提供商)速度较慢(约 80–300 tok/s),但:
- 缓存折扣更好。
- 长会话的实际成本更低。
- 许多用户在本地运行 Qwen 3.8 27B(GPU、ninfer、llama.cpp),速度约 30–200 tok/s,没有速率限制;对于持续性工作负载和敏感数据,很多人更偏好这种方式。
- 对于小型工作负载,Cerebras 的速度溢价也许值得额外成本;但对于大型 agentic 编码,其他方案的总成本往往更低。
产品策略、可靠性与支持
- 多位评论者认为公共 API 更像是一个演示/营销渠道,用于销售 Cerebras 硬件和企业交易(例如为大客户托管超大模型)。
- 抱怨包括:
- 配额紧张,移除/共享层模型(例如 Gemma 4)且几乎没有提前通知。
- 计费/访问相关错误不稳定且令人困惑。
- 对 Discord 的支持依赖很重,包括上手问题。
- 总体评价:硬件和原始速度令人印象深刻,但公共服务给人的感觉是容量受限、持续编码成本高,而且对开发者不友好。