Groq 以 500 T/s 运行 Mixtral 8x7B-32k
Groq 发布了一项 LLM 托管服务,其中 Mixtral 8x7B 模型在定制的“Language Processing Unit”ASIC 上运行速度约为每秒 500 tokens,远超典型的 GPU 承载部署。评论者对接近即时、达到 GPT‑3.5 级别的响应以及按 token 计费的低价格印象深刻,但也追问其实现方式,质疑总硬件成本、功耗、超出少数旗舰模型后的可扩展性,以及商业模式的长期可持续性。讨论还探讨了技术细节,例如确定性、重 SRAM 的架构、部分 FP8 量化、对微调和非 LLM 工作负载的支持,以及这种延迟降低能够为实时语音、代理和其他交互式应用带来什么。
性能与用户印象
- 许多用户报告称,通过 Groq 演示和 API,Mixtral 8x7B 的速度可达 400–500+ tokens/s,而 Llama 2 70B 约为 200 t/s。
- 主观反馈非常积极:速度“即时”或“超人类”,尤其与 GPT‑3.5/4 和 Gemini 相比。
- 不少人表示,这种速度会实质性改变 UX:更容易快速浏览、反复迭代并构建交互式工具;缓慢的自回归现在感觉“过时”了。
- 有些人认为该模型在编码和通用任务上的质量可与 GPT‑3.5 相当,甚至更好,但仍未达到 GPT‑4 的水平。
硬件与架构
- Groq 使用定制 ASIC(“GroqChips”/LPU),每颗约有 230 MB 片上 SRAM,部署在由数百颗芯片组成的机架中;据称当前演示使用了约 568 颗芯片。
- 架构强调确定性、固定时钟,以及类似脉动阵列的矩阵引擎和确定性的芯片间互连(约 100 Gbps 链路)。
- 使用 KV cache;解码目前实际上以 batch size 1 运行,但由于该架构,吞吐量很高。
- 部分编译器流水线和基础设施用 Haskell 实现;其他组件使用 C++/MLIR 和 Python。
延迟、吞吐量与批处理
- Groq 将自己定位为针对低延迟、小批量推理进行了优化,而不是像 GPU 栈那样主要依赖大批处理来获得高吞吐量。
- 引用的独立基准显示,其首 token 时间极低,单请求吞吐量很高,包括通过公开 API。
- 讨论指出,GPU 可以实现非常高的总 tokens/s,但通常以较低的单用户速度为代价。
精度、量化与质量
- 激活值以 FP16 计算;部分权重在“静态存储”时以 FP8 形式保存。Groq 声称与完整 FP16 相比没有显著质量损失。
- 用户报告称 Mixtral 的质量至少与强 3.5 级模型相当;也有人强调存在明显幻觉和算术失败(例如质数、因式分解),强调更快的硬件并不能修复模型本身的局限。
成本、规模与商业模式
- 零售加速卡价格昂贵(每张约 20k 美元),这意味着演示规模所需硬件价值数百万美元;Groq 表示其自有成本远低于零售价。
- 一些观察者质疑每美元对应的 tokens/s 和总功耗;另一些人指出,对于某些用例,低延迟可能足以证明高资本支出是合理的。
- Groq 同时出售 tokens“as a service”(并承诺对受支持模型击败竞争对手的单 token 价格)以及面向企业的完整系统;短期内没有面向爱好者的硬件计划。
API、生态与访问
- 提供类似 OpenAI 的 chat/completions API,具备部分兼容性;同时提供文档和 Discord。
- 最近巨大的关注带来了等候名单和排队;一些用户报告称,虽然一旦开始生成速度很快,但等待时间很长。
- 多位开发者表达了强烈兴趣,希望将 Groq 作为应用、RAG 系统和代码工具的后端。
用例与应用
- 低延迟被认为对以下场景尤其有价值:实时语音代理(CNN 演示)、呼叫中心、交易、“copilot”风格助手、游戏/VR NPC,以及多步 agent 流水线。
- Groq 声称该硬件是通用数值计算,适用于视觉和扩散模型;已有一些扩散相关工作,但尚未公开提供。
批评、限制与开放问题
- 关注点包括:缺乏 HBM 限制了每颗芯片的模型容量;大型模型需要数百颗芯片;整体系统吞吐量不明确;以及价格可能不可持续。
- 有人认为,带 HBM 的 GPU 在多模型、多 LoRA 或本地部署场景中可能更好;也有人反驳称,Groq 的确定性系统和 SRAM 对超低延迟至关重要。
- 还提到了一些 bug 和 UX 问题:演示中的模型切换行为令人困惑、移动端 UI 怪异、字体加载依赖,以及偶发的循环输出。
- 多位用户强调,幻觉和推理限制仍然存在;速度本身并不能解决模型可靠性的核心问题。