Groqchat

Groqchat 展示了 Meta 的 Llama 2 70B 模型运行在 Groq 定制的“Language Processing Unit”硬件上,每位用户可达到每秒数百个 tokens——远快于典型的基于 GPU 的部署。评论者对速度和低延迟印象深刻,尤其是在代码和大模型推理方面,但也指出输出质量和严格的安全过滤受限于底层的 Llama 2 chat 模型,而非硬件本身。该讨论串还探讨了 Groq 的架构与扩展策略、其对推理(而非训练)的专注,以及对未来支持 Mixtral 等模型和更广泛 API 访问的兴趣。

性能与基准测试

  • 主要的兴奋点在于速度:用户报告 Llama‑2‑70B 的速度约为 270–300 tokens/s,而同一模型在其他服务上的速度约为 60 tokens/s。
  • 多位评论者指出,这是他们见过的 ≥70B 模型中最快的;也有人强调重点在于 tokens/s 和延迟,而不是模型质量。
  • 一些人希望看到更清晰的基准测试和苹果对苹果的比较(相同模型、上下文长度、批量大小,以及 $/token 和瓦特数)。
  • Groq 员工提到部署使用了 9 个机架 / 576 颗芯片,整个模型被分片到片上 SRAM 中,以实现极低延迟。

模型质量、安全性与审查

  • 许多人觉得回答很快,但经常是错误的、幻觉式的,或者会循环;一些任务(代码、基础应用设计建议、食谱)看起来与 GPT‑4 “同一水平”,而其他任务则明显更差。
  • 多位用户抱怨安全过滤过强:对诗歌、歌词、轻度性/浪漫内容,甚至无害的图像提示都会拒绝;被描述为“过度审查”或“无聊”。
  • 另一些人认为,这正是 Llama‑2‑chat 风格安全调优的预期结果,质量由模型选择而非硬件决定。

硬件与架构

  • Groq 被描述为一家定制芯片硬件公司;其 LPU / GroqChip 构成了低延迟、高吞吐的“计算织物”,而不是类似 GPU 的架构。
  • 他们将模型完全存放在跨许多芯片的 SRAM 中(没有 DRAM),这被认为成本高昂,但非常适合快速的 batch-1 推理。
  • 据说训练仍然更适合 GPU;Groq 专注于推理,尤其是在延迟和每位用户的 tokens/s 很重要的场景。

生态系统、产品与定价

  • API 和定价被说成“即将推出”,并声称它们会在价格上与 OpenAI 具有竞争力,但速度快得多。
  • 用户询问:mixtral‑8x7B 和 Mistral‑7B 部署(进行中)、长上下文、家用/LLM 盒子、单卡,以及垂直行业用例(例如医疗保健)。
  • 一些人担心软件栈成熟度以及对新架构(例如 MoE)的长期适应能力;回应则声称工具链可以编译任意 PyTorch/ONNX 模型。

UX 与杂项

  • 有几位称赞其响应性,但批评聊天界面(流式输出会不断滚动、禁用了 iOS 自动更正)。
  • 对于输出是否在其他地方与 Llama‑2‑70B 完全一致,也存在一些困惑;在讨论串中这点仍不清楚。