Phind-70B:在运行速度快 4 倍的同时缩小与 GPT-4 Turbo 之间的代码质量差距

来自 Phind 的一款新的 70B 参数、面向代码的语言模型因声称在运行于 H100 GPU 上时可达到 GPT‑4 级别的编码质量,同时速度显著更快而受到关注。开发者报告的真实使用结果喜忧参半但总体偏正面:许多人认为它在代码生成和技术问答方面很强,尤其是在“chat”模式下,而另一些人则认为 GPT‑4 在困难逻辑、细腻的 API 使用,以及复杂的 CI 或重试逻辑示例上仍然更胜一筹。更广泛的话题包括对基准测试过拟合的怀疑、对硬件、量化和上下文窗口的讨论、对 API 和更好 UX 的需求,以及一种感觉:专门化的编码模型可能会越来越多地补充或与通用 LLM 竞争。

模型质量 vs GPT‑4 / 其他 LLM

  • 许多用户认为 Phind‑70B 非常快,而且编程能力很强,在实际开发任务上有时可达到“GPT‑4 级别”,尤其是在以代码为中心的“Chat/Code”模式中。
  • 也有人报告称,与 GPT‑4 相比,它在以下方面结果明显更差:
    • 逻辑谜题和 trick questions。
    • 细腻的 API / 文档总结以及 IoT / 安全设计问题。
    • 细微的编码任务(例如带有 POST 重试的 Go RoundTripper、CI 管道),在这些任务中 GPT‑4 能捕捉到更多边缘情况和最佳实践。
  • 有几条评论指出,GPT‑4 Turbo 在代码方面比原始 GPT‑4 弱;Phind‑70B 可能会胜过 Turbo,但不及 GPT‑4 “classic”。
  • 讨论中还提到了 DeepSeek、Mistral、Gemini 等;有人说 DeepSeek Coder 是他们在本地运行过的最强开源模型,但也承认 Phind‑70B 很令人印象深刻。

基准测试、评估与专门化

  • 多位评论者因污染、容易“作弊”以及任务设计不佳,而不信任当前的代码基准(HumanEval 和开源 LLM 排行榜)。
  • 有人认为模型规模不再是质量的简单代理;也有人反驳说,长尾覆盖仍然更有利于 GPT‑4 这样的大模型。
  • 大家对更好、更贴近真实、由人工评判的编码基准,以及 arena 风格的一对一评测表现出兴趣。

服务、训练与基础设施

  • Phind 表示其在 H100 上使用 NVIDIA TensorRT‑LLM;评论者推测其中很可能也涉及 Triton。
  • 讨论了内存需求:70B 在 4-bit 下可放入约 35–48 GB VRAM;完整 16-bit 则约为 140 GB,这意味着需要多 GPU 配置。
  • 团队报告称有一块 H100 真的“熔掉了”,而且 H100 故障率相对较高;有人推测可能是气流/PLX 问题,并提到其他 GPU 上与 FP8 相关的降频。

产品行为、UX 和模式

  • 强烈好评包括:
    • 速度快,并且愿意输出详细代码而不是拒绝回答。
    • 针对技术查询的网页搜索 + LLM 集成;有些人因此从 Google 转向它。
  • 弱点和 bug:
    • 70B 选择有时会悄悄回退到 34B,尤其是在未登录时。
    • 公开聊天 URL 可被任何人编辑,从而改变可见答案。
    • RAG / 搜索会“污染”答案;Chat/Code 模式通常比 Search 模式表现更好。
    • 模型偶尔会无法读取自己的博客页面(例如关于上下文窗口的问题)。
  • 需求包括:
    • OpenAI 兼容 API、更多支付方式、移动应用、更好的聊天记录组织,以及改进无障碍标签。

开放性、生态与未来

  • Phind 已发布较早的 34B 权重,并表示打算发布更新的 34B,最终也会发布 70B 权重。
  • 一些人批评它仍是另一个封闭的、围墙花园式模型,直到权重和 API 被广泛开放。
  • 更广泛的讨论涉及模型的快速激增、筛选有用研究的必要性,以及通过 API 调用其他模型的 meta‑LLMs 可能兴起。