DeepSeek-V4-Flash 更新

DeepSeek 发布了其 V4-Flash 语言模型的重大升级,称其在编码和工具使用基准上取得了大幅进步,已与 OpenAI 最新 GPT-5.6 变体等领先闭源模型处于同一水平,同时每个 token 的成本仍然低得多,尤其在利用缓存命中时更是如此。评论者指出,开源权重、相对较低的硬件需求,以及出色的性价比,使它在本地推理、编码代理和高吞吐量“脏活累活”任务中很有吸引力,尽管在某些推理和多模态能力上仍落后于顶级模型。与此同时,也有人对不透明的基准测试、数据隐私与中国司法管辖,以及在稳定 API 名称背后静默升级模型的运营风险表示担忧。

模型性能与基准测试

  • 更新显示,相比之前的 V4-Flash,在内部测试框架上有大幅提升:Terminal Bench 和 Toolathlon 的增益尤其明显。
  • 与 GPT‑5.6 Terra/Luna 相比:Flash 现在在一些编码/终端基准(Terminal Bench、Toolathlon、CyberGym)上超过了它们,但在另一些(DeepSWE、Agents’ Last Exam)上仍然落后。没有明显的总体赢家。
  • 有人认为官方排行榜(例如 Terminal-Bench、DeepSWE)才是“真实”分数;也有人指出实验室自报数据以及可能存在的拼写错误。
  • 多位用户表示,在编码任务中,Flash 的体验接近前沿模型(Opus 4.7–5.x、Sonnet 5、Luna),但成本低得多。

定价、缓存与单任务成本

  • V4-Flash 被反复描述为“便宜得离谱”,尤其是在使用缓存时。
  • 共享的使用数据:在短短几周内,借助约 99% 的缓存命中率,以不到 20 美元处理了数亿到约 20 亿 token。
  • 直接使用 DeepSeek API 被认为比一些聚合器更便宜,也更适合缓存;也有人使用第三方套餐(例如 OpenCode Go),它们转售 DeepSeek 并提供类似 ZDR 的保证,不过最近措辞的变化带来了不确定性。
  • 与 Luna 的对比显示,Flash 的缓存读价为 $0.0028/MTok,而 Luna 为 $0.02/MTok。

本地推理与硬件

  • 模型:DeepSeek‑V4‑Flash‑284B‑A13B,完整权重约 160 GiB,被描述为一个约 200–300B MoE 级模型却“只有 160 GiB”。
  • 在 2× DGX Spark 或 2× RTX 6000/6000 Pro 上运行效果很好;单块 B300 处于边缘;128 GB M5 Max 可以运行较强量化版本,但速度较慢。
  • 讨论了 4-bit 甚至 2–3-bit 量化;社区项目(例如 ds4)正在快速更新。

使用场景与测试框架

  • 大量用于编码:C#、Rust、C/C++、Go、Python、TS/JS、SQL、CSS/HTML;尤其是在 pi、OpenCode 以及其他子代理系统等 agent 框架中。
  • 用户强调,对生产力而言,“框架比模型更重要”:子代理、MCP 工具、缓存、上下文压缩器,以及用于代码审查的自定义“技能”。
  • 也用于语音转录的 QA、分类、抽取、重写,以及通过搜索 MCP 进行深度网络研究。
  • 有人会把一个“前沿”规划器(Opus/Sol/Luna/K3)与 V4-Flash 搭配,把后者作为廉价执行器。

开源权重、数据与治理

  • 权重已发布到 Hugging Face;许多人认为这对长期“可永久使用”的能力以及通过自托管实现更好的数据保护至关重要。
  • 对将代码发送到中国托管的 API 存在担忧;缓解方式包括使用 ZDR 风格的中介或本地部署。
  • 关于中国开源权重的未来以及美国可能出台的监管存在争论;参与者引用了对政治演讲和意图的不同解读。

版本命名与评估怀疑

  • 模型命名存在混淆:DeepSeek 上旧版和新版 Flash 都暴露为 deepseek-v4-flash;一些提供商会附加 -0731
  • 有几位认为这本应叫“V4.1”,以避免在生产环境中无声无息的行为变化。
  • 一些人对以基准驱动的营销持谨慎态度,并怀疑模型针对基准做了微调;也有人表示,他们基本忽略基准测试,而是依赖真实世界表现。