DeepSeek V4 Flash 0731
DeepSeek 新推出的 V4 Flash 0731 开源权重模型因其以远低于美国实验室模型(如 GPT‑5.6)的成本,提供接近前沿水平的编码与推理能力而受到关注,这在很大程度上得益于激进的 KV 缓存和高效架构。评论者表示,他们将其作为软件开发、agent 和基础设施自动化的日常主力——常常只花几美元就能消耗数亿 token——同时也指出,与 Fable 或 Opus 等顶级模型相比,它在可靠性、长周期任务和工具使用方面仍有取舍。人们担心 DeepSeek 已警告将“显著”涨价,但许多人指出,开源权重和竞争性提供商应能继续压低整体价格,并让这一能力层级被广泛获取。
模型性能与能力
- 许多人认为 DeepSeek V4 Flash 0731“对几乎所有事情都够用”,尤其是在编码、调试、文档分析以及基础设施/DevOps 任务上。
- 它经常被拿来与 GPT‑5.6 Luna / Sol 以及更早的前沿模型(Opus 4.x、Gemini 等)比较:有人说它在许多任务上接近甚至优于 Luna,也有人说它在复杂的真实世界编码(例如图形、Rust、边缘情况处理)上明显更弱、更慢。
- 有几位用户表示,它大致处于 Opus 4.5–4.8 这一档,低于 Fable‑5 / 当前 Opus‑5,但远强于大多数中档开源权重模型。
- 新的 0731 版本被广泛认为比早先的 Flash 预览版有明显提升。
成本、定价与缓存
- 最吸引人的地方是单次任务成本极低;很多人形容它“便宜到可以随便用”,花费不到 10 美元就能烧掉数亿 token。
- 它的 cache read 定价比其他提供商便宜一个数量级;在 agentic/编码工作流中,如果 cache 命中率达到 90–99%,这部分成本占主导。
- DeepSeek 已宣布未来会有一次“显著”的价格上涨;具体幅度尚不清楚。有些人认为即便涨 2–4 倍仍然很便宜;另一些人则担心会涨 10 倍,接近市场价。
- 与 OpenAI/Anthropic 订阅相比:对于重度 agentic 使用,按 API 计费的 DeepSeek 可以便宜得多;对于普通用户,前沿模型的订阅仍可能很划算。
真实世界使用与 harness
- 在 Oh My Pi、omp.sh、Prime Agent、Codex、Cline、OpenCode Go 等工具中很受欢迎,也常用于带有 implementer/advisor agent 组合的自定义方案。
- 用于 CI 测试修复、日志/安全监控、代码重构、Kubernetes/基础设施工作、SEO 和分析工作流,以及长时间运行的多小时 agent。
- 许多人强调,harness 的质量(工具链、缓存、循环检测、提示词纪律)会严重影响感知到的能力和成本。
局限、回退与基准测试怀疑
- 有报告称会出现无限推理循环、自言自语、分心,以及较慢或不稳定的工具调用,尤其是在某些提供商或 harness 中。
- 一些用户认为它在更难的、多步骤编码和长周期任务上明显不如 Luna/Sol/Fable;也有人报告几乎持平。
- 有人担心 ARC‑AGI‑2 等基准测试夸大了真实世界的实用性,或者模型是针对基准进行了调优;ARC‑AGI‑3 的结果仍在等待中。
- 还有人抱怨 0731 之后回答变得更啰嗦、token 更重;但可以通过强提示词缓解。
开源权重、提供商与自托管
- 该模型是开源权重;OpenRouter 及其他平台上的多个提供商都在托管它,通常基础价格相近,但 cache read 费用比 DeepSeek 自己贵得多。
- 有些人将其本地运行在高端 GPU(RTX 6000 Blackwell、MI300X、DGX、Strix Halo)甚至大内存 CPU 机器上,称其吞吐量不错,这使它对涉密/本地部署数据很有吸引力。
更广泛的影响
- 讨论集中在:便宜、且“够用”的中国开源权重模型,是否会威胁美国实验室的业务,尤其是在美国以外的企业市场。
- 有人认为,前沿模型在长周期、自主 agent 方面更高的可靠性足以证明其高得多的价格是合理的;也有人认为,大多数真实工作都会迁移到廉价开源模型加上良好的编排。