DeepSeek V4 Pro 0813

DeepSeek 的新 V4 Pro 0813 模型被拿来与其自身的 V4 Flash 变体,以及 Claude Opus、Fable、OpenAI 的 Sol/Luna 等美国“前沿”模型进行比较:基准测试显示它略低于最顶级系统,但在 DeepSeek 激进的提示缓存加持下,每个任务的成本只是一小部分。许多工程师认为,Flash 在日常编码中仍然是性价比最好的选择,而 Pro 在规划、审计和更难的推理任务上可能更值得使用,不过结果会非常依赖所选的 agent harness 和工作流。评论者也在权衡隐私、中国模型在西方企业中的采用,以及 DeepSeek 宣布将提高峰/谷定价这一变化——即便如此,它仍可能比西方竞争对手便宜得多。

与其他模型的整体定位

  • 基准测试显示 DeepSeek V4 Pro 0813 接近 Fable 5 / Opus 5 级别,并高于 GLM 5.2,Flash 紧随其后。
  • 用户将其与 Qwen3.8-max、Kimi-K3、GPT-5.6(Luna/Sol)、Grok 4.6、MiMo、GLM 5.2 相比较:普遍共识是“接近前沿”,但并非公认最强。
  • 一些人表示,在他们的任务上 Pro 不如 Luna 或 Kimi;另一些人则说把缓存和成本算进去后,它又胜过 Luna。

定价、缓存与订阅

  • 原始 token 价格非常低;在大量缓存读取的情况下,有人声称每个任务的成本比 Opus 低 10–60 倍,也比用于编程 harness 的 Luna 更便宜。
  • DeepSeek 正在引入高峰/非高峰定价,并警告未来将有“显著”涨价;关于时间点和新费率的具体数值仍然有混淆。
  • 争论点在于:购买 API token 的用户 vs. 获得大幅补贴的 ChatGPT/Claude 订阅用户。很多人指出,订阅在实际效果上可以把所有按 token 计费的方案都压低。

Pro vs Flash 以及真实世界的编码

  • 基准测试:在编码/agent 任务上,Pro 大约比 Flash 高 5 分,但很多人觉得 Flash 已经“足够好”,而且便宜得多。
  • 一些工作流是:“Pro 负责规划,Flash 负责实现”或反过来;也有人使用前沿模型(Sol/Fable/Opus)来规划/审阅,再用 DeepSeek 来实现。
  • 有几位提到 Pro 感觉更慢,而且并不总是比 Flash 值得;另一些人则说 Pro 每次任务更可靠,也更不啰嗦。
  • 普遍共识是 harness/工具链非常重要:在 Pi、OpenCode、Codex 等不同环境下,结果差异巨大。

质量、幻觉与适用领域

  • 反馈不一:有人称 Pro 在 pass@1 上“并不可靠”,但在 pass@3 上很强;另一些人说,在他们的多轮 agent 循环里,它与 Sol/Fable 持平甚至更好。
  • 据称 ArtificialAnalysis 的幻觉指标对 DeepSeek 模型表现很差;一些用户也确认,在非编码或多语言散文上幻觉更多。
  • 在安全审查、性能调优、研究/评测以及 agentic 循环中,不少用户对 Pro 的性价比印象很深。

隐私、政治与托管

  • 有人担心 DeepSeek 会保留数据并用提示词训练;在出现零保留提供商之前,一些人拒绝做基准测试。
  • 另一些人不把这些顾虑当回事,甚至更愿意让数据处于美国司法管辖区之外。
  • 即使模型托管在美国/欧盟,或在本地运行,企业也可能因为监管/政治风险而避开中国来源模型。

生态与部署

  • Pro 0813 的权重目前还没有被广泛提供;Flash 已经可以本地运行,并被称赞为“便宜到几乎无法计量”。
  • 用户也在讨论 OpenRouter 的替代方案(其他路由器、直接使用 API),以获得更好的缓存、更强的隐私控制或更低的费用。