DeepSeek v4.1 Flash

DeepSeek 的新 V4.1 Flash 模型是一款大规模开权重多模态 LLM,结合了 552B 参数的稀疏 backbone 和 196B “Engram” 记忆,并采用新颖的因果编码器–解码器设计,大幅压缩 KV cache,以相对较低的 API 价格提供非常高的吞吐量。评论者指出,尽管该模型体量太大,若无极端硬件或激进量化,通常无法在本地常规运行,但它的效率、推理控制和强劲基准表现,使其在许多编码、安全与 agentic 工作负载上接近 GPT-6 Astra 和 Claude Opus 等前沿系统。此次发布也进一步激化了关于中国实验室与美国实验室、开源与闭源模型、提示数据保留,以及安全与“福利”工作究竟是真正的风险缓解还是主要用于营销与监管定位的更广泛争论。

模型架构与特性

  • V4.1 Flash 是一次重大重设计,而不是小幅点版本更新。
  • 使用因果编码器–解码器(CED)Transformer:约 20 层因果编码器 + 20 层解码器。
  • 尽管有:
    • 552B “backbone” 参数(大多约为 FP4,~306GB)
    • 196B FP8 “Engram” / 类 PLE 记忆(~204GB),更像键值存储,可放在 SSD 上
    • 但每个 token 在 prefill 期间仅激活约 8B 参数,解码期间激活 16B 参数。
  • KV cache 被大幅压缩:每个 token 约 890–900 字节(1M 上下文约 1GB),大约是此前 V4 Flash 的 1/4。
  • 支持多模态(视觉)以及可控推理力度(1–100),映射到几个内部级别(low/high/max)。

性能与基准测试

  • 许多评论者表示,其 API 形式极其快:通常 250–400+ tokens/s,不过有些人在某些 OpenRouter 提供方上看到更低速度。
  • 基准测试:据称在若干编码、agentic、安全任务上接近或超过此前“前沿”的闭源模型,但:
    • 与 GPT-5.6 Sol、Opus 5、Kimi K3、GLM 5.3 相比,它在一些基准上获胜,在另一些基准上失利。
    • 几个人提醒要警惕“benchmaxxing”而非真实世界可用性。
  • 早期上手体验:在编码、安全分析和自动化漏洞分诊方面表现强劲;一些人认为其整体“手感”略低于顶级闭源模型,但远强于大多数开权重模型。

硬件与本地部署

  • 完整权重约 510–550GB,再加上 KV cache;实际快速本地使用被认为需要约 384GB+ 内存或多张高端 GPU。
  • 256GB 系统只能通过重度量化和/或 SSD 卸载来运行,这会显著拖慢 prefill。
  • 稀疏性和 Engram 卸载应当使 SSD 流式传输对慢速、无人值守工作负载成为可行方案。

定价与效率

  • 官方定价强调非常便宜的 cache 命中(低至每 100 万 token $0.003–0.006 的离峰价格),使长周期 agentic 工作负载比可比闭源模型便宜得多。
  • 相较于早先的 V4 Flash 和 V4 Pro,不同提供方的定价有些令人困惑;DeepSeek 直接定价中,输入 token 相比近期 V4 Flash 峰值有所下降,输出大致相近,cache 更便宜。
  • 几位用户报告,数十亿美元级 token 的运行成本只有几十美元。

安全性、开放性与政策

  • 人们对开权重和详尽技术报告的热情很高,与美国实验室更重视安全/“模型福利”文档和闭源权重形成对比。
  • 关于安全与“品牌安全”以及监管俘获的争论;一些人希望在安全/渗透测试方面少一些护栏,另一些人则认为对齐(alignment)被低估了。
  • DeepSeek 通过某些路线会用用户提示词进行训练;有人认为这对编码可以接受,另一些人则会避开用于敏感或专有工作。

开发者体验与工具

  • DeepSeek Harness 被称赞为强大的 agentic 编码环境;一些人比起第三方 harness 更偏好它。
  • V4.1 Flash 将在路由中取代 V4 Pro;一些人已经把它推广为其软件工厂的主要“主力”模型。
  • 小烦恼:部分用户在官方 UI 中收到中文回复;在涉及“盗版式”请求时,偶尔会出现拒绝行为。