DeepSeek 推出 v4.1 Flash,比 v4 Pro 更便宜也更强

DeepSeek 正在推出其 V4.1 Flash 大语言模型,早期用户表示它比现有的 V4 Pro 更快、更便宜,而且往往更强,尤其适合编码和代理式自动化任务。公司还在下调每个 token 的价格,并暂时把所有 V4 Pro API 调用路由到按 Flash 计费的 V4.1 Flash;一些人称赞这很友好,另一些人则批评这对依赖稳定模型行为的生产工作负载有风险。评论者强调它相对于西方提供商的高性价比,指出语言混用和冗长“推理”轨迹等问题,并强调开放权重和自托管在一定程度上缓解了数据隐私与模型变动的担忧。

模型能力与定位

  • V4.1 Flash 被宣布比当前的 V4 Pro 更便宜也更强;有人认为这种“Flash 超越 Pro”的模式正在成为新常态。
  • 早期测试者表示,它在很多编码/代理任务上与 GLM 5.3 Flash 相当或更好,并且接近前沿模型,但在纯推理方面不一定是顶级。
  • 预览 API 模型已支持视觉能力,人们已经开始用它来重构内核、移植代码以及其他重型编码任务。

定价与经济性

  • Flash 的官方定价(非高峰时段)在缓存命中、缓存未命中和输出 token 上都在下降;由于把不同提供商和旧价格混在一起比较,曾引发一些混淆。
  • 高峰时段是非高峰时段的 2×,但这本来就如此;用户指出,相比美国实验室它依然极其便宜,因此新的自动化用例变得可行。
  • 有几位评论者认为,关键变化不是“Flash 取代 Pro”,而是“Flash 让许多小而重复的任务值得自动化”。

性能、工具与本地部署

  • 预览测试报告显示速度为 300–400 tok/s,有时甚至比被调用的工具更快。
  • 开放权重和 GGUF 量化让人们可以通过 llama.cpp、dwarfstar 和其他运行时,在 128 GB RAM 上本地运行大型 Flash/视觉模型。
  • Flash 被广泛用作更强规划器(例如 Opus、Sol、GLM Max)的“执行工人”,尤其适合代码实现。

可靠性、推理与易用性

  • 体验分歧很大:有人觉得 V4 Flash 在编码和代理方面极其可靠;也有人看到无限循环、幻觉、无效工具调用,以及病态的“但是等等”链条,尤其是在第三方提供商或重度量化下。
  • 工具调用的健壮性差异很大;大家强调,运行环境设计(重试、宽松 schema、结构化输出)至关重要。
  • 推理级别(low/high/max)遭到批评:low 几乎等于关闭,high 几乎等于 max,导致运行缓慢、冗长且昂贵;人们希望有真正的“medium”。

语言行为与 Web UI 问题

  • 即使提示词是英文,Web 聊天也经常用中文回答或“思考”,尤其是在网页搜索之后;加入“用英文”只能部分缓解。
  • API 使用中据说较少出现这个问题;有人猜测是中文系统提示和搜索结果压过了语言指令。

生产使用、模型稳定性与路由变更

  • DeepSeek 将在一段时间内把所有 Pro 请求路由到按 Flash 价格计费的 V4.1 Flash。
    • 支持者称这对用户友好、也更节省算力。
    • 批评者担心这会破坏已经调校好的工作流,并希望有明确、可固定版本的模型,或者提供 “Auto” 与“精确模型”选项。
  • 更广泛的争论:
    • 一方认为:云端 LLM 本质上是非确定性的,因此固定精确模型并不现实;认真使用的人应该自托管。
    • 另一方认为:即便存在非确定性,模型也有各自的“风格”,而未经告知的替换会破坏评测、安全审查和监控。

隐私、司法管辖与数据使用

  • 一些人仍对中国提供商保持警惕;另一些人指出,美国/Meta/OpenAI 也会监视或复用数据,因此司法管辖可能并不会显著改变风险。
  • 开放权重让用户可以避免把数据交给中国服务器,不过业界普遍对“零数据保留”政策持怀疑态度。
  • 有评论者指出,官方 DeepSeek API 会用用户数据训练,因此对于敏感工作负载,自托管或使用非中国代理更有吸引力。