DeepSeek-v4-flash-vision-exp
DeepSeek 发布了其 V4 Flash 模型的实验性视觉增强版本,这引起了依赖它进行编码、UI 工作和需要“看见”截图、文档与设计的 agent 工作流开发者的关注。评论者强调其出色的成本效益,以及在前端 QA、OCR 和空间推理等任务上的自主性提升,但也指出了关键限制,例如 800×800 的图像缩放上限、偶发的基础视觉失败(如读时钟或识别地标),以及对近期价格变化的担忧。许多人预计通过 harness 级别的绕过方法(裁剪、放大工具、外部视觉模型)和未来模型迭代,可以解决保真度和可靠性方面的差距。
视觉能力与行为
- DeepSeek V4 Flash 之前曾“表现得像”具备视觉能力,会尝试用纯文本技巧处理截图;新的 vision-exp 模型被认为是在修补这一缺口。
- 有人指出它仍然处于实验阶段,并不是“旗舰”视觉系统,更像是一个快速/廉价、以编码为导向但现在支持图像的模型。
图像分辨率限制(800×800)与绕过方法
- 图像会被缩放到约 800×800 等效大小,每张图上限约 384–400 个 token;成本估算显示每美元大约可处理 2,500 张图。
- 很多人认为 800×800 对于密集内容来说太低了(A4 页面、原理图、微小文字、细节丰富的图表)。
- 也有人认为对于截图或小裁剪已经够用,而且工具链可以补足:
- 使用裁剪/放大工具,或将图像切成网格后再拼接结果。
- 使用单独的布局/OCR 模型(例如 PP‑DocLayout、Unlimited‑OCR)来拆分页面。
- 围绕这些 harness 绕过方法是否能保留全局关系与计数准确性,存在争论。
视觉用途
- 常见的“不错”用途包括:
- 前端/UI 开发循环(来自 Playwright/无头浏览器的截图、Figma 检视、验证布局)。
- OCR / 扫描文档和 CV 照片;提取文本,同时可选择“修正”或保留错误。
- 图表、示意图、设计草图、线框图、游戏 UI、通过手绘学习并让 AI 纠正。
- 社交媒体 alt 文本、卫星图像研究、机器人感知、3D 打印监控、通过超小字体 PNG 进行上下文压缩。
质量、基准与失败
- 基准测试:据报 DeepSWE 分数略高于之前的纯文本 Flash,在成本/性能上明显优于某些竞品模型。
- 一些用户称赞 DeepSeek Flash 相比同价位模型在持续性、验证和工具使用方面更好;也有人报告输出不连贯以及工具调用效果很差(可能与量化/ harness 问题有关)。
- 视觉准确性参差不齐:
- 在“读钟表”测试中失败或表现不稳定;对某些模拟时钟时间的判断出错,而竞争模型也常会误读。
- 在地标识别上不如部分对手(例如会混淆大教堂/桥梁)。
- 多位评论者强调“锯齿状智能”:在编码和许多视觉任务上很强,但在某些边缘情况上不可靠。
开放性、生态与替代方案
- 预期(但此处未确认)权重可能会发布,这与 DeepSeek 以往做法一致。
- 有人建议通过 MCP 或插件接入外部视觉模型。
- 由于 DeepSeek 价格变化,尽管对其能力很看好,一些用户正在转向其他模型(例如 Qwen)。