GPT 5.6 Sol 是 OpenAI 迄今发布的最好的“视觉”模型

OpenAI 新发布的 GPT‑5.6 Sol 被广泛视为在图像和视频理解方面迈出了重要一步,尤其适合 UI 评审、购物辅助以及细粒度视觉推理等复杂真实任务。然而,基准结果和用户反馈表明,Google 的 Gemini 3.x 系列和 Alibaba 的 Qwen 3.8 往往在目标检测、计数以及成本效率方面表现更好,尤其适用于高吞吐或生产工作负载。许多评论者认为,传统视觉工具(如 OpenCV)和专用模型在狭窄任务上仍然胜过通用 LLM,但也认为前沿的视觉语言模型在自动标注数据、协调工具以及处理杂乱的多模态输入方面正变得越来越有价值。

关于 GPT‑5.6 Sol 视觉能力的总体看法

  • 许多人认为,Sol 相比早期的 OpenAI 视觉模型有了实质性提升,尤其是在以下方面:
    • 复杂布局(例如嵌套弹窗、应用 UI)。
    • 带有亚秒级运动且对 FPS 具有鲁棒性的视频字幕生成。
    • 困难的 OCR 场景(微弱反光、棘手的截图、乐谱)。
  • 也有人表示,它在细节、“审美感”以及严格遵循设计系统方面,仍然“跟其他模型一样瞎”。
  • 视觉能力被普遍认为明显落后于文本能力;会出现一些令人意外的失败(空白图片 → 幻觉出厨房、日期无法辨认、手写西里尔字母)。

对比:Gemini、Qwen 及其他模型

  • 多位评论者表示,Gemini(尤其是 3.7 Flash)目前是最实用的视觉选择:
    • 在大多数 Roboflow 基准上都优于 Sol,尤其是在检测/计数方面。
    • 成本更低,速度足以应对高吞吐任务;Flash Lite 因提取能力受到称赞,不过在大型/复杂输入上表现不稳定。
  • 也有人仍然偏好 Gemini Pro 3/3.1 进行深度科学推理,但对于杂乱 PDF 和视觉任务,3.7 Flash 被认为可比甚至更好。
  • Qwen 3.8(Max 和 27B)在视觉和目标检测方面获得了很高评价;开源权重的 27B 因适合本地使用而受到强调。
  • 还提到其他模型:Fable 用于 OCR,Luna 和 Seed Turbo 2.1 在视觉描述方面表现很强,小模型如 minicpm‑v‑4.6 适合端侧使用。

基准、方法论与传统 CV

  • 评论者指出药丸/鸡蛋示例中存在真值和框旋转问题;对图像分辨率与 EXIF 方向也有争论。
  • 约 80% 的药丸计数准确率被认为远低于药房生产环境的要求。
  • 还有人认为这些任务用 OpenCV/模板匹配就很简单;而另一些人反驳说:
    • VLM 有助于自动标注数据集。
    • 正确的模式应是让 LLM 协调传统 CV 工具,而不是完全取代它们。

设计、UX 与“审美感”

  • 使用 LLM 评审 UI 截图的体验褒贬不一:
    • 有人说 Sol 能把屏幕拆解成连贯、可复用的模块。
    • 也有人觉得模型不稳定或陈词滥调,尤其是在处理“看起来像 AI 生成的” UI 时。
  • 讨论集中在设计/UX 中有多少是可以客观衡量的,有多少属于“审美感”,以及模型是否能够捕捉这些细微差别。

用例与局限

  • 报告中的成功案例包括:超市货架商品查找与裁剪、药房药片计数辅助、图表审查、乐谱转写。
  • 明显失败的情况包括:没有工具支持的路径跟随谜题、作物病害误诊、深度/3D 理解(有人提出双目基准,但未展开讨论)。
  • 一些人认为,Sol 及其同类模型作为通用模型令人印象深刻,但在安全关键或高精度生产级视觉场景中,仍不足以可靠使用。