将生产中的 AI 代理迁移到 GPT-5.6:速度提升 2.2 倍,成本降低 27%

一篇关于将生产中的网页构建 AI 代理从 Anthropic 的 Claude Opus 迁移到 OpenAI 新的 GPT‑5.6 Sol 的文章,引发了关于“宣称的 2.2 倍速度提升和 27% 成本下降”是否足以让真实系统切换模型的讨论。评论者权衡多种前沿模型(包括 Claude Fable 和较旧的 Opus 版本)的取舍,重点关注代码质量、工具调用怪癖、缓存行为,以及在生产中把模型当作可互换组件有多困难。另有大量分支讨论批评许多 AI 辅助文章那种公式化、带有“LLM 味”的写作风格,认为即使底层技术见解有价值,这种风格也会传递低投入内容的信号。

模型质量与对比

  • 对 GPT‑5.6 Sol 是否是真正的改进,存在强烈分歧。
    • 有人声称它基本上就是换了新品牌的 5.5,依然产出较弱的代码,并在复杂任务上失败。
    • 也有人报告了明确的速度、成本和质量收益(例如,更快的 PCB 设计帮助、更好的分类、相比 5.5 更少的 token)。
  • Anthropic 的模型也被激烈讨论:
    • 有人坚持 Claude Opus/Fable 在结构化任务上要好得多(例如,“完美”的代码、端到端任务完成)。
    • 也有人发现 GPT‑5.6 Sol 在复杂代码库(例如 C)上更可靠,或者更偏好 Opus 4.6 而不是后来的 4.7/4.8,认为那是性价比最好的点。
  • 也有人好奇,究竟哪个模型在营销网站方面转化率更高;一些读者在视觉和修辞上更喜欢 Opus 的示例。

写作风格与“LLM slop”

  • 许多评论者对一种可辨认的“LLM 风格”散文感到疲惫:句子短、零碎,短语被过度使用,语气平淡。
  • 这种风格常被当作低实质内容、低人力投入的代理信号;几位评论者说,一旦识别出来就会立刻停止阅读。
  • 也有人反驳,认为重点应该放在技术内容上,而只要经过筛选,AI 辅助写作也可以有很高质量。
  • 提出的应对策略包括:使用浏览器扩展将文本重写为偏好的风格、把文章喂给 LLM 做摘要,以及维护一个 WRITING.md 来约束模型风格。

工具调用、schema 与代理

  • 讨论了 GPT‑5.6 的工具调用怪癖:模型倾向于填充它看到的任何参数,因此会出现 schema 变通方案(例如,“必需但可为 null”)。
  • 有人把这看作是 TypeScript/schema 的 bug;也有人认为这反映了 OpenAI 的函数调用训练方式。
  • 据称前沿模型对工具的行为较为松散;严格的受限解码可能会损害“智能”,所以运行框架通常会修复/清理输出,而不是强制完美的 schema。
  • 子代理和更便宜的模型(例如 Luna 对比 Sol)被讨论为一种采样多次运行并衡量不确定性的方法,但隔离和重复研究可能会消耗 token 预算。

生产使用、评估与迁移

  • 一派认为,只要有基本的评估,切换模型通常就是一行代码的事;另一派指出,严肃的代理需要对运行框架做非平凡的重构(工具 schema、缓存、提示词)。
  • 这篇文章背后的公司描述了他们运行了一个规模可观的网页设计任务评测基准,使用对 5.6 的预览访问,并通过功能开关逐步上线。
  • 还有几位提到,跨模型“故障转移”很难:提示词、工具和行为都依赖于模型,因此稳健的 LLMOps 需要针对模型的测试和路由。