Cognition 发布新的 SWE-2 模型,可与 Fable 5.1 和 GPT-Astra 抗衡
Cognition 的新 SWE-2 编码模型基于 Kimi K3 进行后训练,被宣传为可与 GPT-Astra 和 Fable 5.1 等顶级前沿模型抗衡,但许多工程师质疑其高分究竟来自真实能力,还是在老旧、趋于饱和的基准上进行“benchmaxxing”。评论者指出它在新的 Terminal Bench 4 上出现断崖式下滑,并且是闭源权重,认为像 DeepSeek V4.1 Flash 这样的开源模型在性价比和可控性方面更有优势。也有人指出 SWE-1.x 本来就已经相当可用,认为 Cognition 运营自己的微调栈以减少对 OpenAI/Anthropic 的依赖是有价值的,但他们不满 SWE-2 被紧密绑定在 Cognition 的 Devin 工具链上,而不是标准 API 或开放分发。
基准测试、“Benchmaxxing” 与泛化能力
- 很多评论者质疑 Cognition 自行发布的 FrontierCode 基准,指出它是内部基准、不可复现,并将 SWE‑2 定位为“可与 Astra/Fable 抗衡”。
- Terminal Bench 2.1(≈93%)与 Terminal Bench 4(≈27%)之间的差距多次被提及,被视为过拟合/“benchmaxxing”以及对新问题泛化能力差的危险信号。
- 也有人指出,Sol 和 GLM 等顶级模型从 TB2.1 到 TB4 同样大幅下滑,认为这是整个生态系统的问题,而 TB4 目前也还没有被充分饱和。
- 一些人认为编码基准越来越像低信息量的营销数字;他们主张直接构建自定义工作负载。
模型来源、训练与能力
- SWE‑2 被描述为“由 Kimi K3 进行后训练(post-trained)”,因此引发了关于后训练、蒸馏与微调之间差异的讨论,以及 RL/后训练到底还能额外带来多少能力。
- 关于一个约 2.8T 参数的模型是否真的能匹配约 10T 级模型,存在争论;一些人怀疑仅靠 RL 无法弥合这一差距。
访问、产品集成与锁定
- 目前 SWE‑2 主要可通过 Cognition 的 Devin 生态系统(CLI、桌面/云端)访问,而不是通过标准 API 或像 OpenRouter 这样的聚合器。
- 一些用户不喜欢为了测试某家实验室的单个模型就必须使用定制的 CLI/harness,并要求提供一个简单的 chat/completions 风格 API。
- 关于定价也存在混乱:有说法称 SWE‑2 通过 CLI 可免费使用一个月、云端有折扣、设备端免费,但一些用户报告自己被收费。
开源与闭源权重,以及中文基础模型
- 若 SWE‑2 不是开源权重,几位评论者表示失望,尤其是将其与 DeepSeek V4.1 Flash 和其他开源中文模型相比时。
- 讨论指出,许多美国初创公司现在正在对强大的中文开源模型(Kimi、GLM 等)做后训练或封装,而不是从头训练。
Devin/Windsurf 的产品体验
- 对 Devin/Windsurf 的体验褒贬不一:一些企业和个人用户认为它作为编码代理很有用,尤其是在集成了前沿模型时。
- 另一些人则报告 CLI/桌面 harness 存在严重的 UX 和可靠性问题、缺少关键功能,以及早期演示被过度吹捧,导致不信任。
经济与竞争背景
- 评论者认为 SWE‑2 的一部分意义在于帮助 Cognition 降低对 OpenAI/Anthropic API 的依赖。
- 还有更广泛的成本-性能权衡讨论,很多人称赞 DeepSeek 4.1 Flash 是强大且便宜的替代方案,并预测这会给闭源实验室的定价带来压力。