Opus 5 目前位居 Artificial Analysis Intelligence Leaderboard 第 1 名
Anthropic 的 Opus 5 短暂登上了 Artificial Analysis AI 排行榜榜首,但许多工程师认为,它相较 GPT‑5.6 Sol 和 Kimi K3 等竞争对手那一点点性能优势,并不值得其高得多的成本。评论者强调,真实世界的价值更多取决于“每美元智能”、推理设置,以及任务领域(例如编程 vs. 知识检索),而不是单一的“最佳模型”分数。一个主要痛点是 Anthropic 激进的安全过滤器和自动模型降级——尤其在生物、安全和调试工作流中——一些人因此认为,哪怕基准分数略低,限制更少的廉价模型或开源模型也更实用。
整体排行榜反应
- Opus 5 登顶 ArtificialAnalysis 的“Intelligence Index”,但它相对 GPT‑5.6 Sol 和其他前沿模型的领先幅度很小。
- 一些评论者认为,更有意思的图表是“智能 vs 成本/时间”,而不是单一的头条分数。
- 有人把 Opus 5 的位置视为 Anthropic 技术进展的验证;也有人认为,考虑到相近性能但更低成本,GPT‑5.6 Sol 看起来更有吸引力。
成本、效率与推理设置
- 很多人强调,推理等级(“low/medium/high/max/xhigh”)会极大改变成本和行为。
- 据称,Opus 5 High 与 Sol Max 的得分相近,成本/时间也大致可比;Opus Max 则贵得多,而且有时会过度思考。
- 有人认为,通常更好的做法是用更聪明的模型配较低推理,而不是用便宜模型开到最高。
- 多位评论者强调 Kimi K3 和其他非美国模型在性价比上很强,尽管 K3 还没有在 AA 图表中得到完全体现。
模型角色与多模型工作流
- 讨论了 OpenAI 的 Sol/Luna/Terra “stack”:Luna 被称赞为高效的主力/工具调用模型,Terra 是不错的对话者,Sol 则适合细腻的综合归纳。
- 有人提出流水线方案:例如用 Sol 或 Opus 做规划/架构,用更便宜或更小的模型做实现,再用多个模型交叉复审。
用户对 Opus 5、Fable、Opus 4.8 和 Sol 的体验
- 反馈不一:有人说 Opus 5 是明显的代际跃迁,尤其适合游戏或复杂设计任务;也有人觉得它比 Opus 4.8 或 Sol 更表面化,甚至更“迷失”。
- 批评包括过度构建、UI 设计薄弱,或在续接旧会话时表现不佳;也有人称赞它比 4.8 更简洁、回答更聚焦。
- 多位评论者指出,性能高度依赖代码库和任务类型。
护栏、审查与模型降级
- 最激烈的讨论集中在 Anthropic 的安全过滤器,尤其是 Fable,其次是 Opus 5。
- 很多人报告称,良性提示词(生物学、医学、化学、安全、性能,甚至某些词如“cell”“microbes”“segfault”“login”)会触发硬拒绝或自动降级到 Opus。
- 生物、医学、放射学、安全和逆向工程领域的用户表示,由于分类器过于宽泛,这些模型实际上已经无法使用。
- 有人认可安全方面的顾虑;也有人认为风险被夸大,而过度拦截损害了科研和生产力。
- 对于静默/自动降级是否可接受存在争论;有人指出可以通过设置关闭自动切换,但也有人反感这种做法本身。
基准测试的实用性与局限性
- 多位评论者批评单一“最佳模型”排行榜具有误导性;真实工作负载各不相同,且领域特定优势(如编程、知识、agent)很重要。
- 也有人为基准测试辩护,认为只要用户查看多个指标(成本、幻觉率、领域分数),它们仍然非常有助于缩小选择范围。
- 有人呼吁为特定栈或社区维护评测(例如针对特定语言/框架)。