Anthropic 似乎在 Claude Code 中对降低“努力”级别进行 A/B 测试
Anthropic 的 Claude Code IDE 正遭到开发者批评,他们称其较新的 Opus 和 Fable 模型更慢、更啰嗦,而且有时似乎在后台被“降级”,从而推高 token 使用量和成本。许多人表示,在较低的“努力”设置下或使用旧模型时表现更好;在担心 enshitification 和不透明计费激励的情况下,一些人正转向竞争对手或开源权重模型。Anthropic 的一位工程师回应称,最近的变化是内部努力映射的 A/B 测试,而不是质量下降,但用户仍然担忧未披露的路由、波动的性能,以及在付费的同时被当作测试对象。
感知到的努力级别变化与模型路由
- 一些用户怀疑 Anthropic 正在 Claude Code 中对“努力”设置进行 A/B 测试,会根据负载或用户等级动态降低努力,或将请求路由到更便宜/更弱的模型。
- 有人报告说,在繁忙时段聊天模型感觉像是“被削弱了”,而直接使用 API 则感觉稳定。
- 关于模型能否可靠报告自身努力级别存在争论;一些人认为这只是由系统提示词驱动,因此是可知的,另一些人则不以为然。
模型质量、回归与冗长程度
- 许多人描述 Opus 5(以及 Fable)变得明显更啰嗦、华丽,带有“LinkedIn 风格”,对琐碎任务也会产生很长的思维链。
- 反馈包括极端过度处理(例如为一个简单的配置修改做了 40 多分钟不必要的分析)以及在更高努力级别下数学能力或准确性更差。
- 一个反复出现的主题是:Opus 4.6 曾广受喜爱;尽管基准更好,4.8 和 5 却被普遍认为是在倒退。
- 一些用户觉得 Opus 5 在低/中等努力级别下是可接受的,甚至很强,尤其适用于复杂的、多仓库、多文档汇总。
Token 使用、计费激励与限制
- 很多人强烈担心:更高的默认努力、冗长的推理,以及子代理“烧光 token”的做法,与按 token 收费的收入激励相一致。
- 也有人反驳说,鉴于算力紧张和竞争,这在经济上并不理性;真正留住用户的是每 token 的质量。
- 对于不透明、波动的 token 成本以及缺乏清晰、固定的资源控制感到沮丧;有人把这比作供应商在控制你的“油门踏板”。
与替代方案和本地/开源模型的比较
- 多位评论者表示已转向或部分迁移到 Codex、DeepSeek、GLM、Qwen 或中文开源权重模型,理由是速度、更稳定或成本更优。
- 关于每月 20 美元订阅的价值与投资本地硬件之间存在争论;一些人认为本地方案成本高,另一些人则强调可预测性和控制权。
信任、透明度与安全项目
- 有人抱怨在 Anthropic 调整配置时,自己实际上成了“测试对象”,却没有退出选项。
- 还有人不满其网络安全验证访问被撤销,以及静默降级或重新路由(例如 Fable → Opus)并不总是被清楚地展示出来。
- 普遍担心“enshitification”:为了基准、护栏或利润率而进行优化,结果损害了日常可用性。