Anthropic parece estar realizando pruebas A/B de niveles de esfuerzo reducidos en Claude Code
Claude Code de Anthropic está recibiendo críticas de desarrolladores que dicen que sus nuevos modelos Opus y Fable son más lentos, más verbosos y a veces parecen ser “degradados” detrás de escena, lo que dispara el uso de tokens y los costes. Muchos informan de un mejor comportamiento con ajustes de “esfuerzo” más bajos o con modelos antiguos, y algunos están cambiándose a competidores o a modelos de pesos abiertos ante el temor de enshitificación e incentivos de facturación opacos. Un ingeniero de Anthropic responde que los cambios recientes son pruebas A/B de asignaciones internas de esfuerzo y no reducciones de calidad, pero los usuarios siguen preocupados por el enrutamiento no divulgado, el rendimiento fluctuante y ser usados como sujetos de prueba mientras pagan.
Cambios percibidos en el nivel de esfuerzo y enrutamiento del modelo
- Varios usuarios sospechan que Anthropic está haciendo pruebas A/B de configuraciones de “esfuerzo” en Claude Code, degradando dinámicamente el esfuerzo o redirigiendo a modelos más baratos/débiles bajo carga o según el nivel del usuario.
- Algunos informan que los modelos de chat se sienten “lobotomizados” en horas de mucho tráfico, mientras que el uso directo de la API se siente estable.
- Hay debate sobre si los modelos pueden informar de forma fiable su propio nivel de esfuerzo; algunos sostienen que solo depende del prompt del sistema y, por tanto, se puede conocer, otros no están convencidos.
Calidad del modelo, regresiones y verbosidad
- Muchos describen Opus 5 (y Fable) como dramáticamente más verbosos, floridos y “tipo LinkedIn”, con largas cadenas de pensamiento para tareas triviales.
- Los informes incluyen exageraciones extremas (por ejemplo, más de 40 minutos de análisis innecesario para una simple edición de configuración) y peor matemática o precisión en niveles de esfuerzo más altos.
- Un tema recurrente: Opus 4.6 era muy querido; 4.8 y 5 son percibidos ampliamente como regresiones a pesar de mejores benchmarks.
- Algunos usuarios encuentran Opus 5 aceptable o incluso fuerte con esfuerzo bajo/medio, especialmente para síntesis complejas, de múltiples repositorios y múltiples documentos.
Uso de tokens, incentivos de facturación y límites
- Hay una fuerte preocupación de que los valores predeterminados de mayor esfuerzo, el razonamiento verboso y los subagentes “prendiendo fuego a tokens” se alineen con incentivos de ingresos por token.
- Otros responden que esto es económicamente irracional dado el cómputo ajustado y la competencia; la calidad por token es lo que retiene a los usuarios.
- Frustración con costes de tokens opacos y variables, y con la falta de controles de recursos claros y fijos; algunos lo comparan con un proveedor controlando tu “acelerador”.
Comparaciones con alternativas y modelos locales/de código abierto
- Varios comentaristas informan que se han cambiado o migrado parcialmente a Codex, DeepSeek, GLM, Qwen o modelos chinos de pesos abiertos, citando mejor velocidad, estabilidad o coste.
- Debate sobre el valor de suscripciones de $20 frente a invertir en hardware local; algunos argumentan que lo local es caro, otros enfatizan la previsibilidad y el control.
Confianza, transparencia y programas de seguridad
- Quejas por ser efectivamente “sujetos de prueba” sin opción de exclusión cuando Anthropic ajusta las configuraciones.
- Reclamaciones sobre acceso de verificación cibernética revocado y degradaciones o redireccionamientos silenciosos (por ejemplo, Fable → Opus) que no siempre se muestran con claridad.
- Preocupación generalizada por la “enshitificación”: optimizar para benchmarks, guardrails o márgenes de una manera que degrada la usabilidad cotidiana.