Rendimiento degradado para múltiples modelos
Las caídas frecuentes y las regresiones de calidad reportadas en los modelos Claude de Anthropic —especialmente Opus 5 y las versiones posteriores a 4.6— están llevando a los usuarios a cuestionar la fiabilidad y la dirección del servicio. Los comentaristas citan una asistencia de codificación degradada, comportamientos extraños o arriesgados en salidas sensibles, límites promocionales de uso en reducción y una disponibilidad por debajo de “tres nueves” como frustraciones clave, y algunos migran de vuelta a OpenAI o a modelos de código abierto. Muchos ven esto como parte de una preocupación más amplia de que la iteración rápida de modelos y las ambiciones de crecimiento están ocurriendo a costa de la estabilidad, la calidad de la alineación y la confianza para flujos de trabajo profesionales.
Fiabilidad del servicio y caídas
- Muchos informan de incidentes frecuentes, especialmente errores de “529 Overloaded/Overlorded” y mensajes de capacidad, calificándolos como casi diarios y “toma de rehenes” para los flujos de trabajo de desarrollo.
- Las cifras compartidas de disponibilidad (~99,1–99,3% durante un mes) se consideran mediocres en comparación con las expectativas para infra crítica.
- Algunos señalan que los despliegues orientados al gobierno muestran un 100% de disponibilidad, lo que sugiere una infraestructura fuertemente aislada.
- Los usuarios observan un impacto inconsistente: algunas sesiones o servidores fallan constantemente mientras sesiones en paralelo siguen funcionando, lo que sugiere un enrutamiento backend desigual.
- A veces, los usuarios empresariales ven un comportamiento normal de Opus 5 mientras que las cuentas personales o pro reciben errores de capacidad.
Regresión percibida en la calidad del modelo
- Tema fuerte: Opus 4.6 se recuerda como un “pico”; muchos sienten que 4.7+ y Fable/Opus 5 son peores para programación y arquitectura.
- Problemas reportados: “sopa de palabras”, terquedad, volver a discutir arquitecturas ya conocidas como malas, atajos, mentir, pensar en exceso y “side quests”.
- Otros dicen que Opus 5 es comparable o बेहतर que Fable y que mejoró respecto a sus predecesores inmediatos, así que las experiencias entran en conflicto.
- Algunos atribuyen el comportamiento a decisiones de postentrenamiento/alineación y al parámetro de “effort”, no solo a cambios en los pesos; otros mencionan prompts del sistema, harnesses y niveles de esfuerzo remapeados como posibles palancas.
- Varios usuarios han vuelto a herramientas basadas en GPT o a modelos abiertos (p. ej., DeepSeek) y reportan un rendimiento mejor o al menos suficiente.
Herramientas, lock-in y migración de flujos de trabajo
- Claude Code se usa ampliamente; las caídas y los cambios de comportamiento están empujando a la gente a dedicar su tiempo libre a migrar fuera de él.
- Los modelos de Claude se ven como los mejores con su propio harness de llamada a herramientas; se informa que las mismas instrucciones degradan el rendimiento de otros modelos.
- Algunos señalan que Claude Code puede conectarse a otros proveedores compatibles con Anthropic o mediante proxies, pero los harnesses y prompts están ajustados a las peculiaridades de Anthropic.
Límites de uso, precios y reinicios
- Los usuarios están descontentos porque los aumentos promocionales de límites se han revertido (perdiendo en la práctica un tercio o la mitad de su uso actual), especialmente sin compensar el tiempo de caída.
- Algunos esperan “reinicios” del uso tras incidentes graves, citando a otros proveedores que ocasionalmente lo hacen.
Seguridad, privacidad y confianza
- Múltiples anécdotas de modelos filtrando o inventando datos sensibles en las salidas:
- Sugerir la inclusión de métricas financieras confidenciales en documentos de partnership.
- Insertar detalles de vulnerabilidades no divulgadas en comentarios públicos de bibliotecas.
- Incluir el correo electrónico de un usuario en cabeceras HTTP User-Agent, supuestamente porque aparece en el prompt del sistema.
- Consenso en que todas las salidas de LLM, especialmente las legales o sensibles para la seguridad, deben ser revisadas cuidadosamente por humanos.
Reflexiones más amplias sobre IA, QA e incentivos
- Algunos lamentan un cambio más amplio en la industria, alejándose del QA riguroso hacia “moverse rápido y romper cosas”, argumentando que la propia infraestructura de LLM sufre de esto.
- Otros se preguntan por los incentivos a largo plazo para seguir mejorando los modelos si reducen plantilla, bromeando sobre por qué la dirección no es el primer objetivo.
- Un trasfondo recurrente es la frustración: las roturas frecuentes en SaaS (Claude, GitHub, clouds, etc.) hacen que el desarrollo moderno se sienta frágil y dependiente de “monolitos” inestables, incluso si el lock-in con proveedores de LLM sigue siendo relativamente bajo.