Claude Opus 5

El lanzamiento de Claude Opus 5 por Anthropic se presenta como un modelo cercano a Fable y a mitad de precio, con sólidos resultados de benchmark en programación y razonamiento y sin retención obligatoria de datos, lo que lo hace atractivo tanto para desarrolladores individuales como para empresas. Los comentaristas debaten si Opus 5 es realmente menos capaz que Fable 5 o simplemente está afinado de forma más agresiva para los benchmarks, y cuán útiles son esas mejoras en cargas de trabajo reales dada la presencia de salvaguardas, fallbacks de modelo y la creciente complejidad de elegir y enrutar entre modelos. El hilo también refleja una preocupación más amplia por la fiabilidad de la infraestructura, la opacidad de la dinámica de costes y lo que significa el rápido avance del “agentic coding” para los trabajos y herramientas de ingeniería de software.

Posicionamiento frente a Fable 5 y otros modelos frontera

  • Anthropic dice explícitamente que Opus 5 no es “más capaz en general” que Fable 5, pero los gráficos del propio blog a menudo muestran a Opus 5 ligeramente por delante de Fable 5 en muchos benchmarks, especialmente en tareas de programación y agentic.
  • Algunos infieren que Opus 5 es un modelo destilado / más barato “tipo Fable”; otros sospechan que Fable sigue siendo más grande y mejor en las tareas más difíciles y de horizonte largo, a pesar de puntuaciones principales más débiles.
  • Las comparaciones con GPT‑5.6 Sol y Kimi K3 son mixtas: algunos usuarios encuentran a Sol o K3 más eficientes o mejores en la práctica; otros ven a Opus 5 como el mejor “por dólar” para programación seria.

Coste, eficiencia y modelos de uso

  • Opus 5 mantiene el precio de Opus 4.8 pero apunta a ofrecer un rendimiento cercano al de Fable; muchos ven esto como el punto principal.
  • Varios paneles de terceros (Artificial Analysis, Vals, etc.) sugieren que Opus 5 en modo “max” puede ser caro por tarea, con mejor relación precio/rendimiento en niveles de esfuerzo más bajos.
  • Los usuarios de suscripción debaten si ejecutar siempre el modelo top (Fable/Sol) merece la pena frente al consumo de cuota, en comparación con mezclar Opus/Sonnet o modelos más baratos.

Benchmarks y rendimiento en el mundo real

  • El 30% en ARC-AGI-3 llama la atención: algunos lo ven como un progreso real en “inteligencia fluida”, otros como RL específico del benchmark o posible benchmaxxing.
  • La confusión sobre las puntuaciones de OSWorld (20% de completions frente a ~55% de puntuaciones parciales) lleva a debatir cómo se informan los benchmarks y la variancia por no determinismo.
  • Las anécdotas abarcan: Opus 5 resolviendo bugs de C/C++ y del kernel donde modelos anteriores fallaron; reproducción de imagen→HTML/UI significativamente mejor; pero también un análisis de código más débil que GPT‑5.6 en algunas tareas y más alucinaciones en ciertas pruebas factuales.

Salvaguardas, ciber/bio y presión gubernamental

  • Opus 5 comparte las salvaguardas de Fable, pero ahora permite el descubrimiento de vulnerabilidades en código fuente en todos los niveles de acceso, aunque sigue bloqueando flujos de trabajo de exploits binarios.
  • Esto es bien recibido por desarrolladores centrados en seguridad, pero frustra a reverse engineers y a algunos investigadores de bio/ML que siguen chocando con clasificadores agresivos.
  • Muchos relacionan el tono cauteloso y las degradaciones del modelo (Fable→Opus 5→4.8) con las recientes restricciones del gobierno de EE. UU. y el anterior mensaje de Anthropic sobre Mythos de “demasiado peligroso”.

Fiabilidad, UX y comportamiento de “thinking”

  • Varios usuarios informan de cortes frecuentes, fallos de la interfaz, historial de chat perdido y comportamiento inestable de Claude Code; otros dicen que casi no ven problemas, lo que sugiere una experiencia desigual.
  • Opus 5 usa por defecto “thinking” (razonamiento) y puede sentirse más lento y verboso; a algunos les gusta el cuidado añadido, otros quieren salidas más rápidas y concisas.
  • Una queja notable: trazas de chain-of-thought reducidas u ocultas, que los usuarios usaban para depurar el razonamiento del modelo; algunos sospechan que esto busca dificultar la destilación por parte de competidores.

Enrutamiento de modelos y dinámica del ecosistema

  • La proliferación de modelos (Fable, Opus, Sonnet, variantes de GPT, K3, etc.) impulsa el interés por servicios externos de enrutamiento de modelos que eligen el modelo más barato adecuado para cada tarea.
  • Se debate si el enrutamiento debe hacerse por infraestructura de terceros, lógica interna o por los propios modelos, y existe un fuerte escepticismo sobre dejar que un único proveedor “se autoenrute” dadas las inercias de coste.

Impacto en desarrolladores y trabajo

  • Varios desarrolladores dicen que los modelos frontera ya los han hecho 10–60× más productivos y han reducido el tamaño de equipo necesario para proyectos greenfield; algunos ahora actúan más como “operadores de agentes de IA” que como programadores tradicionales.
  • Otros están ansiosos o escépticos: ven mucho “AI slop”, comportamiento frágil de largo horizonte y poca evidencia todavía de sistemas de producción realmente transformadores construidos por IA.
  • Muchos sienten que la capacidad frontera actual es “suficientemente buena” para la mayor parte de la programación; el valor futuro puede depender más de scaffolding, tooling e integración que del cociente intelectual bruto del modelo.