Opus 5 es actualmente el #1 en el Artificial Analysis Intelligence Leaderboard
Opus 5 de Anthropic ha tomado brevemente el primer puesto en el leaderboard de IA de Artificial Analysis, pero muchos ingenieros argumentan que su pequeña ventaja de rendimiento sobre rivales como GPT‑5.6 Sol y Kimi K3 no justifica su coste significativamente mayor. Los comentaristas destacan que el valor en el mundo real depende más de la inteligencia por dólar, los ajustes de razonamiento y el dominio de la tarea (p. ej., codificación frente a recuperación de conocimiento) que de una sola puntuación de “mejor modelo”. Un gran punto de fricción son los filtros de seguridad agresivos de Anthropic y las degradaciones automáticas del modelo —especialmente en flujos de trabajo de biología, seguridad y depuración—, que algunos dicen que hacen que modelos más baratos, menos restringidos o abiertos sean más prácticos a pesar de tener puntuaciones ligeramente inferiores en benchmarks.
Reacción general al leaderboard
- Opus 5 encabeza el “Intelligence Index” de ArtificialAnalysis, pero el margen sobre GPT‑5.6 Sol y otros modelos de frontera es pequeño.
- Varios comentaristas sostienen que los gráficos más interesantes son los de “inteligencia vs coste/tiempo” en lugar de la puntuación principal única.
- Algunos ven la posición de Opus 5 como una validación del progreso técnico de Anthropic; otros dicen que GPT‑5.6 Sol parece más atractivo dada su rendimiento similar a menor coste.
Coste, eficiencia y ajustes de razonamiento
- Muchos enfatizan que el nivel de razonamiento (“low/medium/high/max/xhigh”) cambia radicalmente el coste y el comportamiento.
- Se informa que Opus 5 High puntúa de forma similar a Sol Max con un coste/tiempo aproximadamente comparable; Opus Max es mucho más caro y a veces piensa demasiado.
- Algunos argumentan que suele ser mejor usar un modelo más inteligente con menor razonamiento que uno más barato al máximo.
- Varios destacan Kimi K3 y otros modelos no estadounidenses como fuertes opciones de coste-rendimiento, aunque K3 aún no está totalmente representado en los gráficos de AA.
Roles de los modelos y flujos de trabajo con múltiples modelos
- Se comenta la “stack” de OpenAI Sol/Luna/Terra: Luna es elogiado como un caballo de batalla eficiente/llamador de herramientas, Terra como un buen conversador, y Sol para síntesis delicada.
- Algunos proponen canalizaciones: p. ej., Sol u Opus para planificación/arquitectura, modelos más baratos o pequeños para la implementación, y varios modelos para revisión cruzada.
Experiencias de usuarios con Opus 5 vs Fable, Opus 4.8 y Sol
- Informes mixtos: algunos dicen que Opus 5 es un salto generacional claro, especialmente para juegos o tareas de diseño complejas; otros lo encuentran más superficial o “perdido” que Opus 4.8 o Sol.
- Las quejas incluyen sobreconstrucción, diseño de UI débil o mal comportamiento al continuar sesiones antiguas; otros elogian una menor verbosidad y respuestas más enfocadas que 4.8.
- Varios señalan que el rendimiento depende mucho del código base y de la tarea.
Barandillas, censura y degradaciones del modelo
- El hilo más intenso se centra en los filtros de seguridad de Anthropic, especialmente en Fable y, en menor medida, en Opus 5.
- Muchos informan que prompts benignos (biología, medicina, química, seguridad, rendimiento, incluso ciertas palabras como “cell”, “microbes”, “segfault”, “login”) activan rechazos duros o degradaciones automáticas a Opus.
- Usuarios de biología, medicina, radiología, seguridad e ingeniería inversa describen que los modelos son prácticamente inutilizables debido a clasificadores demasiado amplios.
- Algunos agradecen las preocupaciones de seguridad; otros sostienen que el riesgo está exagerado y que el bloqueo excesivo perjudica la ciencia y la productividad.
- Hay debate sobre si las degradaciones silenciosas/automáticas son aceptables; algunos señalan que existen ajustes para desactivar el cambio automático, pero otros rechazan todo el patrón.
Utilidad y limitaciones de los benchmarks
- Varios critican que los leaderboards de un solo “mejor modelo” sean engañosos; las cargas de trabajo reales varían, y las fortalezas específicas del dominio (p. ej., codificación vs conocimiento vs agentes) importan.
- Otros defienden que los benchmarks siguen siendo muy informativos para acotar opciones, siempre que los usuarios miren múltiples métricas (coste, alucinaciones, puntuaciones por dominio).
- Algunos piden evaluaciones específicas de stack o mantenidas por la comunidad (p. ej., para lenguajes/frameworks concretos).