Qwen3.8 Max ahora ocupa el primer puesto como mejor modelo general según el índice agentic
Qwen 3.8 Max, un gran modelo de lenguaje chino con pesos abiertos, apareció brevemente como el modelo “agentic” más destacado en el leaderboard de Artificial Analysis, lo que provocó escrutinio sobre cómo se construyen y actualizan estos benchmarks compuestos. Los comentaristas comparan sus capacidades, coste y estilo de razonamiento muy consumidor de tokens con rivales como Opus de Anthropic, GPT 5.6 de OpenAI, Kimi K3 y DeepSeek, señalando que en puntuaciones brutas de “inteligencia” aún queda por detrás de algunos modelos propietarios y es caro de ejecutar. Un tema recurrente es que los modelos frontier chinos y open source ya están lo bastante cerca en calidad como para que factores como el precio, la latencia, la posibilidad de autoalojamiento y el estilo de interacción importen más que las pequeñas diferencias en puntuaciones de benchmark.
Benchmarks y afirmación de “mejor modelo”
- Artificial Analysis tiene varios índices:
- Agentic Index (GDPval‑AA v2, Tau³‑Banking) donde Qwen3.8 Max lideró brevemente, y ahora está en el #2 tras una actualización de metodología.
- Coding Agent Index (DeepSWE, Terminal‑Bench, SWE‑Atlas‑QnA) donde Qwen3.8 Max solo está probado parcialmente y queda por detrás de algunos modelos de OpenAI en los benchmarks compartidos.
- Varios comentaristas ven el encuadre inicial de “mejor modelo general” como clickbait y señalan que la victoria es estrecha y específica de un benchmark.
- La actualización de la metodología (incluido un nuevo modelo evaluador) llegó mientras la gente estaba mirando, provocando cambios visibles en puntuaciones/orden y alimentando sospechas sobre la neutralidad del leaderboard.
Calidad del modelo y experiencia de usuario
- Muchos describen los modelos Qwen, especialmente las variantes grandes 3.6/3.8, como excelentes para depuración, flujos de trabajo agentic y programación general; algunos los comparan favorablemente con Anthropic y OpenAI en depuración compleja.
- Otros consideran que Qwen/los modelos chinos son descuidados o inconsistentes: cambian formatos a mitad de sesión, omiten elementos solicitados o necesitan prompts más explícitos.
- Los leaderboards de “índice de inteligencia” bruto siguen situando a menudo a Opus 5 y otros modelos propietarios por delante; algunos desconfían de cualquier benchmark donde Opus supera a alternativas que les parecen más fuertes en el uso diario.
Coste, tokens y economía
- Qwen3.8 Max tiene pesos abiertos, pero es enorme (~escala de un billón), así que en su mayoría solo está disponible en la nube y es casi tan caro por tarea como los mejores modelos propietarios.
- Los comentaristas subrayan que los modelos centrados en razonamiento pueden emitir muchos tokens, haciendo que los modelos de precio medio resulten efectivamente tan caros por tarea como los de gama alta.
- Otros destacan opciones fuertes más baratas (p. ej., DeepSeek v4 Flash, Grok 4.5, GPT‑5.6 Luna tras recortes de precio) y argumentan que el coste por calidad se ha convertido en un diferenciador principal.
Modelos locales y más pequeños
- Gran interés por el próximo Qwen 3.8 27B y por los Qwen 3.6 27B/35B A3B existentes como candidatos a “modelo local por defecto” en GPUs prosumer y Apple silicon.
- Se comentan compensaciones: 27B se ve como más inteligente pero más lento y exigente con la KV cache; 35B A3B es más rápido y “más tonto”, pero suficiente para pair‑programming.
Anthropic / Claude frente a otros
- Muchos describen a Opus 5 en agentes de código como verboso, demasiado orientado a planificar, “devorador de tokens” y reacio a ejecutar trabajo; algunos vuelven a Opus 4.6/4.8 o cambian a Qwen/DeepSeek/OpenAI.
- Otros informan que Opus 5 supone una mejora clara en la calidad del código si se ajustan el prompt y la configuración del estilo de salida, pero siguen quejándose de su prosa y personalidad.
- El precio de suscripción frente al precio por API de Anthropic se percibe como extrañamente descompensado; algunos sienten que los créditos desaparecen muy rápido en enjambres agentic.
China, destilación y sesgo
- Los comentaristas sostienen que China ha “alcanzado” de hecho; las diferencias entre modelos de frontera ahora parecen pequeñas y están impulsadas por el caso de uso, la marca o la personalidad.
- Las experiencias con DeepSeek, GLM, Kimi y Qwen varían mucho: algunos los consideran transformadores y de mucho mejor valor; otros reportan peor fiabilidad que los modelos de EE. UU.
- Hay debate sobre si los modelos chinos están fuertemente destilados a partir de salidas occidentales y si eso es éticamente distinto de entrenar con datos de la web.
- Algunos expresan preocupación por la censura y la conformación narrativa en los modelos chinos; otros responden que todos los grandes proveedores, chinos y occidentales, incorporan sus propios sesgos.
Harnesses agentic y comunicación
- Varias personas subrayan que los benchmarks omiten un factor clave para los agentes de código: lo claramente que el modelo explica lo que hizo.
- En particular, se critica a Opus 5 por su jerga densa, terminología inventada y actualizaciones divagantes que dificultan la supervisión humana, pese a su gran capacidad bruta.
- Varios sugieren que quizá estamos en una meseta de inteligencia “suficientemente buena”, donde la velocidad, el coste y la calidad de la comunicación importan más que pequeñas diferencias en los benchmarks.