Qwen 3.8-Flash-Next se lanza mañana (125B a6B)

El modelo Qwen3.8-Flash-Next de Alibaba está llamando la atención como una gran arquitectura MoE (mezcla de expertos) con 125B parámetros y 6B activos por token, diseñada para ejecutarse en hardware “de consumo” de gama alta como Macs de 128GB, sistemas Strix Halo y GPUs con 32GB+ de VRAM. Los comentaristas lo ven como una posible alternativa local de clase Opus/Sonnet para coding y cargas de trabajo “agentic”, pero señalan compensaciones en velocidad, huella de memoria, calidad de cuantización y la practicidad de ejecutar estos modelos en casa frente al uso de APIs cloud. Muchos consideran esta publicación como una vista previa técnica temprana de la futura familia Qwen4, pensada para que los stacks de inferencia y las herramientas se pongan al día antes de que llegue la línea completa.

Arquitectura del modelo y objetivos

  • La descripción temprana (ya eliminada) decía: MoE multimodal de 125B parámetros, ~6B parámetros activos por token, además de ~51B embeddings n‑gram y una nueva “Qwen Sparse Attention”.
  • Se afirmaba que alcanzaba una capacidad cercana a Qwen3.7-Plus con ~1/9 del costo de entrenamiento, con mejor rendimiento en coding y cowork.
  • El equipo de Qwen dice que esto es principalmente una vista previa arquitectónica para que los stacks de inferencia se preparen para la próxima “familia completa” de modelos Qwen4, no una versión totalmente pulida.

Recuento de parámetros, escalado y “tamaño efectivo”

  • Una regla práctica discutida: el “tamaño denso efectivo” de un MoE ≈ media geométrica de los parámetros totales y activos. Para 125B‑a6B esto da ≈27B, lo que coincide con la expectativa de que su calidad será similar a Qwen3.8 27B.
  • Algunos esperan capacidades aproximadamente a la altura de Sonnet/Opus‑4.6 para coding y tareas de Linux, pero con un “sobrepensar” adicional que puede mitigarse con la temperatura y el prompting.

Requisitos de hardware y rendimiento

  • Muchos asumen que las máquinas de clase 128GB RAM (Mac Studio, Strix Halo, DGX Spark, GPUs grandes) son los verdaderos objetivos.
  • Varios benchmarks y anécdotas:
    • Qwen3.8 27B funciona bien en 5090 y escritorios con doble GPU; se prefieren 32GB+ de VRAM y cuantización de ≥6 bits para evitar pérdida de calidad.
    • Strix Halo tiene dificultades con modelos densos de 27B (a menudo ~10–30 tok/s), pero un MoE con 6B activos podría situarse alrededor de 25–40 tok/s; la latencia de prefill sigue siendo un problema.
    • M5 Max muestra grandes mejoras frente al M4 en prefill; se reportan 25–70 tok/s en 27B con MTP y runtimes MLX optimizados, aunque otros ven valores más cercanos a 30–35 tok/s.
  • FP8 para el modelo completo parece demasiado grande para 96GB de VRAM; el consejo es esperar FP4/Q4 para configuraciones de consumo.

Local vs cloud, y routers

  • A muchos les gustan los modelos locales de gama alta, pero los encuentran lentos para coding interactivo y flujos de trabajo de agentes frente a APIs cloud de pago.
  • OpenRouter recibe elogios por su flexibilidad, pero también críticas por:
    • Endpoints de Qwen inestables o limitados por capacidad.
    • Peores economics de caché de prompts frente a ir directamente a los proveedores.
    • Dificultad para fijar proveedores estables y baratos sin mucha configuración.
  • Algunos prefieren routers autoalojados (por ejemplo, con alias de modelos y fallback local/cloud) por su previsibilidad y control de costes.

Comparaciones e impacto en el ecosistema

  • Se espera que el modelo compita con MoE tipo “flash” de DeepSeek y otros modelos de clase 27–35B (Qwen3.6/3.8, Gemma 4, Laguna, Ornith, GPT‑OSS).
  • Sentimiento mixto: entusiasmo por un MoE potente y semiconsumidor ejecutable; escepticismo sobre la velocidad, los precios de RAM y si realmente sustituye a Claude/u otras APIs frontier.