Qwen3.8-Flash-Next

Qwen3.8-Flash-Next, un nuevo modelo de lenguaje grande de mezcla de expertos de Alibaba, está llamando la atención por superar a versiones anteriores de Qwen mientras cuesta mucho menos entrenarlo y servirlo, y por adelantar la arquitectura prevista para Qwen 4. Combina un modelo principal de 125B parámetros con una gran memoria N‑gram “engram” para separar la recuperación de hechos del razonamiento, prometiendo gran calidad con pocos parámetros activos y haciéndolo atractivo para el despliegue local en Macs con mucha RAM, sistemas AMD Strix Halo y equipos DGX Spark. Los comentaristas están entusiasmados, pero señalan limitaciones actuales: herramientas como llama.cpp y vLLM apenas están añadiendo soporte, las versiones cuantizadas son grandes por el complemento N‑gram, y el sobrepensamiento y la verbosidad en tokens siguen siendo preocupaciones frente a algunos modelos alojados de frontera.

Rendimiento y posicionamiento del modelo

  • Muchos ven a Qwen3.8-Flash-Next superando a Qwen3.8-27B y DeepSeek V4 Flash en benchmarks, especialmente dado que es un MoE relativamente pequeño en parámetros activos (≈6B por token).
  • A algunos les sorprende que “derrote” tan claramente al denso 27B; otros señalan que esto era de esperar por una arquitectura más חדשה y el diseño MoE.
  • Hay interés en cómo se compara con los modelos propietarios “frontier” en coste por tarea, con cierto escepticismo de que el precio por tokens cuente toda la historia.

Arquitectura: MoE y embeddings N‑gram / “engram”

  • La arquitectura se describe como 125B de parámetros principales + ~51B de embeddings N‑gram, con 6B activos por token; se ve como un adelanto de una futura familia Qwen 4.
  • La tabla N‑gram/engram se presenta como:
    • Un complemento de recuperación de hechos que preserva conocimiento específico sin sobrecargar los pesos densos.
    • Similar en espíritu a RAG, pero integrado en la red y sin usar la ventana de contexto.
    • Una forma de intercambiar memoria adicional por menos cómputo por token y un “conocimiento del mundo” más robusto de cola larga.
  • Algunos aclaran que en la práctica no es solo “cuantización de 1 bit”; las tasas efectivas de bits difieren entre el modelo núcleo y la tabla N‑gram.

Despliegue local y hardware

  • Gran entusiasmo entre usuarios de Strix Halo, DGX Spark, Macs con mucha RAM y plataformas AMD/Apple: 128 GB de memoria unificada es un objetivo común.
  • Velocidades reportadas:
    • Strix Halo: ~20–35 tok/s ahora, con expectativas de 50–60 tok/s con mejores kernels/MTP.
    • DGX Spark: ~12–20 tok/s en decode, ~80–190 tok/s en prefill con motores personalizados y N‑grams paginados en NVMe.
  • Preocupación: el complemento N‑gram (~50 GB+) dificulta ejecutarlo en sistemas de 32–64 GB, socavando la esperanza inicial de que un MoE de 6B activos fuera amigable para CPU.

Herramientas, cuantización y ecosistema

  • Fricción inicial: llama.cpp principal y vLLM al principio no tenían soporte; ahora existen bifurcaciones y compilaciones especiales, con PRs en curso.
  • Unsloth ofrece cuantizaciones GGUF y documenta que incluso “1-bit” requiere ~75+ GB de RAM; las cuantizaciones de más bits pueden llegar a ~90+ GB.
  • Algunos se quejan de que las cuantizaciones actuales se centran demasiado en bits muy bajos (1–2 bits), lo que podría subrepresentar la calidad del modelo; otros muestran resultados decentes incluso a 2 bits.

Estilo de razonamiento, sobrepensar y eficiencia de tokens

  • Varios usuarios informan que modelos anteriores Qwen 3.8 “sobrepensaban” en niveles altos de razonamiento, especialmente en tareas abiertas o de una sola toma, causando salidas lentas y verbosas.
  • Algunos esperan que Flash-Next sea más directo; las primeras anécdotas son mixtas: puede seguir dudando de sí mismo, pero a menudo ofrece resultados sólidos.
  • Hay preocupación de que los modelos chinos “flash” (incluyendo GLM y DeepSeek) puedan desperdiciar muchos tokens mediante largas cadenas internas de razonamiento, lo que importa para los costes de API.

Precio y economía

  • Los precios de la API de Qwen3.8-Flash-Next (p. ej., $0.16 / $0.47 por millón de tokens) se comparan con los niveles de DeepSeek y OpenAI.
  • Debate sobre si la inferencia a estos precios es rentable:
    • Un lado sostiene que la inferencia es claramente positiva en margen y que los precios siguen tasas de mercado más amplias.
    • Otro lado sospecha que descuentos agresivos, subsidios cruzados o una estrategia previa a la salida a bolsa pueden ocultar los costes reales.

Conocimiento vs. herramientas vs. arquitectura

  • Varios comentarios se desvían hacia si modelos más pequeños con búsqueda web o almacenes de conocimiento externos pueden igualar el “conocimiento del mundo” incorporado de modelos más grandes.
  • Algunos argumentan:
    • Los modelos grandes codifican una amplia gama de libros/conocimientos, pero no tienen una recuperación perfecta, así que la recuperación y las citas siguen importando.
    • Los modelos pequeños aumentados con herramientas pueden ser preferibles cuando la frescura y los almacenes de conocimiento modulares son importantes.
  • Otros enfatizan que “no puedes buscar lo que no sabes que existe”, así que la cobertura conceptual interna sigue siendo importante para descubrir algoritmos y técnicas.

Dinámica de código abierto y geopolítica

  • El hilo señala el contraste entre laboratorios estadounidenses relativamente conservadores y los lanzamientos abiertos frecuentes y agresivos de equipos chinos (Qwen, DeepSeek, GLM).
  • Algunos ven este ciclo rápido de lanzamientos abiertos como algo que impulsa la innovación en LLM locales y hace accesibles con rapidez nuevas arquitecturas (MoE + N‑grams, MTP, etc.).
  • Subyace la idea de que coexistirán tanto las APIs de frontera fuertemente controladas como los modelos chinos de pesos abiertos, y empujarán el campo hacia adelante.