Qwen3.8-Flash-Next

Qwen3.8-Flash-Next, um novo modelo de linguagem grande mixture-of-experts da Alibaba, está chamando atenção por superar versões anteriores do Qwen enquanto é muito mais barato de treinar e servir, além de antecipar a arquitetura planejada para o Qwen 4. Ele combina um modelo principal de 125B parâmetros com uma grande memória N‑gram “engram” para separar recuperação factual de raciocínio, prometendo alta qualidade com poucos parâmetros ativos e tornando-o atraente para implantação local em Macs com muita RAM, sistemas AMD Strix Halo e caixas DGX Spark. Os comentaristas estão entusiasmados, mas observam limitações atuais: ferramentas como llama.cpp e vLLM estão apenas começando a adicionar suporte, versões quantizadas são grandes por causa do sidecar N‑gram, e overthinking e verbosidade ainda preocupam em comparação com alguns modelos hospedados de fronteira.

Desempenho e posicionamento do modelo

  • Muitos veem o Qwen3.8-Flash-Next superando o Qwen3.8-27B e o DeepSeek V4 Flash em benchmarks, especialmente considerando que é um MoE relativamente pequeno em parâmetros ativos (≈6B por token).
  • Alguns se surpreendem com o fato de ele “vencer” o 27B denso de forma tão clara; outros observam que isso é esperado por causa de uma arquitetura mais nova e do design MoE.
  • Há interesse em como ele se compara a modelos proprietários de “fronteira” em custo por tarefa, com certo ceticismo de que a precificação por token, sozinha, conte a história toda.

Arquitetura: MoE e embeddings N‑gram / “engram”

  • A arquitetura é descrita como 125B de parâmetros principais + ~51B de embeddings N‑gram, com 6B ativos por token; vista como uma prévia de uma futura família Qwen 4.
  • A tabela N‑gram/engram é apresentada como:
    • Um sidecar de recuperação de fatos que preserva conhecimento específico sem sobrecarregar os pesos densos.
    • Similar em espírito ao RAG, mas integrado à rede e sem usar a janela de contexto.
    • Uma forma de trocar memória extra por menos computação por token e por um “conhecimento de mundo” de cauda longa mais robusto.
  • Alguns esclarecem que, na prática, não se trata apenas de “quantização de 1 bit”; as taxas efetivas de bits diferem entre o modelo central e a tabela N‑gram.

Implantação local e hardware

  • Grande entusiasmo de usuários de Strix Halo, DGX Spark, Macs com muita RAM e plataformas AMD/Apple: 128 GB de memória unificada é um alvo comum.
  • Velocidades relatadas:
    • Strix Halo: ~20–35 tok/s agora, com expectativas de 50–60 tok/s com kernels/MTP melhores.
    • DGX Spark: ~12–20 tok/s em decode, ~80–190 tok/s em prefill com engines customizadas e N‑grams paginados em NVMe.
  • Preocupação: o sidecar N‑gram (~50 GB+) dificulta rodar em sistemas com 32–64 GB, minando a esperança inicial de que um MoE com 6B ativos fosse amigável à CPU.

Ferramentas, quantização e ecossistema

  • Fricção inicial: o llama.cpp principal e o vLLM inicialmente não tinham suporte; hoje existem forks e builds especiais, com PRs em andamento.
  • O Unsloth fornece quants em GGUF e documenta que até mesmo o “1-bit” requer ~75+ GB de RAM; quants de bits mais altos podem chegar a ~90+ GB.
  • Alguns reclamam que os quants atuais focam demais em bits muito baixos (1–2 bits), o que pode subrepresentar a qualidade do modelo; outros mostram resultados razoáveis mesmo em 2 bits.

Estilo de raciocínio, overthinking e eficiência de tokens

  • Vários usuários relatam que modelos anteriores do Qwen 3.8 “pensavam demais” em níveis altos de raciocínio, especialmente em tarefas abertas ou de uma única passada, causando saídas lentas e verborrágicas.
  • Alguns esperam que o Flash-Next seja mais direto; os relatos iniciais são mistos: ele ainda pode se questionar, mas muitas vezes entrega resultados fortes.
  • Há preocupação de que modelos chineses “flash” (incluindo GLM e DeepSeek) possam desperdiçar muitos tokens em longas cadeias internas de raciocínio, o que importa para custos de API.

Preços e economia

  • A precificação da API do Qwen3.8-Flash-Next (por exemplo, $0.16 / $0.47 por milhão de tokens) é comparada com níveis da DeepSeek e da OpenAI.
  • Debate sobre se a inferência com esses preços é lucrativa:
    • Um lado argumenta que a inferência é claramente positiva em margem e que os preços acompanham as taxas mais amplas do mercado.
    • Outro lado suspeita que descontos agressivos, subsídios cruzados ou posicionamento pré-IPO possam mascarar os custos reais.

Conhecimento vs. ferramentas vs. arquitetura

  • Vários comentários divagam sobre se modelos menores com busca na web ou armazenamentos externos de conhecimento conseguem igualar o “conhecimento de mundo” incorporado de modelos maiores.
  • Alguns argumentam:
    • Modelos grandes codificam uma ampla gama de livros/conhecimento, mas não têm recuperação perfeita, então recuperação e citações continuam importando.
    • Modelos menores com ferramentas podem ser preferíveis quando atualidade e armazenamentos modulares de conhecimento são importantes.
  • Outros enfatizam que você “não pode buscar o que não sabe que existe”, então a cobertura conceitual interna ainda importa para descobrir algoritmos e técnicas.

Dinâmica de código aberto e geopolítica

  • A thread observa o contraste entre laboratórios americanos relativamente conservadores e lançamentos abertos agressivos e frequentes de equipes chinesas (Qwen, DeepSeek, GLM).
  • Alguns veem esse ciclo rápido de lançamentos abertos como motor da inovação em LLMs locais e como forma de tornar novas arquiteturas (MoE + N‑grams, MTP, etc.) rapidamente acessíveis.
  • Há uma percepção subjacente de que tanto APIs de fronteira fortemente controladas quanto modelos chineses de pesos abertos coexistirão e empurrarão o campo para frente.