Qwen3.8-Flash-Next
Qwen3.8-Flash-Next, um novo modelo de linguagem grande mixture-of-experts da Alibaba, está chamando atenção por superar versões anteriores do Qwen enquanto é muito mais barato de treinar e servir, além de antecipar a arquitetura planejada para o Qwen 4. Ele combina um modelo principal de 125B parâmetros com uma grande memória N‑gram “engram” para separar recuperação factual de raciocínio, prometendo alta qualidade com poucos parâmetros ativos e tornando-o atraente para implantação local em Macs com muita RAM, sistemas AMD Strix Halo e caixas DGX Spark. Os comentaristas estão entusiasmados, mas observam limitações atuais: ferramentas como llama.cpp e vLLM estão apenas começando a adicionar suporte, versões quantizadas são grandes por causa do sidecar N‑gram, e overthinking e verbosidade ainda preocupam em comparação com alguns modelos hospedados de fronteira.
Desempenho e posicionamento do modelo
- Muitos veem o Qwen3.8-Flash-Next superando o Qwen3.8-27B e o DeepSeek V4 Flash em benchmarks, especialmente considerando que é um MoE relativamente pequeno em parâmetros ativos (≈6B por token).
- Alguns se surpreendem com o fato de ele “vencer” o 27B denso de forma tão clara; outros observam que isso é esperado por causa de uma arquitetura mais nova e do design MoE.
- Há interesse em como ele se compara a modelos proprietários de “fronteira” em custo por tarefa, com certo ceticismo de que a precificação por token, sozinha, conte a história toda.
Arquitetura: MoE e embeddings N‑gram / “engram”
- A arquitetura é descrita como 125B de parâmetros principais + ~51B de embeddings N‑gram, com 6B ativos por token; vista como uma prévia de uma futura família Qwen 4.
- A tabela N‑gram/engram é apresentada como:
- Um sidecar de recuperação de fatos que preserva conhecimento específico sem sobrecarregar os pesos densos.
- Similar em espírito ao RAG, mas integrado à rede e sem usar a janela de contexto.
- Uma forma de trocar memória extra por menos computação por token e por um “conhecimento de mundo” de cauda longa mais robusto.
- Alguns esclarecem que, na prática, não se trata apenas de “quantização de 1 bit”; as taxas efetivas de bits diferem entre o modelo central e a tabela N‑gram.
Implantação local e hardware
- Grande entusiasmo de usuários de Strix Halo, DGX Spark, Macs com muita RAM e plataformas AMD/Apple: 128 GB de memória unificada é um alvo comum.
- Velocidades relatadas:
- Strix Halo: ~20–35 tok/s agora, com expectativas de 50–60 tok/s com kernels/MTP melhores.
- DGX Spark: ~12–20 tok/s em decode, ~80–190 tok/s em prefill com engines customizadas e N‑grams paginados em NVMe.
- Preocupação: o sidecar N‑gram (~50 GB+) dificulta rodar em sistemas com 32–64 GB, minando a esperança inicial de que um MoE com 6B ativos fosse amigável à CPU.
Ferramentas, quantização e ecossistema
- Fricção inicial: o llama.cpp principal e o vLLM inicialmente não tinham suporte; hoje existem forks e builds especiais, com PRs em andamento.
- O Unsloth fornece quants em GGUF e documenta que até mesmo o “1-bit” requer ~75+ GB de RAM; quants de bits mais altos podem chegar a ~90+ GB.
- Alguns reclamam que os quants atuais focam demais em bits muito baixos (1–2 bits), o que pode subrepresentar a qualidade do modelo; outros mostram resultados razoáveis mesmo em 2 bits.
Estilo de raciocínio, overthinking e eficiência de tokens
- Vários usuários relatam que modelos anteriores do Qwen 3.8 “pensavam demais” em níveis altos de raciocínio, especialmente em tarefas abertas ou de uma única passada, causando saídas lentas e verborrágicas.
- Alguns esperam que o Flash-Next seja mais direto; os relatos iniciais são mistos: ele ainda pode se questionar, mas muitas vezes entrega resultados fortes.
- Há preocupação de que modelos chineses “flash” (incluindo GLM e DeepSeek) possam desperdiçar muitos tokens em longas cadeias internas de raciocínio, o que importa para custos de API.
Preços e economia
- A precificação da API do Qwen3.8-Flash-Next (por exemplo, $0.16 / $0.47 por milhão de tokens) é comparada com níveis da DeepSeek e da OpenAI.
- Debate sobre se a inferência com esses preços é lucrativa:
- Um lado argumenta que a inferência é claramente positiva em margem e que os preços acompanham as taxas mais amplas do mercado.
- Outro lado suspeita que descontos agressivos, subsídios cruzados ou posicionamento pré-IPO possam mascarar os custos reais.
Conhecimento vs. ferramentas vs. arquitetura
- Vários comentários divagam sobre se modelos menores com busca na web ou armazenamentos externos de conhecimento conseguem igualar o “conhecimento de mundo” incorporado de modelos maiores.
- Alguns argumentam:
- Modelos grandes codificam uma ampla gama de livros/conhecimento, mas não têm recuperação perfeita, então recuperação e citações continuam importando.
- Modelos menores com ferramentas podem ser preferíveis quando atualidade e armazenamentos modulares de conhecimento são importantes.
- Outros enfatizam que você “não pode buscar o que não sabe que existe”, então a cobertura conceitual interna ainda importa para descobrir algoritmos e técnicas.
Dinâmica de código aberto e geopolítica
- A thread observa o contraste entre laboratórios americanos relativamente conservadores e lançamentos abertos agressivos e frequentes de equipes chinesas (Qwen, DeepSeek, GLM).
- Alguns veem esse ciclo rápido de lançamentos abertos como motor da inovação em LLMs locais e como forma de tornar novas arquiteturas (MoE + N‑grams, MTP, etc.) rapidamente acessíveis.
- Há uma percepção subjacente de que tanto APIs de fronteira fortemente controladas quanto modelos chineses de pesos abertos coexistirão e empurrarão o campo para frente.