Qwen 3.8-Flash-Next será lançado amanhã (125B a6B)

O modelo Qwen3.8-Flash-Next da Alibaba está chamando atenção como uma grande arquitetura MoE (mixture-of-experts) com 125B parâmetros e 6B ativos por token, projetada para rodar em hardware “consumer” de alto nível, como Macs com 128GB, sistemas Strix Halo e GPUs com 32GB+ de VRAM. Os comentaristas o veem como uma possível alternativa local da classe Opus/Sonnet para programação e workloads “agentic”, mas observam trade-offs em velocidade, footprint de memória, qualidade de quantização e a praticidade de executar tais modelos em casa versus usar APIs na nuvem. Muitos encaram este lançamento como uma prévia técnica inicial da futura família Qwen4, destinada a permitir que stacks de inferência e ferramentas acompanhem antes da chegada da linha completa.

Arquitetura do modelo e objetivos

  • A descrição inicial (desde então removida) dizia: MoE multimodal de 125B parâmetros, ~6B parâmetros ativos por token, além de ~51B embeddings de n‑gram e uma nova “Qwen Sparse Attention”.
  • Alegava alcançar uma capacidade próxima da do Qwen3.7-Plus com cerca de 1/9 do custo de treinamento, com melhor desempenho em programação/cowork.
  • A equipe Qwen diz que isto é principalmente uma prévia arquitetural para que as pilhas de inferência possam se preparar para a próxima “família completa” de modelos Qwen4, e não um lançamento totalmente polido.

Contagens de parâmetros, escala e “tamanho efetivo”

  • Uma regra prática discutida: o “tamanho denso efetivo” de um MoE ≈ média geométrica dos parâmetros totais e ativos. Para 125B‑a6B isso ≈27B, o que bate com a expectativa de que sua qualidade será semelhante à do Qwen3.8 27B.
  • Alguns esperam capacidades aproximadamente na classe Sonnet/Opus-4.6 para programação e tarefas Linux, mas com “pensamento excessivo” extra que pode ser mitigado por temperatura e prompting.

Requisitos de hardware e desempenho

  • Muitos assumem que as máquinas da classe 128GB de RAM (Mac Studio, Strix Halo, DGX Spark, GPUs grandes) são os alvos reais.
  • Vários benchmarks e relatos:
    • O Qwen3.8 27B roda bem em 5090 e desktops com duas GPUs; preferem-se 32GB+ de VRAM e quantização de ≥6 bits para evitar perda de गुणवत्ता.
    • O Strix Halo tem dificuldade com modelos densos de 27B (frequentemente ~10–30 tok/s), mas o MoE com 6B ativos pode ficar em torno de 25–40 tok/s; a latência de prefill continua sendo um problema.
    • O M5 Max mostra grandes ganhos sobre o M4 para prefill; foram relatados 25–70 tok/s em 27B com MTP e runtimes MLX otimizados, embora outros vejam algo mais próximo de 30–35 tok/s.
  • FP8 para o modelo completo parece grande demais para 96GB de VRAM; a խորհուրդ é esperar FP4/Q4 para configurações de consumo.

Local vs nuvem, e roteadores

  • Muitos gostam de modelos locais de ponta, mas os consideram lentos para programação interativa e fluxos de trabalho agentic em comparação com APIs pagas na nuvem.
  • O OpenRouter é elogiado pela flexibilidade, mas criticado por:
    • Endpoints Qwen serem instáveis ou limitados em capacidade.
    • Economia de cache de prompt pior do que ir direto aos provedores.
    • Dificuldade em fixar provedores estáveis e baratos sem muita configuração.
  • Alguns preferem roteadores auto-hospedados (por exemplo, com aliases de modelo, fallbacks local/nuvem) para previsibilidade e controle de custos.

Comparações e impacto no ecossistema

  • Espera-se que o modelo concorra com MoEs “flash” no estilo DeepSeek e outros modelos da classe 27–35B (Qwen3.6/3.8, Gemma 4, Laguna, Ornith, GPT‑OSS).
  • Sentimento misto: entusiasmo por um MoE poderoso e semi-executável em hardware de consumo; ceticismo quanto à velocidade, aos preços de RAM e a se ele realmente substitui o Claude/ outras APIs de frontier.