Qwen3.8-2.4T

Um novo modelo Qwen3.8 de 2,4 trilhões de parâmetros foi lançado como pesos abertos, impressionando muitos com resultados de benchmark próximos aos melhores modelos proprietários e, ao mesmo tempo, levantando dúvidas práticas sobre como operar um sistema de ~5 TB no mundo real. Comentadores debatem estratégias de quantização, requisitos de hardware e se variantes extremamente grandes em 1-bit ou FP8 valem a pena em comparação com modelos menores, mas mais otimizados, como DeepSeek V4 Flash, GLM 5.2 ou o futuro Qwen3.8-27B. Também há preocupação de que a variante aberta tenha limitações intencionais — sem visão, com contexto reduzido e sem quantização QAT — o que a torna mais difícil de auto-hospedar do que rivais como Kimi K3, apesar de desempenho semelhante.

Lançamento geral e posicionamento

  • Qwen3.8-2.4T é um modelo MoE com ~2,4T de parâmetros e ~5 TB de pesos bf16 (≈2,5 TB fp8), posicionado em torno dos níveis de benchmark de Opus 4.8–Fable 5.
  • Ele é apresentado como um rival do Kimi K3 (2,8T-A100B), mas é mais difícil de servir no lançamento devido ao suporte apenas a bf16/fp8 e à falta de pesos 4-bit prontos para QAT.

Escala, desempenho e comparações

  • Alegações: a variante quantizada em 1-bit (~397 GB, 95B de ativos MoE) tem desempenho em torno do “nível Opus 4.5”, com alguns argumentando que modelos muito grandes degradam menos sob quantização pesada.
  • Outros discordam: comparações de 1-bit com modelos em precisão total são chamadas de enganosas; a divergência KL é criticada como um proxy inadequado para capacidade.
  • Vários კომენტadores dizem que DeepSeek v4 Flash e Kimi K3 já alcançam a faixa de Opus 4.5–4.6 em tamanho e custo muito menores.
  • Para programação, alguns usuários relatam que o GLM 5.2 supera tanto Kimi K3 quanto Qwen 3.8 apesar do maior uso de tokens, tornando-o mais econômico para eles.

Requisitos de hardware e quantização

  • Rodar em bf16 completo (~4,9 TB) ou fp8 é visto como algo apenas para cluster; configurações de consumo precisam depender de quants.
  • Há debate sobre orientação para um orçamento fixo de RAM: a regra antiga “modelo maior com menos bits > modelo menor com mais bits” agora ficou mais nebulosa por causa de MoE, QAT, MTP/DFlash e eficiência de KV.
  • O consenso aproximado:
    • 4-bit costuma ser a menor precisão “segura” para modelos padrão.
    • Sub‑4-bit geralmente é ruim, a menos que o modelo seja explicitamente treinado para isso (poucos modelos grandes são).
  • Muitos usuários estão focando no futuro Qwen3.8 de 27B para uso local (cabe em GPUs de ponta com quants Q4), observando uma “zona morta” na faixa de 120–300B para lançamentos abertos.

Recursos e limitações

  • O modelo open-weight de 2,4T não tem visão, possui contexto de 250k e exclui alguns recursos de “thinking”/ferramentas presentes no Qwen3.8-Max proprietário (contexto de 1M, ferramentas integradas, modo não-thinking).
  • Alguns veem isso como um passo atrás em relação aos lançamentos abertos mais completos do Qwen 3.5.
  • O novo parâmetro reasoning_effort (low/medium/xhigh) foi criado para trocar velocidade por profundidade, mas usuários relatam que a tendência a loops pode persistir mesmo em low.

Ecossistema, ferramentas e provedores

  • A Unsloth oferece quants iniciais e documentação detalhada; muitos elogiam sua qualidade e responsividade, embora alguns relatem problemas com builds gguf específicos.
  • Llama.cpp e ferramentas semelhantes podem quantizar sem QAT, mas isso pode sacrificar a optimalidade; provedores provavelmente favorecerão fp8 ou nvfp4 calibrado de alta qualidade até que exista um bom QAT em Q4.
  • As opções de serving mencionadas incluem a própria nuvem da Alibaba, OpenRouter, DigitalOcean, Fireworks e integrações OpenCode; o Bedrock é visto como cada vez mais voltado sobretudo a laboratórios proprietários dos EUA.

Concorrência chinesa e contexto de política

  • Vários comentaristas ligam os lançamentos abertos da Qwen a uma política industrial chinesa que incentiva modelos abertos e transferência de tecnologia, enquadrando isso tanto como estratégia geopolítica quanto como um motor prático de abertura.
  • Há um sentimento amplo de que os lançamentos open-weight chineses estão pressionando laboratórios ocidentais, impedindo um futuro totalmente fechado de “inteligência tarifada”.

Trajetória de hardware e modelos futuros

  • As estimativas para hardware abaixo de US$10 mil capaz de rodar esses modelos sem quantização variam de ~5 anos até ~2040, com a largura de banda (HBM vs DDR) citada como um limitador-chave, não apenas a capacidade.
  • Outros esperam que modelos futuros menores (<400B) atinjam inteligência semelhante muito antes de hardware de consumo conseguir hospedar confortavelmente 2,4T bf16.