Qwen 3.8 27B é excelente, mas por padrão exagera no raciocínio

Qwen 3.8 27B, um modelo de linguagem local aberto de ponta, está sendo elogiado por raciocínio próximo ao nível de fronteira, mas criticado por “pensar demais” por padrão, gastando vastos números de tokens internos de “thinking” e ficando 5–10x mais lento que alternativas em muitas tarefas. Usuários o comparam com modelos mais concisos como Muse Glimmer e Gemma 4, debatem o trade-off entre tamanho do modelo e compute no tempo de teste, e observam que a eficiência em tokens afeta diretamente tanto a latência quanto o custo operacional para agentes. Muitos relatam bons resultados ao reduzir ou desligar o raciocínio, adicionar orçamentos de thinking ou LoRAs, ou trocar templates — destacando tanto o quanto os modelos locais atuais se tornaram poderosos quanto o quanto sua utilidade depende de escolhas de harness e configuração.

Qualidade do modelo vs. exagero no raciocínio

  • Qwen 3.8 27B é amplamente elogiado como um grande salto em relação ao 3.6 e inusitadamente forte para um modelo denso local, com alguns usuários comparando seu desempenho a modelos de fronteira recentes em raciocínio e programação.
  • Principal reclamação: o modo de raciocínio padrão “xhigh” produz rastros de pensamento enormes (muitas vezes 10–30 mil+ tokens), tornando-o 5–10x mais lento e muito ineficiente em tokens para trabalho interativo.
  • O exagero no raciocínio costuma aparecer como desvios profundos, análise excessiva de casos-limite e soluções superengenheiradas (por exemplo, SVG/HTML ornamentado para prompts simples).

Modos de raciocínio, templates e mitigadores

  • Usuários relatam grandes ganhos ao:
    • Desligar o raciocínio ou usar “low”/“medium” em vez de “xhigh”.
    • Impor orçamentos rígidos de raciocínio em llama.cpp (--thinking-budget, --thinking-message) ou proxies personalizados que interrompem o pensamento após N tokens e dizem ao modelo para prosseguir.
  • Alguns harnesses/templates padrão usam xhigh; outros templates da comunidade (“fixed”) definem “medium” e expõem um menu suspenso para ajustar o esforço de raciocínio.
  • LoRAs como “ThinkingCap” estão sendo testadas para reduzir os tokens de pensamento em ~40–50% mantendo a qualidade, com resultados iniciais mistos, mas promissores.

Comparações com outros modelos

  • Muse Glimmer 30B: “pensamentos” muito mais concisos, menor uso de tokens, mais rápido na prática apesar de ser mais lento em tok/s bruto; alguns o veem como menos capaz que Qwen 3.6/3.8.
  • Gemma 4 12B é citado como um modelo pequeno de destaque (rápido, multimodal, eficiente em tokens), embora supostamente prejudicado por templates e configurações mal ajustados em algumas toolchains.
  • Vários usuários observam que muitos modelos abertos e proprietários atuais “pensam demais” por incentivos de treinamento e otimização de benchmarks.

Hardware, desempenho e local vs. nuvem

  • Qwen 3.8 27B roda em GPUs de consumo mais avançadas e Apple Silicon, mas a velocidade e o tamanho de contexto são fortemente limitados por largura de banda de memória e VRAM.
  • Usuários compartilham números reais: ~20–50 tok/s em GPUs decentes ou Macs da série M em contexto moderado; contextos longos e raciocínio pesado podem derrubar a geração para ~1 tok/s.
  • Para alguns, eletricidade mais hardware tornam os modelos em nuvem (por exemplo, Luna/Terra/Sol, GPT-5.x) mais baratos e rápidos; outros veem o uso local como preferível para privacidade, fluxos de trabalho agênticos e tarefas de longa duração.

Visões mais amplas sobre “pensar”

  • Muitos gostam do raciocínio visível para depuração, segurança e planejamento mais profundo; outros acham isso cognitivamente exaustivo e preferem pensamento oculto ou mínimo.
  • Há debate sobre se os tokens de chain-of-thought refletem raciocínio interno real ou um substrato de “murmúrio”, e se modelos futuros deveriam se mover mais para raciocínio em espaço latente.