Qwen 3.8 27B disponível na Cerebras a 1500 tokens/s

A Cerebras lançou inferência em nuvem ultrarrápida para o modelo Qwen 3.8 27B, entregando cerca de 1.500 tokens por segundo e impressionando muitos usuários com suas capacidades de programação e responsividade. No entanto, desenvolvedores destacam desvantagens significativas: 128k de contexto em vez do potencial total do modelo, limites rigorosos de tokens por minuto, nenhum benefício de preço com cache de prompt e custos relativamente altos que tornam cargas de trabalho de programação sustentadas ou agenticas inviáveis. Muitos concluem que o serviço funciona mais como uma vitrine para o hardware da Cerebras do que como uma alternativa competitiva de uso diário a implantações mais baratas baseadas em GPU ou auto-hospedadas.

Desempenho e velocidade do modelo

  • Qwen 3.8 27B na Cerebras é amplamente elogiado por ser muito forte para programação e raciocínio, com saída extremamente rápida (até ~1500 tok/s) e baixa latência.
  • Alguns usuários relatam que a experiência “parece” transformadora para a UX (respostas quase instantâneas), especialmente para busca, sumarização e tarefas rápidas de código.
  • Outros dizem que o processamento de entrada ainda domina o tempo para prompts grandes, então os ganhos no tempo total em comparação com modelos de ~100–200 tok/s podem ser modestos quando chamadas de ferramentas e comandos de shell são incluídos.

Preço, cache e economia de tokens

  • O preço é de cerca de $0.99/M em tokens de entrada e $1.49/M em tokens de saída em um modelo de créditos pay-as-you-go (sem mensalidade recorrente, crédito mínimo de $10).
  • O cache de prompt é suportado, mas:
    • Tokens de entrada em cache custam o mesmo que tokens novos.
    • Tokens em cache ainda contam para os limites de tokens por minuto.
  • Muitos veem isso como cache “apenas de marketing”, que remove o principal benefício econômico, tornando cargas de trabalho agenticas significativamente mais caras do que com concorrentes que dão grandes descontos para cache hits.

Limites de taxa e adequação para programação/cargas de trabalho agenticas

  • Limites do endpoint público: ~150k tokens/min sem cache, 450k total/min.
  • A 1500 tok/s, os usuários atingem esses limites muito rapidamente, especialmente com contextos grandes e chamadas frequentes de ferramentas.
  • Vários relatam gastar os créditos grátis em minutos e atingir limites em 60–90 segundos de programação agentica sustentada.
  • Consenso: bom para tarefas curtas e em rajadas; muitas vezes “inutilizável” para agentes de programação de longa duração e projetos grandes.

Janela de contexto e configuração do modelo

  • A Cerebras expõe apenas 128k de contexto, apesar de o modelo suportar mais em outros lugares.
  • Muitos consideram 128k insuficiente para setups sérios de programação/agenticos quando se incluem prompts de sistema, ferramentas, histórico e base de código; o contexto se enche rapidamente e a compactação vira um gargalo.
  • Alguns observam que o padrão de “extra-high reasoning” do Qwen 3.8 amplia as necessidades de contexto.

Comparações: outros provedores e hospedagem local

  • Outros hosts (por exemplo, OpenRouter, provedores dedicados de GPU) oferecem velocidades mais lentas (~80–300 tok/s), mas:
    • Melhor desconto de cache.
    • Menor custo efetivo para sessões longas.
  • Vários usuários executam Qwen 3.8 27B localmente (GPUs, ninfer, llama.cpp) a 30–200 tok/s sem limites de taxa, o que muitos preferem para cargas de trabalho sustentadas e dados sensíveis.
  • Para cargas pequenas, o prêmio de velocidade da Cerebras pode valer o custo extra; para programação agentica em grande escala, as alternativas costumam ser mais baratas no total.

Estratégia de produto, confiabilidade e suporte

  • Vários comentaristas veem a API pública como um canal de demonstração/marketing para vender hardware da Cerebras e contratos corporativos (por exemplo, hospedar modelos muito grandes para grandes clientes).
  • As reclamações incluem:
    • Quotas apertadas, modelos removidos/da camada compartilhada (por exemplo, Gemma 4) com pouco aviso.
    • Confiabilidade instável e erros confusos relacionados a cobrança/acesso.
    • Forte dependência do Discord para suporte, incluindo problemas de onboarding.
  • Sentimento geral: hardware impressionante e velocidade bruta, mas o serviço público parece limitado por capacidade, caro para programação contínua e pouco amigável para desenvolvedores.