Qwen 3.8 27B disponível na Cerebras a 1500 tokens/s
A Cerebras lançou inferência em nuvem ultrarrápida para o modelo Qwen 3.8 27B, entregando cerca de 1.500 tokens por segundo e impressionando muitos usuários com suas capacidades de programação e responsividade. No entanto, desenvolvedores destacam desvantagens significativas: 128k de contexto em vez do potencial total do modelo, limites rigorosos de tokens por minuto, nenhum benefício de preço com cache de prompt e custos relativamente altos que tornam cargas de trabalho de programação sustentadas ou agenticas inviáveis. Muitos concluem que o serviço funciona mais como uma vitrine para o hardware da Cerebras do que como uma alternativa competitiva de uso diário a implantações mais baratas baseadas em GPU ou auto-hospedadas.
Desempenho e velocidade do modelo
- Qwen 3.8 27B na Cerebras é amplamente elogiado por ser muito forte para programação e raciocínio, com saída extremamente rápida (até ~1500 tok/s) e baixa latência.
- Alguns usuários relatam que a experiência “parece” transformadora para a UX (respostas quase instantâneas), especialmente para busca, sumarização e tarefas rápidas de código.
- Outros dizem que o processamento de entrada ainda domina o tempo para prompts grandes, então os ganhos no tempo total em comparação com modelos de ~100–200 tok/s podem ser modestos quando chamadas de ferramentas e comandos de shell são incluídos.
Preço, cache e economia de tokens
- O preço é de cerca de $0.99/M em tokens de entrada e $1.49/M em tokens de saída em um modelo de créditos pay-as-you-go (sem mensalidade recorrente, crédito mínimo de $10).
- O cache de prompt é suportado, mas:
- Tokens de entrada em cache custam o mesmo que tokens novos.
- Tokens em cache ainda contam para os limites de tokens por minuto.
- Muitos veem isso como cache “apenas de marketing”, que remove o principal benefício econômico, tornando cargas de trabalho agenticas significativamente mais caras do que com concorrentes que dão grandes descontos para cache hits.
Limites de taxa e adequação para programação/cargas de trabalho agenticas
- Limites do endpoint público: ~150k tokens/min sem cache, 450k total/min.
- A 1500 tok/s, os usuários atingem esses limites muito rapidamente, especialmente com contextos grandes e chamadas frequentes de ferramentas.
- Vários relatam gastar os créditos grátis em minutos e atingir limites em 60–90 segundos de programação agentica sustentada.
- Consenso: bom para tarefas curtas e em rajadas; muitas vezes “inutilizável” para agentes de programação de longa duração e projetos grandes.
Janela de contexto e configuração do modelo
- A Cerebras expõe apenas 128k de contexto, apesar de o modelo suportar mais em outros lugares.
- Muitos consideram 128k insuficiente para setups sérios de programação/agenticos quando se incluem prompts de sistema, ferramentas, histórico e base de código; o contexto se enche rapidamente e a compactação vira um gargalo.
- Alguns observam que o padrão de “extra-high reasoning” do Qwen 3.8 amplia as necessidades de contexto.
Comparações: outros provedores e hospedagem local
- Outros hosts (por exemplo, OpenRouter, provedores dedicados de GPU) oferecem velocidades mais lentas (~80–300 tok/s), mas:
- Melhor desconto de cache.
- Menor custo efetivo para sessões longas.
- Vários usuários executam Qwen 3.8 27B localmente (GPUs, ninfer, llama.cpp) a 30–200 tok/s sem limites de taxa, o que muitos preferem para cargas de trabalho sustentadas e dados sensíveis.
- Para cargas pequenas, o prêmio de velocidade da Cerebras pode valer o custo extra; para programação agentica em grande escala, as alternativas costumam ser mais baratas no total.
Estratégia de produto, confiabilidade e suporte
- Vários comentaristas veem a API pública como um canal de demonstração/marketing para vender hardware da Cerebras e contratos corporativos (por exemplo, hospedar modelos muito grandes para grandes clientes).
- As reclamações incluem:
- Quotas apertadas, modelos removidos/da camada compartilhada (por exemplo, Gemma 4) com pouco aviso.
- Confiabilidade instável e erros confusos relacionados a cobrança/acesso.
- Forte dependência do Discord para suporte, incluindo problemas de onboarding.
- Sentimento geral: hardware impressionante e velocidade bruta, mas o serviço público parece limitado por capacidade, caro para programação contínua e pouco amigável para desenvolvedores.