Groq executa Mixtral 8x7B-32k com 500 T/s
A Groq revelou um serviço de hospedagem de LLM no qual o modelo Mixtral 8x7B roda a cerca de 500 tokens por segundo em ASICs personalizados de “Language Processing Unit”, superando drasticamente as implantações típicas baseadas em GPU. Os comentaristas ficam impressionados com respostas quase instantâneas, da classe do GPT‑3.5, e com o preço baixo por token, mas questionam como isso é alcançado, levantando dúvidas sobre custo total de hardware, consumo de energia, escalabilidade além de alguns modelos principais e a sustentabilidade de longo prazo do modelo de negócios. A discussão também explora detalhes técnicos como arquitetura determinística com forte uso de SRAM, quantização parcial em FP8, suporte a cargas ajustadas e não-LLM, e o que essas reduções de latência poderiam habilitar para voz em tempo real, agentes e outras aplicações interativas.
Desempenho e Impressões dos Usuários
- Muitos usuários relatam 400–500+ tokens/s no Mixtral 8x7B e ~200 t/s no Llama 2 70B via a demo e a API da Groq.
- As reações subjetivas são muito positivas: velocidade “instantânea” ou “sobre-humana”, especialmente em comparação com GPT‑3.5/4 e Gemini.
- Vários dizem que essa velocidade muda materialmente a UX: mais fácil de escanear, iterar e construir ferramentas interativas; a autoregressão lenta agora parece “antiquada”.
- Alguns consideram a qualidade do modelo comparável ou superior à do GPT‑3.5 para codificação e tarefas gerais, embora não no nível do GPT‑4.
Hardware e Arquitetura
- A Groq usa ASICs personalizados (“GroqChips” / LPU) com ~230 MB de SRAM no chip cada, integrados em racks com centenas de chips; a demo atual supostamente usa ~568 chips.
- A arquitetura enfatiza determinismo, clock fixo e um motor matricial semelhante a sistólico com interconexão determinística chip a chip (links de ~100 Gbps).
- KV cache é usado; a decodificação atualmente roda efetivamente em batch size 1, com alta vazão devido à arquitetura.
- Parte do pipeline do compilador e da infraestrutura é implementada em Haskell; outros componentes usam C++/MLIR e Python.
Latência, Vazão e Batching
- A Groq se posiciona como otimizada para inferência de baixa latência e pequenos batches, em oposição a stacks de GPU que dependem fortemente de batching grande para atingir alta vazão.
- Benchmarks independentes citados mostram tempo até o primeiro token muito baixo e alta vazão por requisição individual, inclusive via API pública.
- A discussão observa que GPUs podem atingir tokens/s totais muito altos, mas normalmente com menor velocidade por usuário.
Precisão, Quantização e Qualidade
- As ativações são computadas em FP16; alguns pesos são armazenados como FP8 “em repouso”. A Groq afirma não haver perda de qualidade significativa em relação ao FP16 completo.
- Usuários relatam qualidade do Mixtral pelo menos equivalente à de modelos fortes da classe 3.5; outros destacam alucinações claras e falhas aritméticas (por exemplo, primos, fatoração), enfatizando que hardware mais rápido não corrige limites do modelo.
Custo, Escala e Modelo de Negócios
- Cartões aceleradores de varejo são caros (~US$20 mil cada), implicando hardware de vários milhões de dólares para a escala da demo; a Groq diz que seu próprio custo é muito menor que o preço de varejo.
- Alguns observadores questionam tokens/s por dólar e o consumo total de energia; outros observam que baixa latência pode justificar alto capex para certos casos de uso.
- A Groq vende tanto tokens “como serviço” (com a promessa de superar os preços por token dos concorrentes para modelos suportados) quanto sistemas completos para empresas; não há planos de curto prazo para hardware hobbyista.
API, Ecossistema e Acesso
- Há uma API de chat/completions no estilo OpenAI com compatibilidade parcial; documentação e um Discord são fornecidos.
- O enorme interesse recente criou listas de espera e filas; alguns usuários relatam longas esperas apesar da geração rápida depois que começa.
- Vários desenvolvedores expressam forte interesse em usar a Groq como backend para apps, sistemas RAG e ferramentas de código.
Casos de Uso e Aplicações
- A baixa latência é vista como especialmente valiosa para: agentes de voz em tempo real (demo da CNN), call centers, trading, assistentes estilo “copilot”, jogos/NPCs em VR e pipelines de agentes em múltiplas etapas.
- A Groq afirma que o hardware é computação numérica de propósito geral, adequado para modelos de visão e difusão; há algum trabalho com difusão, mas ainda não exposto publicamente.
Críticas, Limitações e Questões em Aberto
- As preocupações incluem: ausência de HBM limitando a capacidade de modelo por chip; necessidade de centenas de chips para um modelo grande; vazão total do sistema pouco clara; e precificação potencialmente insustentável.
- Alguns argumentam que GPUs com HBM podem ser melhores para cenários multi-modelo, multi-LoRA ou on-prem; outros contrapõem que o sistema determinístico e a SRAM da Groq são críticos para latência ultrabaixa.
- Bugs e problemas de UX são apontados: comportamento confuso de troca de modelo na demo, peculiaridades da interface móvel, dependências de carregamento de fonte e saídas ocasionais em loop.
- Vários usuários enfatizam que alucinações e limites de raciocínio continuam; velocidade por si só não resolve os problemas centrais de confiabilidade do modelo.