Groqchat

Groqchat mostra o modelo Llama 2 70B da Meta rodando no hardware personalizado “Language Processing Unit” da Groq, alcançando centenas de tokens por segundo por usuário — muito mais rápido do que implantações típicas baseadas em GPU. Os comentaristas ficam impressionados com a velocidade e a baixa latência, especialmente para código e inferência em grandes modelos, mas observam que a qualidade da saída e os filtros de segurança rígidos são limitados pelo próprio modelo Llama 2 chat, e não pelo hardware. O thread também explora a arquitetura e a estratégia de escalonamento da Groq, seu foco em inferência (não treinamento) e o interesse em suporte futuro a modelos como Mixtral e acesso mais amplo à API.

Desempenho e Benchmarks

  • O principal entusiasmo gira em torno da velocidade: usuários relatam ~270–300 tokens/s para Llama‑2‑70B, مقابل ~60 tokens/s em outros serviços para o mesmo modelo.
  • Vários observam que essa é a velocidade mais alta que já viram para um modelo ≥70B; outros enfatizam que o ponto é tokens/s e latência, não a qualidade do modelo.
  • Alguns querem benchmarks mais claros e comparações justas (mesmo modelo, comprimento de contexto, tamanho do batch, além de $/token e watts).
  • Funcionários da Groq mencionam implantações usando 9 racks / 576 chips, com o modelo inteiro particionado na SRAM on-chip para latência muito baixa.

Qualidade do Modelo, Segurança e Censura

  • Muitos acham as respostas rápidas, mas frequentemente erradas, alucinatórias ou em loop; algumas tarefas (código, conselhos básicos de design de apps, receitas) parecem “em paridade” com o GPT-4, outras claramente piores.
  • Vários usuários reclamam de filtros de segurança fortes: recusas para poesia, letras de músicas, conteúdo sexual/romântico leve e até prompts benignos de imagem; descritos como “supercensurados” ou “entediante.”
  • Outros argumentam que isso é esperado do ajuste de segurança no estilo Llama‑2‑chat e que a escolha do modelo, não o hardware, determina a qualidade.

Hardware e Arquitetura

  • A Groq é descrita como uma empresa de hardware de chips personalizados; seus LPUs / GroqChips formam um “tecido de computação” de baixa latência e alto throughput, em vez de arquiteturas no estilo GPU.
  • Eles armazenam os modelos inteiramente em SRAM entre muitos chips (sem DRAM), o que é apontado como caro, mas ideal para inferência rápida com batch‑1.
  • Diz-se que o treinamento ainda favorece GPUs; a Groq foca em inferência, especialmente onde latência e tokens/s por usuário importam.

Ecossistema, Produtos e Preços

  • Uma API e preços estão “chegando em breve”, com alegações de que serão competitivos em preço com a OpenAI, mas muito mais rápidos.
  • Usuários perguntam sobre: implantações de mixtral‑8x7B e Mistral‑7B (em andamento), contexto longo, boxes domésticos/LLM, placas únicas e casos de uso verticais (por exemplo, saúde).
  • Alguns se preocupam com a maturidade da pilha de software e com a adaptabilidade de longo prazo a novas arquiteturas (por exemplo, MoE); as respostas afirmam que a toolchain pode compilar modelos arbitrários em PyTorch/ONNX.

UX e Diversos

  • Vários elogiam a responsividade, mas criticam a interface de chat (streaming que rola constantemente, autocorreção do iOS desativada).
  • Existe alguma confusão em torno da verificação de que as saídas correspondem exatamente ao Llama‑2‑70B em outro lugar; isso permanece incerto no thread.