Executando o Gemma 4 26B a 5 tokens/seg em um Xeon de 13 anos sem GPU

Executar um modelo Gemma 4 de 26B parâmetros em CPUs Xeon de 10–13 anos a cerca de 5 tokens por segundo mostra que grandes LLMs modernos podem rodar localmente em hardware antigo, desde que haja RAM suficiente e quantização cuidadosa. Os comentaristas avaliam o quão prático isso realmente é, contrastando velocidades lentas de tokens e alto consumo de energia com o apelo de privacidade, uso ilimitado e computação “gratuita se você já a possui”, além de comparar custos com provedores de inferência na nuvem. O tópico também aborda a trajetória para modelos esparsos/MoE cada vez maiores em máquinas de consumo e levanta preocupações sobre posts técnicos gerados por IA e as normas da comunidade em torno da divulgação.

Conteúdo Escrito por IA & Normas do HN

  • Vários comentaristas argumentam que a postagem do blog e alguns comentários “parecem” saída de IA e observam que posts/comentários escritos por IA violam as normas do HN.
  • Outros discordam ou dizem que é difícil distinguir quando as pessoas usam LLMs pesadamente para redigir texto.
  • O autor afirma que o patch de código foi assistido por IA, mas a postagem esclarece quais partes foram humanas vs. IA.

Bug & Detalhes Técnicos

  • O fork original assumia AVX2; Xeons Ivy Bridge mais antigos não têm isso, causando falhas de compilação e, de forma mais sutil, caminhos de dispatch ausentes para duas operações de MoE.
  • Em builds sem AVX2, as saídas dos especialistas de MoE vinham de memória não inicializada, levando a texto fluente, porém sem sentido.
  • Um correção foi enviada upstream como pull request.

Desempenho, Quantização & RAM

  • Há vários relatos de execução do Gemma 4 e de outros modelos em Xeons antigos, servidores com dois CPUs e hardware da Apple.
  • As taxas de tokens variam bastante: ~5 t/s para o Gemma 4 26B em Xeons da era de 2013; taxas maiores em GPUs e em modelos menores/fortemente quantizados.
  • Discussão sobre Q4 vs Q8: Q4 reduz pela metade a necessidade de largura de banda e pode quase dobrar a velocidade em sistemas limitados por banda, mas Q8/Q6 são preferidos quando a RAM permite, devido à qualidade.
  • Muita RAM (80–100+ GB usados por modelos 26B) é comum; alguns experimentam configurações com RAM extremamente baixa e carregadores personalizados.

Usabilidade de Modelos Locais Lentos

  • Há uma divisão forte: alguns acham 5–10 t/s aceitável para fluxos de trabalho em segundo plano ou em lote; outros consideram isso inutilizável para codificação interativa ou cadeias longas de raciocínio.
  • Debate sobre “estado de fluxo”: modelos rápidos (centenas de t/s) permitem iterar rapidamente; modelos lentos empurram as pessoas para uso em fila e “deixar rodando e voltar depois”.

Custo, Energia & Eficiência

  • Vários cálculos de ordem de grandeza sugerem que inferência local em CPU pode custar mais em eletricidade do que tokens na nuvem, especialmente com servidores de 300–500W e preços altos de energia.
  • Contrapontos: eletricidade mais barata, solar ou uso do calor residual para aquecimento ambiente podem mudar a conta.
  • O limitador de potência da GPU pode reduzir significativamente o consumo de energia com perda modesta de velocidade.
  • Alguns observam que provedores de nuvem podem atualmente vender tokens abaixo do custo real, então os preços podem subir.

Privacidade, Controle & Motivação para Uso Local

  • Muitos enfatizam privacidade, independência e liberdade de limites de fornecedores como as principais razões para a inferência local, não o custo.
  • Outros veem o hardware local como valioso para experimentação, mas ainda não competitivo com os melhores modelos de nuvem em qualidade ou velocidade.

Futuro dos LLMs Locais

  • Previsões otimistas: >200B MoE e até modelos equivalentes a ~1T parâmetros em hardware de consumo por volta de 2027–2028, ajudados por treinamento ternário/de 1 bit, MoE esparso, novas GPUs e aceleradores especializados.
  • Céticos destacam largura de banda da RAM, restrições de energia, capacidade de fabs e incentivos econômicos para priorizar datacenters.
  • Alguns argumentam que transformers são estruturalmente inadequados para inferência local eficiente; outros veem o trabalho contínuo em arquitetura e hardware como promissor.

Problemas de Ferramentas & Configuração

  • Dicas práticas: ajustar timeouts no Ollama, explorar configurações de TTL/evicção do LM Studio e usar frameworks de batch/agentes para explorar melhor modelos locais lentos.