Como a GLM construiu sua própria infraestrutura de inferência
O laboratório chinês Z.ai construiu uma pilha de inferência em larga escala para seus modelos GLM-5.3 em mais de 100.000 aceleradores de IA produzidos domesticamente, provocando debate sobre o impacto estratégico de a China alcançar uma infraestrutura competitiva, sem NVIDIA. Os comentaristas avaliam os feitos técnicos e a otimização agressiva de software em contraste com reclamações de usuários sobre preços, velocidade e limites de tokens, e contrapõem a postura de pesos abertos do GLM aos modelos fechados dos EUA, como o Claude. O tópico também aborda alegações de destilação em grande escala a partir dos modelos da Anthropic, a eficácia dos controles de exportação de chips dos EUA e se essa mudança vai corroer ao longo do tempo a dominância ocidental em hardware e modelos de IA.
Aceleradores de IA chineses e implicações geopolíticas
- Muitos veem executar GLM-5.3(-Flash) em >100k aceleradores chineses como uma grande mudança estratégica: a China agora tem seus próprios chips mais inferência em grande escala.
- A visão de que “a maioria dos usuários não precisa de modelos de fronteira” — modelos fortes, baratos e ligeiramente atrás, mais chips domésticos, poderiam ser um “evento de asteroide” para os laboratórios ocidentais.
- Debate sobre se a eletricidade chinesa é mais barata; um comentarista cita dados alegando que a energia industrial é, na verdade, mais cara do que nos EUA.
- Alguns argumentam que os controles de exportação dos EUA saíram pela culatra, forçando/acelerando o desenvolvimento doméstico de chips na China e inovações em eficiência; outros dizem que a China já iria fazer isso de qualquer forma.
Preços, planos de tokens e valor
- Vários usuários dizem que os planos iniciais de codificação da Z.ai eram “comicamente subsidiados” e depois tiveram forte reajuste, agora parecendo caros demais ou limitados demais em tokens.
- Outros ainda veem bom valor por causa de caching e altos limites de tokens, especialmente nos planos Max, mas observam que é preciso paralelizar bastante e/ou usar Flash para atingir as cotas.
- Confusão sobre quantos tokens os níveis de assinatura realmente oferecem; alguns comparam desfavoravelmente com Claude, enquanto outros argumentam que o valor por dólar é semelhante quando mapeado corretamente.
Qualidade do modelo, padrões de uso e agentes
- GLM-5.3 é frequentemente elogiado como de primeira linha entre pesos abertos, com bom raciocínio e alucinações relativamente baixas, embora possa “perder o rumo” sem supervisão.
- Usuários intensivos de tokens descrevem configurações multiagente (por exemplo, geração de código, busca de bugs, pipelines de busca/otimização) movimentando bilhões de tokens por mês.
- O consenso é que todos os modelos atuais precisam de supervisão humana ou de nível superior periodicamente; o GLM não é exceção.
Destilação, legalidade e ética
- Longo debate sobre alegações de que laboratórios chineses (incluindo pares da Z.ai) redirecionaram ilegalmente tráfego por meio de um provedor de modelos dos EUA para destilação em escala massiva.
- Discordância sobre a legalidade: alguns chamam isso de fraude clara e ataque cibernético; outros dizem que violações dos Termos de Serviço não são necessariamente ilegais ou veem isso como “roubar de ladrões” diante de supostas violações de direitos autorais por laboratórios ocidentais.
- Ceticismo sobre quanto essa destilação realmente pode extrair de conversas limitadas; outros observam que a escala dos ataques sugere que os laboratórios acreditam que isso funciona.
Desempenho, infraestrutura e otimizações
- Alguns usuários dizem que o serviço da Z.ai parece “dog slow” apesar das alegações de otimização no blog; outros atribuem isso a trade-offs deliberados de throughput e economia de energia.
- Discussão sobre altas taxas de acerto de cache (90–97%) para cargas de trabalho agentic, tornando os limites de tokens mais generosos do que os números brutos sugerem.
- Interesse técnico na versão completa MoE de 744B do GLM-5.3 rodando localmente por meio de streaming de experts a partir de SSDs, embora a uma taxa de tokens/s muito baixa.
- Vários observam que laboratórios dos EUA também estão otimizando agressivamente a inferência e até construindo chips personalizados; isso não é exclusivo da China.
Controles de exportação, protecionismo e impacto de longo prazo
- Debate sobre se os banimentos de exportação ajudam os laboratórios dos EUA (mais acesso à Nvidia) e prejudicam os laboratórios chineses, ou se, em vez disso, criam um espaço protegido para fornecedores chineses de chips alcançarem o nível necessário.
- Alguns preveem que a futura concorrência de GPUs chinesas baratas vai corroer as margens da Nvidia; outros enfatizam os gargalos restantes de litografia/EUV da China.
- Reflexões mais amplas sobre política industrial, guerras comerciais e a inevitabilidade de grandes economias emergentes alcançarem o nível tecnológico com o tempo.