GLM-5.3 (open-weight) derrotou modelos da Anthropic/OpenAI – por 1/5 do custo
Afirmações de que o modelo chinês GLM‑5.3 supera os principais sistemas da OpenAI e da Anthropic por uma fração do custo levaram a um exame mais atento de como LLMs são avaliados e comparados. Os comentaristas questionam a validade dos testes citados (tarefas pequenas, saturadas, muitas vezes triviais, textos escritos por IA) e observam que recusas por segurança, harnesses de prompt e compras/conformidade corporativas frequentemente importam mais do que pontuações brutas. Alguns usuários relatam desempenho impressionante do GLM‑5.3 no mundo real, especialmente em tarefas como engenharia reversa, mas muitos argumentam que modelos abertos ou chineses ainda ficam atrás dos modelos de ponta dos EUA em capacidade geral e são complicados por riscos geopolíticos e de licenciamento.
Credibilidade e metodologia do benchmark
- Muitos veem o benchmark como saturado: ~10 modelos com pontuação >95% sugere que as tarefas são fáceis demais ou pouco discriminatórias.
- As avaliações de código são criticadas como triviais (poucas tarefas simples em Python; 28 tarefas no total), então as diferenças entre modelos talvez não sejam significativas.
- Vários apontam inconsistências com outros rankings (por exemplo, ArtificialAnalysis, LMSys Arena), e resultados como o Haiku pontuar muito alto ou GPT 5.5 > 5.6 são vistos como sinais de alerta.
- Alguns observam que a baixa pontuação do Fable se deve em grande parte a recusas, e não à capacidade bruta; outros argumentam que contar recusas como falhas é justo para uma avaliação “do mundo real”.
- No geral, muitos comentaristas consideram o benchmark e o texto como “slop” e não uma base séria para escolher modelo.
Capacidades e custo do GLM-5.3
- Vários usuários relatam o GLM-5.3 (e modelos Kimi relacionados) como fortes desempenhos, especialmente para engenharia reversa, uso de ferramentas, planejamento e código em harnesses.
- Alguns dizem que ele pode substituir modelos fechados de ponta para suas cargas de trabalho pessoais/de desenvolvimento a um custo muito menor; outros o consideram mais lento, excessivamente engenheirado ou não claramente melhor que o GLM-5.1.
- É citada uma avaliação separada em que o GLM-5.3 fica em torno do #6 e não é Pareto-ótimo em preço/desempenho em comparação com Grok e Sol.
Pesos abertos, segurança e recusas
- Os pesos do GLM-5.3 ainda não foram lançados; o atraso é atribuído a reduções de segurança, o que preocupa alguns por poder diminuir a capacidade, embora outros digam que isso pode ser ajustado depois via fine-tuning.
- Há ampla frustração com os filtros de segurança e recusas dos modelos dos EUA, especialmente para tarefas de segurança, engenharia reversa e codificação “autônoma”.
Considerações empresariais e geopolíticas
- Vários argumentam que empresas continuarão pagando por modelos das big techs dos EUA por causa de integrações, compras e conformidade, independentemente de pequenas diferenças de qualidade.
- Outros destacam riscos de cadeia de suprimentos e políticos em ambas as direções: o governo dos EUA pode restringir modelos americanos e poderia igualmente mirar modelos chineses, afetando contratadas.
- Organizações fora dos EUA podem perceber maior risco com provedores americanos.
Confiança, conteúdo escrito por IA e preocupações com propaganda
- Muitos acreditam que o artigo e o site são fortemente ou totalmente gerados por IA e mal editados; isso mina fortemente a confiança nos resultados.
- Alguns chamam isso de “AI slop” e temem que conteúdo gerado por IA inunde o HN.
- Poucos mencionam possível astroturfing ou propaganda para promover modelos chineses, embora isso não seja sustentado além do tom e dos resultados.