Cómo GLM construyó su propia infraestructura de inferencia
El laboratorio chino Z.ai ha construido una pila de inferencia a gran escala para sus modelos GLM-5.3 sobre más de 100.000 aceleradores de IA fabricados en el país, lo que ha provocado debate sobre el impacto estratégico de que China logre una infraestructura competitiva y no basada en NVIDIA. Los comentaristas evalúan los logros técnicos y la agresiva optimización de software frente a las quejas de los usuarios sobre precios, velocidad y límites de tokens, y contrastan la postura de open weights de GLM con modelos cerrados de EE. UU. como Claude. El hilo también profundiza en acusaciones de destilación a gran escala a partir de los modelos de Anthropic, en la eficacia de los controles de exportación de chips de EE. UU. y en si este cambio erosionará con el tiempo el dominio occidental en hardware y modelos de IA.
Aceleradores de IA chinos e implicaciones geopolíticas
- Muchos ven ejecutar GLM-5.3(-Flash) en >100k aceleradores chinos como un gran cambio estratégico: China ahora tiene sus propios chips más inferencia a gran escala.
- La idea de que “la mayoría de los usuarios no necesitan modelos de frontera”: modelos potentes, baratos y ligeramente por detrás, junto con chips domésticos, podrían ser un “evento de asteroide” para los laboratorios occidentales.
- Debate sobre si la electricidad en China es más barata; un comentarista cita datos que afirman que la energía industrial en realidad es más cara que en EE. UU.
- Algunos sostienen que los controles de exportación de EE. UU. tuvieron el efecto contrario al buscado, obligando/acelerando el desarrollo doméstico de chips chinos y las innovaciones en eficiencia; otros dicen que China siempre iba a hacer esto.
Precios, planes de tokens y valor
- Varios usuarios dicen que los planes iniciales de codificación de Z.ai estaban “subvencionados de forma ridícula” y luego se repricaron bruscamente, y ahora parecen demasiado caros o demasiado limitados en tokens.
- Otros siguen viendo buen valor gracias al caché y a los altos permisos de tokens, especialmente en los planes Max, pero señalan que hay que paralelizar mucho y/o usar Flash para alcanzar las cuotas.
- Confusión sobre cuántos tokens ofrecen realmente los niveles de suscripción; algunos los comparan desfavorablemente con Claude, mientras que otros argumentan que el valor por dólar es similar cuando se mapea correctamente.
Calidad del modelo, patrones de uso y agentes
- GLM-5.3 es elogiado con frecuencia como de primera línea entre los open weights, con buen razonamiento y alucinaciones relativamente bajas, aunque puede “perder el hilo” sin supervisión.
- Los usuarios con un uso intensivo de tokens describen configuraciones multiagente (p. ej., generación de código, búsqueda de bugs, canalizaciones de búsqueda/optimización) que consumen miles de millones de tokens al mes.
- Consenso en que todos los modelos actuales necesitan supervisión humana o de un modelo de nivel superior de forma periódica; GLM no es la excepción.
Destilación, legalidad y ética
- Largo debate sobre las acusaciones de que laboratorios chinos (incluidos pares de Z.ai) desviaron tráfico ilegalmente a través de un proveedor de modelos de EE. UU. para una destilación a gran escala.
- Desacuerdo sobre la legalidad: algunos lo califican de fraude claro y ciberataque; otros dicen que las violaciones de los Términos de Servicio no son necesariamente ilegales o lo ven como “robar a ladrones” dada la supuesta infracción de copyright por parte de laboratorios occidentales.
- Escepticismo sobre cuánto puede extraer realmente una destilación así de conversaciones limitadas; otros señalan que la escala de los ataques sugiere que los laboratorios creen que funciona.
Rendimiento, infraestructura y optimizaciones
- Algunos usuarios dicen que el servicio de Z.ai se siente “dog slow” pese a las afirmaciones de optimización del blog; otros lo atribuyen a compromisos deliberados de rendimiento y ahorro de energía.
- Discusión sobre altas tasas de acierto de caché (90–97%) para cargas de trabajo agenticas, lo que hace que los límites de tokens sean más generosos de lo que sugieren las cifras brutas.
- Interés técnico en la versión completa MoE de 744B de GLM-5.3 ejecutándose localmente mediante el streaming de expertos desde SSD, aunque a una velocidad de tokens/s muy baja.
- Varios señalan que los laboratorios de EE. UU. también están optimizando agresivamente la inferencia e incluso construyendo chips personalizados; esto no es exclusivo de China.
Controles de exportación, proteccionismo e impacto a largo plazo
- Debate sobre si las prohibiciones de exportación ayudan a los laboratorios de EE. UU. (más acceso a Nvidia) y perjudican a los laboratorios chinos, o si en cambio crean un espacio protegido para que los proveedores chinos de chips alcancen a los demás.
- Algunos predicen que la futura competencia de GPUs chinas baratas erosionará los márgenes de Nvidia; otros destacan los cuellos de botella restantes de China en litografía/EUV.
- Reflexiones más amplias sobre política industrial, guerras comerciales y la inevitabilidad de que las grandes economías emergentes alcancen el nivel tecnológico.