Cómo GLM construyó su propia infraestructura de inferencia

El laboratorio chino Z.ai ha construido una pila de inferencia a gran escala para sus modelos GLM-5.3 sobre más de 100.000 aceleradores de IA fabricados en el país, lo que ha provocado debate sobre el impacto estratégico de que China logre una infraestructura competitiva y no basada en NVIDIA. Los comentaristas evalúan los logros técnicos y la agresiva optimización de software frente a las quejas de los usuarios sobre precios, velocidad y límites de tokens, y contrastan la postura de open weights de GLM con modelos cerrados de EE. UU. como Claude. El hilo también profundiza en acusaciones de destilación a gran escala a partir de los modelos de Anthropic, en la eficacia de los controles de exportación de chips de EE. UU. y en si este cambio erosionará con el tiempo el dominio occidental en hardware y modelos de IA.

Aceleradores de IA chinos e implicaciones geopolíticas

  • Muchos ven ejecutar GLM-5.3(-Flash) en >100k aceleradores chinos como un gran cambio estratégico: China ahora tiene sus propios chips más inferencia a gran escala.
  • La idea de que “la mayoría de los usuarios no necesitan modelos de frontera”: modelos potentes, baratos y ligeramente por detrás, junto con chips domésticos, podrían ser un “evento de asteroide” para los laboratorios occidentales.
  • Debate sobre si la electricidad en China es más barata; un comentarista cita datos que afirman que la energía industrial en realidad es más cara que en EE. UU.
  • Algunos sostienen que los controles de exportación de EE. UU. tuvieron el efecto contrario al buscado, obligando/acelerando el desarrollo doméstico de chips chinos y las innovaciones en eficiencia; otros dicen que China siempre iba a hacer esto.

Precios, planes de tokens y valor

  • Varios usuarios dicen que los planes iniciales de codificación de Z.ai estaban “subvencionados de forma ridícula” y luego se repricaron bruscamente, y ahora parecen demasiado caros o demasiado limitados en tokens.
  • Otros siguen viendo buen valor gracias al caché y a los altos permisos de tokens, especialmente en los planes Max, pero señalan que hay que paralelizar mucho y/o usar Flash para alcanzar las cuotas.
  • Confusión sobre cuántos tokens ofrecen realmente los niveles de suscripción; algunos los comparan desfavorablemente con Claude, mientras que otros argumentan que el valor por dólar es similar cuando se mapea correctamente.

Calidad del modelo, patrones de uso y agentes

  • GLM-5.3 es elogiado con frecuencia como de primera línea entre los open weights, con buen razonamiento y alucinaciones relativamente bajas, aunque puede “perder el hilo” sin supervisión.
  • Los usuarios con un uso intensivo de tokens describen configuraciones multiagente (p. ej., generación de código, búsqueda de bugs, canalizaciones de búsqueda/optimización) que consumen miles de millones de tokens al mes.
  • Consenso en que todos los modelos actuales necesitan supervisión humana o de un modelo de nivel superior de forma periódica; GLM no es la excepción.

Destilación, legalidad y ética

  • Largo debate sobre las acusaciones de que laboratorios chinos (incluidos pares de Z.ai) desviaron tráfico ilegalmente a través de un proveedor de modelos de EE. UU. para una destilación a gran escala.
  • Desacuerdo sobre la legalidad: algunos lo califican de fraude claro y ciberataque; otros dicen que las violaciones de los Términos de Servicio no son necesariamente ilegales o lo ven como “robar a ladrones” dada la supuesta infracción de copyright por parte de laboratorios occidentales.
  • Escepticismo sobre cuánto puede extraer realmente una destilación así de conversaciones limitadas; otros señalan que la escala de los ataques sugiere que los laboratorios creen que funciona.

Rendimiento, infraestructura y optimizaciones

  • Algunos usuarios dicen que el servicio de Z.ai se siente “dog slow” pese a las afirmaciones de optimización del blog; otros lo atribuyen a compromisos deliberados de rendimiento y ahorro de energía.
  • Discusión sobre altas tasas de acierto de caché (90–97%) para cargas de trabajo agenticas, lo que hace que los límites de tokens sean más generosos de lo que sugieren las cifras brutas.
  • Interés técnico en la versión completa MoE de 744B de GLM-5.3 ejecutándose localmente mediante el streaming de expertos desde SSD, aunque a una velocidad de tokens/s muy baja.
  • Varios señalan que los laboratorios de EE. UU. también están optimizando agresivamente la inferencia e incluso construyendo chips personalizados; esto no es exclusivo de China.

Controles de exportación, proteccionismo e impacto a largo plazo

  • Debate sobre si las prohibiciones de exportación ayudan a los laboratorios de EE. UU. (más acceso a Nvidia) y perjudican a los laboratorios chinos, o si en cambio crean un espacio protegido para que los proveedores chinos de chips alcancen a los demás.
  • Algunos predicen que la futura competencia de GPUs chinas baratas erosionará los márgenes de Nvidia; otros destacan los cuellos de botella restantes de China en litografía/EUV.
  • Reflexiones más amplias sobre política industrial, guerras comerciales y la inevitabilidad de que las grandes economías emergentes alcancen el nivel tecnológico.