GLM-5.3 (open-weight) superó a los modelos de Anthropic/OpenAI – por 1/5 del costo

Las afirmaciones de que el modelo chino GLM‑5.3 supera a los sistemas líderes de OpenAI y Anthropic por una fracción del costo han suscitado escrutinio sobre cómo se evalúan y comparan los LLM. Los comentaristas cuestionan la validez de las pruebas citadas (tareas pequeñas, saturadas, a menudo triviales, textos generados por IA) y señalan que los refusals por seguridad, los harnesses de prompt y la adquisición y el cumplimiento normativo empresariales suelen importar más que las puntuaciones brutas. Algunos usuarios informan un rendimiento real impresionante de GLM‑5.3, especialmente en tareas como ingeniería inversa, pero muchos argumentan que los modelos abiertos o chinos aún están por detrás de los modelos estadounidenses de frontera en capacidad general y que además están complicados por riesgos geopolíticos y de licencia.

Credibilidad y metodología del benchmark

  • Muchos ven el benchmark como saturado: ~10 modelos con puntuación >95% sugiere que las tareas son demasiado fáciles o no son discriminativas.
  • Las evaluaciones de programación son criticadas por ser triviales (pocas tareas sencillas de Python; 28 tareas en total), por lo que las diferencias entre modelos pueden no ser significativas.
  • Varios señalan inconsistencias con otros leaderboards (p. ej., ArtificialAnalysis, LMSys Arena), y resultados como Haiku puntuando muy alto o GPT 5.5 > 5.6 se ven como señales de alerta.
  • Algunos observan que la baja puntuación de Fable se debe en gran medida a refusals, no a la capacidad bruta; otros argumentan que contar los refusals como fallos es justo para una evaluación “del mundo real”.
  • En general, muchos comentaristas consideran que el benchmark y el artículo son “slop” y no una base seria para elegir un modelo.

Capacidades y costo de GLM-5.3

  • Varios usuarios reportan que GLM-5.3 (y modelos Kimi relacionados) rinde muy bien, especialmente para ingeniería inversa, uso de herramientas, planificación y programación en harnesses.
  • Algunos dicen que puede sustituir a modelos cerrados de gama alta para sus cargas de trabajo personales/de desarrollo a un costo significativamente menor; otros lo encuentran más lento, sobrediseñado o no claramente mejor que GLM-5.1.
  • Se cita una evaluación aparte en la que GLM-5.3 ocupa aproximadamente el puesto #6 y no es Pareto-óptimo en precio/rendimiento frente a Grok y Sol.

Pesos abiertos, seguridad y refusals

  • Los pesos de GLM-5.3 aún no se han publicado; el retraso se atribuye a recortes por seguridad, lo que a algunos les preocupa que reduzca la capacidad, aunque otros dicen que puede corregirse con fine-tuning.
  • Existe una frustración generalizada con los filtros de seguridad y refusals de los modelos de EE. UU., especialmente para seguridad, ingeniería inversa y tareas de programación “autónomas”.

Consideraciones empresariales y geopolíticas

  • Varios argumentan que las empresas seguirán pagando por los modelos de las grandes tecnológicas estadounidenses debido a integraciones, compras y cumplimiento normativo, independientemente de pequeñas diferencias de calidad.
  • Otros destacan riesgos de cadena de suministro y políticos en ambas direcciones: el gobierno de EE. UU. puede restringir modelos estadounidenses, y podría hacer lo mismo con modelos chinos, afectando a los contratistas.
  • Las organizaciones no estadounidenses pueden percibir mayor riesgo con proveedores de EE. UU.

Confianza, contenido generado por IA y preocupaciones de propaganda

  • Muchos creen que el artículo y el sitio están muy o totalmente generados por IA y mal editados; esto socava fuertemente la confianza en los resultados.
  • Algunos llaman a esto “AI slop” y temen que el contenido generado por IA inunde HN.
  • Unos pocos mencionan posible astroturfing o propaganda para promocionar modelos chinos, aunque esto no está sustentado más allá del tono y los resultados.