Z.ai confirma que Ox Alpha es un nuevo modelo de la serie GLM y que publicará sus pesos
Z.ai de China ha confirmado que su modelo Ox Alpha es una nueva variante de la serie GLM cuyos pesos se publicarán, posicionándolo como un competidor abierto frente a modelos como DeepSeek y sistemas propietarios de gama media de laboratorios occidentales. Los comentaristas informan de un rendimiento fuerte en tareas largas de programación y agentes en relación con su tamaño presumido, pero señalan comportamientos inestables como “doom loops”, benchmarks inconsistentes, inferencia lenta y una posible cuantización agresiva. El lanzamiento se ve como parte de un impulso estratégico más amplio de los laboratorios chinos para publicar modelos de alto rendimiento con pesos abiertos, intensificando la competencia y reduciendo costes para los desarrolladores que pueden alojarlos por su cuenta.
Identidad del modelo y publicación de pesos
- El hilo coincide en que Ox Alpha es un nuevo modelo de la serie GLM de Z.ai; según se informa, la empresa lo confirmó y dijo que los pesos se publicarían “esta noche” (GMT+8, pero la zona horaria causó confusión).
- Algunos lo vinculan específicamente con la línea GLM‑5.3/“flash”; siguen sin estar claros los detalles exactos de qué se publicará (variante completa frente a una variante más pequeña, términos de la licencia).
Tamaño del modelo y arquitectura
- Aún no hay conteo oficial de parámetros; las estimaciones de la comunidad van desde ~18B parámetros activos (si fuera como GLM‑5.3 flash) hasta 200–300B en total.
- Varios comentaristas destacan que la utilidad depende mucho del tamaño frente al rendimiento: si es pequeño y fuerte, es un gran avance; si está más cerca de modelos muy grandes, solo es “bueno pero no especial”.
Rendimiento y benchmarks
- La puntuación reportada en DeepSWE ronda el 63%; algunos dicen que es sólido pero queda por debajo de los modelos frontier de primer nivel.
- Los benchmarks públicos muestran resultados mixtos: rinde por debajo de algunos modelos GPT pequeños en LiveBench, pero otros sitios (no oficiales) afirman que está cerca del nivel de Fable; esos sitios y ejecuciones no oficiales son ampliamente vistos como poco fiables o con muestras demasiado pequeñas.
- Varios comentarios subrayan que la mayoría de los benchmarks de LLM se ejecutan con tan pocas tareas que no son estadísticamente significativos.
Informes de uso práctico
- Muchos usaron Ox Alpha durante varios días para tareas de programación y refactorización; el consenso es que la calidad del código y el trabajo a largo horizonte son fuertes, a menudo mejores que modelos “flash”/baratos comparables, pero por detrás de los niveles superiores de Claude/GPT.
- Es bueno reescribiendo, explicando, trabajando en interfaces y produciendo textos bien estructurados; varios lo describen como “divertido” o más legible que algunos modelos de Anthropic.
- Otros lo encontraron flojo, especialmente en pipelines bash complejos o tareas visuales.
Distillation y debates de entrenamiento
- Sigue el debate sobre si Ox Alpha está fuertemente destilado a partir de otros modelos propietarios; algunos creen que sí, otros quieren pruebas más sólidas.
- Una investigación vinculada muestra que la destilación de caja negra puede acercarse al rendimiento del profesor, pero no resuelve las preguntas sobre razonamiento o comportamiento a largo horizonte.
Despliegue, harnesses y “doom loops”
- Se reportaron problemas importantes de inferencia lenta, timeouts y “doom loops” (repetición de comandos o llamadas a herramientas).
- Algunos dicen que esto es común en los modelos GLM y empeora con una cuantización agresiva o harnesses de agentes débiles; otros informan sesiones largas estables en harnesses mejor diseñados.
Ecosistema, licencias y geopolítica
- Muchos ven la publicación de pesos abiertos como una respuesta competitiva a DeepSeek y parte de un impulso chino más amplio hacia modelos abiertos, posiblemente alentado por la política estatal.
- Hay debate sobre licencias restrictivas frente a licencias verdaderamente abiertas; a algunos les parecen bien las restricciones como necesidad comercial.
- Se observan una adopción creciente de modelos chinos en startups, alojamiento local barato mediante hardware no NVIDIA y una confusión de marca cada vez mayor (Qwen, Kimi, GLM, Ox, etc.), aunque varios niegan que exista una confusión real entre usuarios técnicos.
- Algunos señalan ciclos de hype y promoción coordinada alrededor de modelos chinos; otros ven los modelos como commodities y esperan que los usuarios sigan cambiando al que sea mejor y más barato.