Qwen3.8-2.4T
Se ha lanzado un nuevo modelo Qwen3.8 de 2.4 billones de parámetros como pesos abiertos, impresionando a muchos con resultados de benchmark cercanos a los mejores modelos propietarios y, al mismo tiempo, planteando preguntas prácticas sobre cómo ejecutar en el mundo real un sistema de ~5 TB. Los comentaristas debaten estrategias de cuantización, requisitos de hardware y si las variantes extremadamente grandes en 1 bit o FP8 valen la pena frente a modelos más pequeños pero mejor optimizados como DeepSeek V4 Flash, GLM 5.2 o el próximo Qwen3.8-27B. También preocupa que la variante abierta esté deliberadamente limitada —sin visión, con menor longitud de contexto y sin cuantización QAT—, lo que dificulta autohospedarlo más que a rivales como Kimi K3 pese a un rendimiento similar.
Lanzamiento general y posicionamiento
- Qwen3.8-2.4T es un modelo MoE de ~2.4T parámetros con ~5TB de pesos bf16 (≈2.5TB fp8), situado en torno a niveles de benchmark de Opus 4.8–Fable 5.
- Se lo presenta como rival de Kimi K3 (2.8T-A100B), pero es más difícil de servir en su lanzamiento debido a que solo dispone de bf16/fp8 y carece de pesos 4-bit preparados para QAT.
Escala, rendimiento y comparaciones
- Afirmaciones: una variante cuantizada a 1 bit (~397GB, 95B de MoE activo) rinde alrededor de “nivel Opus 4.5”, y algunos sostienen que los modelos muy grandes degradan menos bajo cuantización agresiva.
- Otros rechazan esto: las comparaciones de 1 bit con modelos en precisión completa se califican de engañosas; la divergencia KL se critica por ser un proxy inadecuado de la capacidad.
- Varios comentaristas dicen que DeepSeek v4 Flash y Kimi K3 ya alcanzan el territorio de Opus 4.5–4.6 con un tamaño y coste mucho menores.
- Para programación, algunos usuarios informan que GLM 5.2 supera tanto a Kimi K3 como a Qwen 3.8 a pesar de usar más tokens, lo que para ellos lo hace más económico.
Requisitos de hardware y cuantización
- Ejecutar bf16 completo (≈4.9TB) o fp8 se ve como algo solo para clústeres; las configuraciones de consumo deben recurrir a quants.
- Debate sobre la orientación para un presupuesto fijo de RAM: la vieja regla “modelo más grande a menos bits > modelo más pequeño a más bits” ahora se ve confusa por MoE, QAT, MTP/DFlash y la eficiencia de KV.
- Consenso aproximado:
- 4-bit suele ser la precisión mínima “segura” para modelos estándar.
- Por debajo de 4-bit suele ser malo salvo que el modelo haya sido entrenado explícitamente para ello (pocos modelos grandes lo están).
- Muchos usuarios se centran en el próximo Qwen3.8-27B para uso local (entra en GPUs de gama alta con quants Q4), y señalan una “zona muerta” en el rango de 120–300B para lanzamientos abiertos.
Características y limitaciones
- El modelo abierto de 2.4T carece de visión, tiene 250k de contexto y excluye algunas funciones de “thinking”/herramientas presentes en el Qwen3.8-Max propietario (1M de contexto, herramientas integradas, modo no-thinking).
- Algunos lo ven como un paso atrás respecto a los lanzamientos abiertos más completos de Qwen 3.5.
- El nuevo parámetro
reasoning_effort(low/medium/xhigh) pretende equilibrar velocidad y profundidad, pero los usuarios informan que la tendencia a entrar en bucles puede persistir incluso en low.
Ecosistema, herramientas y proveedores
- Unsloth ofrece quants tempranos y documentación detallada; muchos elogian su calidad y capacidad de respuesta, aunque algunos informan problemas con ciertos builds gguf.
- Llama.cpp y herramientas similares pueden cuantizar sin QAT, pero pueden sacrificar optimalidad; es probable que los proveedores prefieran fp8 o nvfp4 calibrado de alta calidad hasta que exista un buen Q4 QAT.
- Entre las opciones de serving mencionadas están la propia nube de Alibaba, OpenRouter, DigitalOcean, Fireworks e integraciones de OpenCode; Bedrock se percibe como cada vez más orientado a laboratorios privados estadounidenses.
Competencia china y contexto de políticas
- Varios comentaristas vinculan los lanzamientos abiertos de Qwen con la política industrial china que fomenta modelos abiertos y transferencia tecnológica, presentándolo a la vez como estrategia geopolítica y motor práctico de la apertura.
- Hay un sentimiento general de que los lanzamientos chinos de pesos abiertos están presionando a los laboratorios occidentales, impidiendo un futuro totalmente cerrado de “inteligencia tarifada”.
Trayectoria del hardware y modelos futuros
- Las estimaciones para hardware de menos de $10k capaz de ejecutar estos modelos sin cuantizar van desde ~5 años hasta ~2040, citándose el ancho de banda (HBM vs DDR) como una limitación clave, no solo la capacidad.
- Otros esperan que futuros modelos más pequeños (<400B) alcancen una inteligencia similar mucho antes de que el hardware de consumo pueda alojar cómodamente 2.4T bf16.