Evaluando las cuantizaciones de Qwen3.8 27B: 4 bits se mantiene, 1 bit colapsa
Los resultados de benchmark para el modelo de pesos abiertos Qwen3.8 27B sugieren que la cuantización a 4 bits puede igualar de cerca la calidad de precisión completa (bf16), mientras que 1 bit y muchas variantes de 2 bits en la práctica colapsan y se vuelven inutilizables. Los comentarios se centran en lo que esto significa para ejecutar modelos locales potentes en GPUs de consumo (8–24 GB), equilibrando nivel de cuantización, longitud de contexto y velocidad, y debatiendo si 3 bits o los esquemas dinámicos son el “punto dulce” práctico. Junto con consejos de implementación y anécdotas de rendimiento, varios participantes cuestionan cómo se interpretan los benchmarks y los intervalos de confianza, y piden una mejor evaluación de la cuantización de la KV cache y de cargas de trabajo reales, agentivas, en lugar de solo texto al estilo Wikipedia.
Resultados de cuantización y lagunas
- El hilo se centra en benchmarks que muestran que Qwen3.8-27B a 4 bits está cerca de la calidad bf16, mientras que 1 bit en gran medida colapsa.
- Varias personas critican que las cuantizaciones de 3 bits no se hayan evaluado en mayor profundidad, ya que son cruciales para GPUs de consumo de 16 GB y contextos largos.
- Algunos informan que, para ciertos problemas difíciles de programación, las diferencias entre Q4/Q5/Q6 son muy notables, lo que contradice la idea de que “no se ve diferencia por encima de 4 bits”.
Rendimiento en el mundo real y configuraciones
- Varios usuarios comparten configuraciones que funcionan en GPUs de clase 16 GB (p. ej., 5060 Ti, 9070 XT, 5090, 3090), con cuantizaciones Q3/Q4, flash attention, cuantización de la KV cache y descarga del proyector de visión para estirar la VRAM.
- Velocidades reportadas: aproximadamente 30–50 tok/s en GPUs de gama media y cientos altos a miles en prefill; más de 200 tok/s en una 5090 con NVFP4.
- Usuarios de Apple silicon encuentran Qwen3.8-27B utilizable pero mucho más lento que en la nube, incluso con runtimes optimizados (p. ej., MTPLX).
3 bits, 1 bit y cuantización de la KV cache
- Se destacan como prometedores esquemas dinámicos de 3 bits (Unsloth, GSQ-RCO, “Flash-GGUF”) por su equilibrio entre velocidad y calidad.
- La cuantización post-entrenamiento a 1 bit es ampliamente vista como inviable; algunos dicen que solo tiene sentido si se entrenó así (QAT) con enormes cantidades de datos.
- Cuantización de la KV cache: varios reportes indican que Qwen3.8-27B tolera KV hasta q4 (e incluso NVFP4) con poca degradación, permitiendo más de 200k de contexto en GPUs de gama alta.
Modo “thinking”, tokens y fiabilidad
- Una teoría: las cuantizaciones de menor bit principalmente cambian la distribución de tokens; Qwen compensa “pensando” durante más tiempo, terminando con un éxito similar en las tareas pero con más tokens/tiempo.
- Otros consideran que el modo thinking a veces perjudica el rendimiento (p. ej., quedarse atascado en largas trazas de razonamiento o no terminar nunca) y señalan que niveles más altos de “thinking” pueden exceder el contexto.
Compromisos entre local y nube
- Algunos sostienen que Qwen3.8-27B local (4 bits/3 bits) ya es realmente útil, y a veces rivaliza o supera a ciertos modelos propietarios en benchmarks y detección de bugs.
- Otros dicen que los modelos de frontera en la nube siguen siendo claramente superiores para programación compleja y matizada, y que el uso local está limitado por el coste del hardware y la latencia.
Metodología de evaluación y estadísticas
- Hay un debate sustancial sobre intervalos de confianza: críticas al uso de CIs de Wilson para implicar estabilidad entre ejecuciones; argumentos sobre interpretaciones frecuentistas frente a bayesianas.
- Se sugiere que los intervalos de predicción, las ejecuciones repetidas y los box plots capturarían mejor la variabilidad.
- Se señala que la divergencia KL es sensible a la elección del conjunto de datos; usar Wikipedia puede subestimar el impacto de la cuantización en tareas agentivas/de programación. Algunos proponen calcular KL sobre trazas generadas por el modelo de precisión completa, o simplemente apoyarse más en benchmarks de extremo a extremo.
Calidad de escritura y contenido autoría por LLM
- Discusión sobre cómo juzgar artículos posiblemente escritos con ayuda de LLM: el consenso se inclina por evaluar claridad, concisión y precisión, no el uso de herramientas.
- Varios comentan que la prosa generada por LLM se siente “suave pero vacía” y es más difícil de recordar, posiblemente por un estilo de baja entropía y una transmisión tipo chat.
Seguridad operativa
- Correr modelos localmente en bare metal se considera seguro; el riesgo proviene del “harness” circundante que ejecuta la salida del modelo.
- Recomendación: si preocupa, aísla el harness (p. ej., contenedor/VM) en lugar de los pesos del modelo en bruto.