Evaluando las cuantizaciones de Qwen3.8 27B: 4 bits se mantiene, 1 bit colapsa

Los resultados de benchmark para el modelo de pesos abiertos Qwen3.8 27B sugieren que la cuantización a 4 bits puede igualar de cerca la calidad de precisión completa (bf16), mientras que 1 bit y muchas variantes de 2 bits en la práctica colapsan y se vuelven inutilizables. Los comentarios se centran en lo que esto significa para ejecutar modelos locales potentes en GPUs de consumo (8–24 GB), equilibrando nivel de cuantización, longitud de contexto y velocidad, y debatiendo si 3 bits o los esquemas dinámicos son el “punto dulce” práctico. Junto con consejos de implementación y anécdotas de rendimiento, varios participantes cuestionan cómo se interpretan los benchmarks y los intervalos de confianza, y piden una mejor evaluación de la cuantización de la KV cache y de cargas de trabajo reales, agentivas, en lugar de solo texto al estilo Wikipedia.

Resultados de cuantización y lagunas

  • El hilo se centra en benchmarks que muestran que Qwen3.8-27B a 4 bits está cerca de la calidad bf16, mientras que 1 bit en gran medida colapsa.
  • Varias personas critican que las cuantizaciones de 3 bits no se hayan evaluado en mayor profundidad, ya que son cruciales para GPUs de consumo de 16 GB y contextos largos.
  • Algunos informan que, para ciertos problemas difíciles de programación, las diferencias entre Q4/Q5/Q6 son muy notables, lo que contradice la idea de que “no se ve diferencia por encima de 4 bits”.

Rendimiento en el mundo real y configuraciones

  • Varios usuarios comparten configuraciones que funcionan en GPUs de clase 16 GB (p. ej., 5060 Ti, 9070 XT, 5090, 3090), con cuantizaciones Q3/Q4, flash attention, cuantización de la KV cache y descarga del proyector de visión para estirar la VRAM.
  • Velocidades reportadas: aproximadamente 30–50 tok/s en GPUs de gama media y cientos altos a miles en prefill; más de 200 tok/s en una 5090 con NVFP4.
  • Usuarios de Apple silicon encuentran Qwen3.8-27B utilizable pero mucho más lento que en la nube, incluso con runtimes optimizados (p. ej., MTPLX).

3 bits, 1 bit y cuantización de la KV cache

  • Se destacan como prometedores esquemas dinámicos de 3 bits (Unsloth, GSQ-RCO, “Flash-GGUF”) por su equilibrio entre velocidad y calidad.
  • La cuantización post-entrenamiento a 1 bit es ampliamente vista como inviable; algunos dicen que solo tiene sentido si se entrenó así (QAT) con enormes cantidades de datos.
  • Cuantización de la KV cache: varios reportes indican que Qwen3.8-27B tolera KV hasta q4 (e incluso NVFP4) con poca degradación, permitiendo más de 200k de contexto en GPUs de gama alta.

Modo “thinking”, tokens y fiabilidad

  • Una teoría: las cuantizaciones de menor bit principalmente cambian la distribución de tokens; Qwen compensa “pensando” durante más tiempo, terminando con un éxito similar en las tareas pero con más tokens/tiempo.
  • Otros consideran que el modo thinking a veces perjudica el rendimiento (p. ej., quedarse atascado en largas trazas de razonamiento o no terminar nunca) y señalan que niveles más altos de “thinking” pueden exceder el contexto.

Compromisos entre local y nube

  • Algunos sostienen que Qwen3.8-27B local (4 bits/3 bits) ya es realmente útil, y a veces rivaliza o supera a ciertos modelos propietarios en benchmarks y detección de bugs.
  • Otros dicen que los modelos de frontera en la nube siguen siendo claramente superiores para programación compleja y matizada, y que el uso local está limitado por el coste del hardware y la latencia.

Metodología de evaluación y estadísticas

  • Hay un debate sustancial sobre intervalos de confianza: críticas al uso de CIs de Wilson para implicar estabilidad entre ejecuciones; argumentos sobre interpretaciones frecuentistas frente a bayesianas.
  • Se sugiere que los intervalos de predicción, las ejecuciones repetidas y los box plots capturarían mejor la variabilidad.
  • Se señala que la divergencia KL es sensible a la elección del conjunto de datos; usar Wikipedia puede subestimar el impacto de la cuantización en tareas agentivas/de programación. Algunos proponen calcular KL sobre trazas generadas por el modelo de precisión completa, o simplemente apoyarse más en benchmarks de extremo a extremo.

Calidad de escritura y contenido autoría por LLM

  • Discusión sobre cómo juzgar artículos posiblemente escritos con ayuda de LLM: el consenso se inclina por evaluar claridad, concisión y precisión, no el uso de herramientas.
  • Varios comentan que la prosa generada por LLM se siente “suave pero vacía” y es más difícil de recordar, posiblemente por un estilo de baja entropía y una transmisión tipo chat.

Seguridad operativa

  • Correr modelos localmente en bare metal se considera seguro; el riesgo proviene del “harness” circundante que ejecuta la salida del modelo.
  • Recomendación: si preocupa, aísla el harness (p. ej., contenedor/VM) en lugar de los pesos del modelo en bruto.