Qwen 3.8 27B

Qwen 3.8 27B, un nuevo modelo de 27 mil millones de parámetros de pesos abiertos del equipo Qwen de Alibaba, está siendo aclamado como un hito porque se acerca al rendimiento de Claude Opus 4.6 en benchmarks de programación y agentes, aunque sigue pudiendo ejecutarse en hardware de consumo de gama alta. Los comentaristas intercambian configuraciones concretas, opciones de cuantización y cifras de rendimiento para GPU y Apple Silicon, y lo comparan con modelos como Gemma 4, Muse Glimmer, DeepSeek V4 Flash y versiones anteriores de Qwen. Un tema recurrente es la brecha entre los resultados de benchmark y el “trabajo real”, especialmente en torno a trazas de razonamiento demasiado largas, límites de conocimiento del mundo y la calidad del harness, pero muchos ven este como el primer modelo local denso que puede sustituir de verdad a los modelos de nube de pago para una gran parte de las tareas de desarrollo diarias.

Capacidades del modelo y afirmaciones de benchmarks

  • Qwen 3.8 27B se presenta como un gran avance para los modelos locales, con puntuaciones en benchmarks supuestamente cercanas o superiores a Claude Opus 4.6/4.7 en tareas de programación y agentes (por ejemplo, DeepSWE, Terminal Bench, uso de ordenador).
  • Algunos ven esto como evidencia de que los modelos abiertos densos de ~30B están acercándose a la calidad frontier de la última generación para muchas tareas.
  • Otros sostienen que los benchmarks sobrestiman la capacidad (“benchmaxxing”), especialmente para horizontes largos, inferencia de intenciones y trabajo real matizado.

Calidad en el mundo real frente a SOTA

  • Varios usuarios dicen que Qwen 27B es “suficientemente bueno” o está cerca de Sonnet/Opus para programación, visión y tareas estructuradas.
  • Contraargumento: los modelos frontier siguen ganando al inferir la intención del usuario a partir de instrucciones escasas, en conocimiento profundo del mundo y en flujos de trabajo largos y complejos.
  • Muchos enfatizan que solo importan realmente las evaluaciones internas específicas de la tarea; los benchmarks públicos pueden ser engañosos.

Despliegue local, velocidad y hardware

  • Se ejecuta en GPU de consumo de gama alta (4090, 5090, Strix Halo, Macs con serie M) con una variación significativa: ~20–100+ tok/s según la cuantización, el contexto y el runtime (llama.cpp, vLLM, Ninfer, MLX).
  • Los pesos completos en FP8 / FP16 necesitan mucha VRAM; las cuantizaciones Unsloth GGUF y NVFP4 apuntan a dispositivos “para cualquier patata”; las cuantizaciones de 2–4 bits sacrifican calidad para encajar.
  • Los Mixture-of-Experts (por ejemplo, Qwen 3.6 35B A3B, AgentWorld, Gemma 4 26B-A3B, Muse Glimmer) son mucho más rápidos con una calidad percibida similar debido al bajo número de parámetros activos, y a menudo se prefieren en hardware limitado por ancho de banda.

Modo de pensamiento, sobrepensar y plantillas

  • 3.8 viene con el razonamiento activado y un esfuerzo “xhigh” por defecto, lo que impulsa mucho el rendimiento en benchmarks pero provoca trazas largas de “pensamiento”, alto uso de tokens y una percepción de sobrepensar.
  • Los usuarios informan de una mejor practicidad al: bajar el esfuerzo de razonamiento (“medium/low”), añadir presupuestos de pensamiento o usar plantillas de chat corregidas por la comunidad (especialmente para arreglar el uso de herramientas y los bucles).
  • Algunos ven el pensamiento largo como escalado en tiempo de prueba; otros lo consideran un problema del harness más que un fallo del modelo.

Casos de uso y flujos de trabajo

  • Buen rendimiento en programación (especialmente agentes de desarrollo local), generación de SVG / HTML, tareas de visión (OCR, descripción de imágenes), filtrado de spam de correo, posprocesado de dictado y pequeñas subtareas de agentes.
  • Los modelos más pequeños de Qwen/Gemma se usan a menudo como herramientas o subagentes junto con modelos en la nube como DeepSeek, Luna, Gemini, etc.
  • Para muchos, los modelos frontier en la nube siguen prefiriéndose por velocidad y corrección “a la primera”; Qwen local se usa cuando la privacidad, el control de costes o la capacidad offline son lo principal.

Abierto vs cerrado y economía

  • El hilo destaca la tensión entre modelos abiertos que mejoran rápidamente y APIs cerradas caras con un enorme gasto de capital.
  • Algunos piensan que los modelos abiertos de clase 27B erosionan el foso defensivo de los laboratorios frontier; otros argumentan que las empresas seguirán pagando por la mejor velocidad, fiabilidad, tooling y alojamiento.