Qwen 3.8 27B es excelente, pero por defecto tiende a pensar en exceso

Qwen 3.8 27B, un modelo de lenguaje local abierto de gama alta, está siendo elogiado por un razonamiento cercano al de los modelos frontera, pero criticado por “pensar en exceso” por defecto, consumiendo enormes cantidades de tokens internos de “thinking” y funcionando 5–10x más lento que alternativas para muchas tareas. Los usuarios lo comparan con modelos más escuetos como Muse Glimmer y Gemma 4, debaten la compensación entre tamaño del modelo y cómputo en tiempo de prueba, y señalan que la eficiencia en tokens impacta directamente tanto la latencia como el costo operativo para agentes. Muchos reportan buenos resultados al bajar o desactivar el razonamiento, añadir presupuestos de pensamiento o LoRAs, o cambiar de plantillas; esto destaca tanto lo potentes que se han vuelto los modelos locales actuales como cuánto depende su utilidad de las decisiones de harness y configuración.

Calidad del modelo frente a pensar en exceso

  • Qwen 3.8 27B es ampliamente elogiado como un gran salto frente a 3.6 y extraordinariamente potente para un modelo local denso, y algunos usuarios lo sitúan en sus pruebas cerca de modelos frontera recientes en razonamiento y programación.
  • Principal queja: el modo de razonamiento predeterminado “xhigh” produce enormes trazas de pensamiento (a menudo 10–30k+ tokens), lo que lo hace 5–10x más lento y muy ineficiente en tokens para trabajo interactivo.
  • Pensar en exceso suele aparecer como profundizar en callejones sin salida, análisis excesivo de casos límite y soluciones sobredimensionadas (p. ej., SVG/HTML ornamentados para indicaciones simples).

Modos de razonamiento, plantillas y mitigaciones

  • Los usuarios reportan grandes mejoras al:
    • Desactivar el razonamiento o usar “low”/“medium” en lugar de “xhigh”.
    • Imponer presupuestos estrictos de razonamiento en llama.cpp (--thinking-budget, --thinking-message) o proxies personalizados que cortan el pensamiento después de N tokens y le indican al modelo que continúe.
  • Algunos harnesses/plantillas usan xhigh por defecto; otras plantillas comunitarias “fixed” establecen “medium” y exponen un menú desplegable para ajustar el esfuerzo de razonamiento.
  • LoRAs como “ThinkingCap” se están probando para reducir los tokens de pensamiento en ~40–50% manteniendo la calidad, con resultados iniciales mixtos pero prometedores.

Comparaciones con otros modelos

  • Muse Glimmer 30B: “pensamientos” mucho más escuetos, menor uso de tokens, más rápido en la práctica pese a ser más lento en tok/s brutos; algunos lo ven menos capaz que Qwen 3.6/3.8.
  • Gemma 4 12B se cita como un modelo pequeño destacado (rápido, multimodal, eficiente en tokens), aunque supuestamente perjudicado por plantillas y configuraciones mal ajustadas en algunas cadenas de herramientas.
  • Varios usuarios señalan que muchos modelos abiertos y propietarios actuales “piensan en exceso” debido a incentivos de entrenamiento y a la optimización para benchmarks.

Hardware, rendimiento y local frente a la nube

  • Qwen 3.8 27B funciona en GPUs de consumo de gama alta y Apple Silicon, pero la velocidad y el tamaño de contexto están fuertemente limitados por el ancho de banda de memoria y la VRAM.
  • Los usuarios comparten cifras reales: ~20–50 tok/s en GPUs decentes o Macs M-series con contexto moderado; contextos largos y razonamiento intenso pueden reducir la generación a ~1 tok/s.
  • Para algunos, la electricidad más el hardware hacen que los modelos en la nube (p. ej., Luna/Terra/Sol, GPT-5.x) sean más baratos y rápidos; otros prefieren lo local por privacidad, flujos de trabajo agenticos y tareas de larga duración.

Visiones más amplias sobre “pensar”

  • A muchos les gusta el razonamiento visible para depuración, seguridad y planificación más profunda; otros lo encuentran cognitivamente agotador y prefieren un pensamiento oculto o mínimo.
  • Hay debate sobre si los tokens de chain-of-thought reflejan un razonamiento interno real o un sustrato de “murmullos”, y sobre si los modelos futuros deberían moverse más hacia el razonamiento en el espacio latente.