Ask HN: ¿Qué modelo predeterminado usas y por qué?

Los usuarios avanzados de IA se están inclinando hacia distintos modelos de lenguaje “predeterminados” según un equilibrio entre coste, velocidad y capacidad, más que por las puntuaciones brutas en benchmarks. Muchos prefieren modelos baratos y rápidos como DeepSeek Flash, GLM 5.3, Gemini Flash o Luna para la programación diaria y la automatización, reservando modelos frontier más caros como Opus, Fable, Sol o Astra para la planificación y revisión complejas, o descartándolos por completo debido a su verbosidad y a los altos costes en tokens. Un tema recurrente es combinar flujos de trabajo con varios modelos (y a veces configuraciones locales de pesos abiertos) para equilibrar privacidad, fiabilidad y presupuesto, y algunos sostienen que hoy el diseño cuidadoso del harness y de las pruebas importa más que perseguir el “modelo más inteligente” único.

Elección de modelos y casos de uso

  • Gran diversidad; no hay un único ganador “predeterminado”.
  • “Caballos de batalla” comunes: DeepSeek v4.1 Flash, GLM‑5.3‑Flash, GPT 5.6 Luna/Terra, Gemini 3.x Flash, Composer, Muse Spark.
  • Los modelos frontier (Opus, Fable, Astra, Sol, Grok) se reservan sobre todo para planificación, errores difíciles o revisar bases de código grandes.
  • Algunos usan modelos baratos/rápidos para la programación diaria y los logs, y solo cambian a Opus/Fable/Sol/Astra cuando se quedan atascados.
  • Unos pocos evitan por completo los LLM.

Coste, uso de tokens y frustración con los precios

  • Muchos optimizan por precio/rendimiento; los presupuestos personales pequeños favorecen DeepSeek, GLM, Luna, Qwen, Gemma, modelos locales.
  • Las experiencias con los límites de tokens varían muchísimo: algunos no consiguen agotar planes grandes tipo “20x”, otros los consumen en un día con fábricas multiagente y devops continuo.
  • Varios consideran que las ofertas de Anthropic de gama alta están enormemente sobrevaloradas para tareas de desarrollo comunes; otros pagan encantados por la comodidad y por proveedores con sede en EE. UU.

Velocidad, capacidad y verbosidad

  • La rapidez de respuesta se valora muchísimo; DeepSeek, GLM, Gemini Flash se describen como “rapidísimos” y “suficientemente buenos” para la mayoría del trabajo web/móvil o SWE.
  • Hay un rechazo importante hacia el estilo de escritura de Claude/Opus más recientes: demasiado verboso, recargado, cauteloso y difícil de leer; se prefieren las versiones antiguas de Opus.
  • GPT Sol/Luna, Astra y algunos pesos abiertos son elogiados por ofrecer resultados más concisos y directos.
  • Algunos informan que los modelos frontier aprueban pruebas pero aun así generan deuda técnica oculta; el diseño del harness y de las pruebas se considera crítico.

Patrones de flujo de trabajo y orquestación

  • Patrón habitual: modelo barato como agente principal + modelo más inteligente como planificador/revisor/asesor.
  • El uso de orquestadores, subagentes y “fábricas de software” está creciendo, pero puede disparar el uso de tokens.
  • Varios prefieren el modo “centauro” con control humano estricto en lugar de agentes totalmente autónomos.

Local frente a alojado, confianza y ética

  • Algunos pasan a Qwen/Gemma/GLM/DeepSeek locales por privacidad, manejo de credenciales y para evitar una vigilancia percibida o problemas de políticas.
  • A otros se les prohíben los modelos chinos en el trabajo, aunque los usan personalmente.
  • Debate sobre el impacto ambiental y el alineamiento geopolítico de los laboratorios de IA de EE. UU. frente a los chinos; no hay consenso.

Sentimiento general

  • El hilo pone de relieve una fragmentación extrema: muchos modelos predeterminados viables, preferencias personales fuertes y la sensación de que la elección del modelo suele importar menos que el flujo de trabajo, la orientación y la disciplina de costes.