Ask HN: ¿Qué modelo predeterminado usas y por qué?
Los usuarios avanzados de IA se están inclinando hacia distintos modelos de lenguaje “predeterminados” según un equilibrio entre coste, velocidad y capacidad, más que por las puntuaciones brutas en benchmarks. Muchos prefieren modelos baratos y rápidos como DeepSeek Flash, GLM 5.3, Gemini Flash o Luna para la programación diaria y la automatización, reservando modelos frontier más caros como Opus, Fable, Sol o Astra para la planificación y revisión complejas, o descartándolos por completo debido a su verbosidad y a los altos costes en tokens. Un tema recurrente es combinar flujos de trabajo con varios modelos (y a veces configuraciones locales de pesos abiertos) para equilibrar privacidad, fiabilidad y presupuesto, y algunos sostienen que hoy el diseño cuidadoso del harness y de las pruebas importa más que perseguir el “modelo más inteligente” único.
Elección de modelos y casos de uso
- Gran diversidad; no hay un único ganador “predeterminado”.
- “Caballos de batalla” comunes: DeepSeek v4.1 Flash, GLM‑5.3‑Flash, GPT 5.6 Luna/Terra, Gemini 3.x Flash, Composer, Muse Spark.
- Los modelos frontier (Opus, Fable, Astra, Sol, Grok) se reservan sobre todo para planificación, errores difíciles o revisar bases de código grandes.
- Algunos usan modelos baratos/rápidos para la programación diaria y los logs, y solo cambian a Opus/Fable/Sol/Astra cuando se quedan atascados.
- Unos pocos evitan por completo los LLM.
Coste, uso de tokens y frustración con los precios
- Muchos optimizan por precio/rendimiento; los presupuestos personales pequeños favorecen DeepSeek, GLM, Luna, Qwen, Gemma, modelos locales.
- Las experiencias con los límites de tokens varían muchísimo: algunos no consiguen agotar planes grandes tipo “20x”, otros los consumen en un día con fábricas multiagente y devops continuo.
- Varios consideran que las ofertas de Anthropic de gama alta están enormemente sobrevaloradas para tareas de desarrollo comunes; otros pagan encantados por la comodidad y por proveedores con sede en EE. UU.
Velocidad, capacidad y verbosidad
- La rapidez de respuesta se valora muchísimo; DeepSeek, GLM, Gemini Flash se describen como “rapidísimos” y “suficientemente buenos” para la mayoría del trabajo web/móvil o SWE.
- Hay un rechazo importante hacia el estilo de escritura de Claude/Opus más recientes: demasiado verboso, recargado, cauteloso y difícil de leer; se prefieren las versiones antiguas de Opus.
- GPT Sol/Luna, Astra y algunos pesos abiertos son elogiados por ofrecer resultados más concisos y directos.
- Algunos informan que los modelos frontier aprueban pruebas pero aun así generan deuda técnica oculta; el diseño del harness y de las pruebas se considera crítico.
Patrones de flujo de trabajo y orquestación
- Patrón habitual: modelo barato como agente principal + modelo más inteligente como planificador/revisor/asesor.
- El uso de orquestadores, subagentes y “fábricas de software” está creciendo, pero puede disparar el uso de tokens.
- Varios prefieren el modo “centauro” con control humano estricto en lugar de agentes totalmente autónomos.
Local frente a alojado, confianza y ética
- Algunos pasan a Qwen/Gemma/GLM/DeepSeek locales por privacidad, manejo de credenciales y para evitar una vigilancia percibida o problemas de políticas.
- A otros se les prohíben los modelos chinos en el trabajo, aunque los usan personalmente.
- Debate sobre el impacto ambiental y el alineamiento geopolítico de los laboratorios de IA de EE. UU. frente a los chinos; no hay consenso.
Sentimiento general
- El hilo pone de relieve una fragmentación extrema: muchos modelos predeterminados viables, preferencias personales fuertes y la sensación de que la elección del modelo suele importar menos que el flujo de trabajo, la orientación y la disciplina de costes.