DeepSeek V4 Flash 0731
El nuevo modelo de pesos abiertos DeepSeek V4 Flash 0731 está llamando la atención por ofrecer un rendimiento de programación y razonamiento cercano al de los modelos frontier a una fracción del costo de los modelos de laboratorios estadounidenses como GPT‑5.6, en gran parte gracias a una caché KV agresiva y una arquitectura eficiente. Los comentaristas dicen usarlo a diario para desarrollo de software, agentes y automatización de infraestructura, a menudo consumiendo cientos de millones de tokens por solo unos pocos dólares, aunque señalan concesiones en fiabilidad, tareas de largo horizonte y uso de herramientas frente a modelos de gama alta como Fable u Opus. Existe preocupación porque DeepSeek ha advertido de un aumento de precio “significativo”, pero muchos señalan que los pesos abiertos y proveedores competidores deberían mantener bajos los precios globales y hacer ampliamente accesible este nivel de capacidad.
Rendimiento y capacidades del modelo
- Muchos consideran que DeepSeek V4 Flash 0731 es “suficientemente bueno para casi todo”, especialmente para programación, depuración, análisis de documentos y tareas de infra/devops.
- A menudo se compara con GPT‑5.6 Luna / Sol y modelos frontier anteriores (Opus 4.x, Gemini, etc.): algunos dicen que se acerca a Luna o incluso lo supera en muchas tareas, mientras que otros afirman que es claramente más débil y más lento en programación real compleja (p. ej., gráficos, Rust, manejo de casos límite).
- Varios informan que se siente aproximadamente en el nivel de Opus 4.5–4.8, por debajo de Fable‑5 / el Opus‑5 actual, pero muy por encima de la mayoría de los pesos abiertos de gama media.
- La nueva versión 0731 es ampliamente vista como un salto notable respecto a la previa Flash anterior.
Costo, precios y caché
- El principal atractivo es un costo por tarea extremadamente bajo; muchos describen su uso como “demasiado barato para medirlo”, consumiendo cientos de millones de tokens por menos de $10.
- El precio de lectura de caché es un orden de magnitud más barato que el de otros proveedores; en flujos de trabajo agénticos/de programación con tasas de acierto de caché del 90–99%, esto domina los costos.
- DeepSeek ha anunciado un futuro aumento de precio “significativo”; la magnitud exacta no está clara. Algunos esperan que incluso un aumento de 2–4× seguiría siendo barato; otros temen un movimiento de 10× hacia niveles de mercado.
- Comparaciones con suscripciones de OpenAI/Anthropic: para uso agéntico intensivo, DeepSeek con precios de API puede ser drásticamente más barato; para usuarios ocasionales, las suscripciones a modelos frontier aún pueden ofrecer una buena relación calidad-precio.
Uso en el mundo real y harnesses
- Es popular en herramientas como Oh My Pi, omp.sh, Prime Agent, Codex, Cline, OpenCode Go y configuraciones personalizadas con pares de agentes implementador/asesor.
- Se usa para corrección de pruebas en CI, monitoreo de logs/seguridad, refactors de código, trabajo de Kubernetes/infra, flujos de SEO y analítica, y agentes de varias horas de duración.
- Muchos enfatizan que la calidad del harness (herramientas, caché, detección de bucles, disciplina en los prompts) afecta mucho la capacidad percibida y el costo.
Limitaciones, regresiones y escepticismo sobre benchmarks
- Hay reportes de bucles infinitos de razonamiento, autocharla, distracción y llamadas a herramientas lentas o inestables, especialmente en algunos proveedores o harnesses.
- Algunos usuarios lo encuentran materialmente peor que Luna/Sol/Fable en programación más difícil, de varios pasos, y en tareas de largo horizonte; otros informan casi paridad.
- Preocupa que benchmarks como ARC‑AGI‑2 exageren la utilidad en el mundo real, o que los modelos estén afinados para benchmarks; los resultados de ARC‑AGI‑3 aún están pendientes.
- Quejas sobre una mayor verbosidad y respuestas más pesadas en tokens después de 0731; esto puede mitigarse con un prompting fuerte.
Pesos abiertos, proveedores y autoalojamiento
- El modelo tiene pesos abiertos; varios proveedores en OpenRouter y otros sitios lo alojan, a menudo con precios base similares pero lecturas de caché mucho más caras que las de DeepSeek.
- Varias personas lo ejecutan localmente en GPUs de alta gama (RTX 6000 Blackwell, MI300X, DGX, Strix Halo) o incluso en máquinas CPU con mucha RAM, citando buen rendimiento y haciéndolo atractivo para datos clasificados/en las instalaciones.
Implicaciones más amplias
- Se debate si los modelos chinos de pesos abiertos, baratos y “suficientemente buenos” amenazan el negocio de los laboratorios estadounidenses, especialmente en empresas fuera de EE. UU.
- Algunos sostienen que la fiabilidad extra de los modelos frontier en agentes autónomos de largo horizonte justifica su precio mucho más alto; otros creen que la mayor parte del trabajo real migrará a modelos abiertos baratos más una buena orquestación.