Análisis de inteligencia, rendimiento y precio de DeepSeek V4 Flash 0731
El nuevo modelo V4 Flash 0731 de DeepSeek está llamando la atención por ofrecer inteligencia cercana a la frontera a una fracción del coste de rivales como Luna de OpenAI y Gemini de Google, especialmente cuando se evalúa en “coste por tarea” y no por conteo bruto de tokens. Los comentaristas destacan sus fortalezas para programación y cargas de trabajo agenticas, el atractivo de los pesos abiertos para el despliegue local y cómo la política agresiva de precios de los laboratorios chinos podría presionar a actores de EE. UU. como Anthropic y OpenAI. Las preocupaciones se centran en compromisos como la verbosidad, la falta de soporte multimodal, la censura y las prácticas de privacidad de datos, así como el riesgo de regulación futura o de rechazo geopolítico contra los modelos abiertos baratos.
Precio, rendimiento y benchmarks
- DeepSeek V4 Flash 0731 obtiene una puntuación muy alta en el “índice de inteligencia” de Artificial Analysis, en territorio de GLM 5.2 / Gemini 3.6 Flash, con un coste por tarea extremadamente bajo.
- Comparaciones con OpenAI Luna: algunos leen las gráficas como si Luna fuera ~2–3× más cara por tarea pero 2–5× más rápida en inferencia; otros enfatizan que la pura baratura y calidad de Flash lo hacen mucho más rentable para muchos usuarios.
- Algunos sostienen que “tokens por tarea” es una métrica obsoleta y que el coste por tarea es lo que importa; otros replican que un mayor uso de tokens perjudica directamente la velocidad y sigue siendo una medida importante de eficiencia.
- Hay críticas de que las gráficas de benchmarks no especifican los parámetros de muestreo, lo que puede afectar significativamente el rendimiento, la verbosidad y la “inteligencia por token”.
Uso práctico, fortalezas y debilidades
- Varios usuarios informan de un excelente rendimiento en programación y de una gran rentabilidad, usando a menudo Flash como principal caballo de batalla y reservando modelos frontier más caros solo para casos límite complicados.
- Otros lo encuentran más débil dentro de “harnesses” agenticos más complejos en comparación con GLM o Kimi, o señalan que no rebate las tonterías con suficiente firmeza y puede alucinar o olvidar contexto.
- Se elogia Flash por permitir niveles gratuitos o de bajo coste en apps, desde herramientas de programación hasta aplicaciones de estudio bíblico / recuperación de escrituras, aunque hay debate sobre la interpretación teológica y la dependencia de los LLM.
Alojamiento local, herramientas y caché
- Los pesos están disponibles en Hugging Face; GGUF cuantizados y motores como vllm‑moe, Unsloth y otros permiten ejecutarlo en escritorios con mucha RAM, RTX Pro 6000 y sistemas DGX Spark con decenas de tokens/s.
- La gente comparte cifras reales de TPS y señala compromisos entre velocidad, ruido/calor y contextos muy largos (cientos de miles de tokens).
- El comportamiento de la caché varía mucho según el harness; las configuraciones minimalistas pueden ver tasas de acierto de caché de ~99% y un coste ultrabajo, mientras que agentes más complejos o prompts del sistema a mitad de flujo pueden “romper” las cachés y aumentar el coste.
Privacidad, entrenamiento y condiciones
- Una preocupación recurrente: el servicio oficial de DeepSeek no permite optar por no usar los datos para entrenamiento, lo cual es un bloqueo para código propietario. Algunos quieren un nivel de pago “sin entrenamiento”, aunque sea solo una garantía blanda.
- Otros restan importancia a la sensibilidad de su código y enfatizan que el valor real está en el diseño/integración.
Censura, geopolítica e impacto en el mercado
- Algunos temen la censura política china (por ejemplo, preguntas sobre Tiananmen); otros argumentan que los modelos occidentales también censuran mucho, aunque sobre temas distintos.
- Los pesos abiertos se ven como una válvula de escape: los usuarios pueden, en principio, “des-censurar” los modelos localmente.
- Varios participantes predicen que los modelos chinos de pesos abiertos y baratos erosionarán los márgenes de los laboratorios frontier de EE. UU. (especialmente Anthropic y OpenAI), podrían desencadenar restricciones estadounidenses o chinas sobre modelos abiertos y acelerar una “guerra de precios” global de la IA.