DeepSeek lanza v4.1 flash, más barato y más capaz que v4 pro
DeepSeek está lanzando su modelo de lenguaje grande V4.1 Flash, que según los primeros usuarios es más rápido, más barato y a menudo más capaz que el V4 Pro existente, especialmente para tareas de programación y automatización tipo agente. La empresa también está reduciendo los precios por token y enrutando temporalmente todas las llamadas API de V4 Pro a V4.1 Flash a tarifas de Flash, una medida que algunos elogian por su conveniencia y otros critican por el riesgo que supone para cargas de producción que dependen de un comportamiento estable del modelo. Los comentaristas destacan el gran valor frente a los proveedores occidentales, señalan problemas como la mezcla de idiomas y trazas de “razonamiento” demasiado largas, y subrayan que los pesos abiertos y el autoalojamiento mitigan en parte las preocupaciones sobre privacidad de datos y cambios de modelo.
Capacidades y posicionamiento del modelo
- V4.1 Flash se anuncia como más barato y más capaz que el actual V4 Pro; algunos ven este patrón de “Flash supera a Pro” como la nueva normalidad.
- Los primeros evaluadores informan que es comparable o बेहतर que GLM 5.3 Flash y cercano a los modelos de frontera para muchas tareas de programación/agentes, aunque no necesariamente de primer nivel en razonamiento puro.
- Existe soporte de visión en un modelo API de vista previa, y ya se está usando para refactorizar kernels, portar código y otras tareas pesadas de programación.
Precios y economía
- El precio oficial (fuera de horas punta) para Flash está bajando en caché aciertos, caché fallos y tokens de salida; surgió cierta confusión al comparar distintos proveedores y precios antiguos.
- Las horas punta cuestan 2× las horas fuera de punta, pero esto ya era así; los usuarios señalan que sigue siendo extremadamente barato frente a los laboratorios de EE. UU., lo que hace viables nuevos casos de automatización.
- Varios sostienen que el cambio clave no es “Flash reemplaza a Pro”, sino “Flash hace que muchas tareas pequeñas y repetitivas merezcan automatizarse”.
Rendimiento, herramientas y despliegue local
- Las pruebas de la vista previa informan 300–400 tok/s, a veces más rápido que las herramientas a las que llama.
- Los pesos abiertos y las cuantizaciones GGUF permiten ejecutar localmente modelos grandes de Flash/visión en 128 GB de RAM mediante llama.cpp, dwarfstar y otros runtimes.
- Flash se usa ampliamente como “worker” junto con planificadores más capaces (por ejemplo, Opus, Sol, GLM Max), especialmente para implementación de código.
Fiabilidad, razonamiento y ergonomía
- Las experiencias divergen: algunos encuentran V4 Flash extremadamente fiable para programación y agentes; otros ven bucles infinitos, alucinaciones, llamadas de herramientas inválidas y cadenas patológicas de “pero espera”, especialmente a través de proveedores de terceros o con cuantización pesada.
- La robustez en las llamadas a herramientas varía; se destaca que el diseño del harness (reintentos, esquemas tolerantes, salidas estructuradas) es crítico.
- Se critican los niveles de razonamiento (bajo/alto/máximo): bajo ≈ apagado, alto ≈ máximo, lo que causa ejecuciones lentas, verbosas y costosas; la gente quiere un verdadero “medio”.
Comportamiento lingüístico y problemas de la interfaz web
- El chat web a menudo responde o “piensa” en chino incluso cuando se le pide en inglés, especialmente después de búsquedas web; añadir “en inglés” solo ayuda parcialmente.
- El uso de la API aparentemente no muestra este problema tan a menudo; se especula con prompts de sistema en chino y resultados de búsqueda que superan las instrucciones de idioma.
Uso en producción, estabilidad del modelo y cambios de enrutamiento
- DeepSeek enrutará temporalmente todas las solicitudes Pro a V4.1 Flash a precios de Flash.
- Los partidarios lo llaman fácil de usar y eficiente en cómputo.
- Los críticos temen romper flujos de trabajo ajustados y quieren modelos explícitos fijados por versión u opciones de “Auto” frente a “modelo exacto”.
- Debate más amplio:
- Una postura: los LLM en la nube son inherentemente no deterministas, por lo que fijar modelos exactos es irrealista; los usuarios serios deberían autoalojar.
- La otra: incluso con no determinismo, los modelos tienen “sabores” característicos, y los cambios no anunciados socavan evaluaciones, revisiones de seguridad y monitorización.
Privacidad, jurisdicción y uso de datos
- Algunos siguen desconfiando de los proveedores chinos; otros señalan que EE. UU./Meta/OpenAI también vigilan o reutilizan datos, así que la jurisdicción quizá no cambie el riesgo de forma significativa.
- Los pesos abiertos permiten evitar servidores chinos, aunque las políticas de “retención cero de datos” se miran con escepticismo en toda la industria.
- Un comentarista señala que la API oficial de DeepSeek entrena con datos de usuario, lo que hace atractivos el autoalojamiento o los proxies no chinos para cargas sensibles.