DeepSeek lanza v4.1 flash, más barato y más capaz que v4 pro

DeepSeek está lanzando su modelo de lenguaje grande V4.1 Flash, que según los primeros usuarios es más rápido, más barato y a menudo más capaz que el V4 Pro existente, especialmente para tareas de programación y automatización tipo agente. La empresa también está reduciendo los precios por token y enrutando temporalmente todas las llamadas API de V4 Pro a V4.1 Flash a tarifas de Flash, una medida que algunos elogian por su conveniencia y otros critican por el riesgo que supone para cargas de producción que dependen de un comportamiento estable del modelo. Los comentaristas destacan el gran valor frente a los proveedores occidentales, señalan problemas como la mezcla de idiomas y trazas de “razonamiento” demasiado largas, y subrayan que los pesos abiertos y el autoalojamiento mitigan en parte las preocupaciones sobre privacidad de datos y cambios de modelo.

Capacidades y posicionamiento del modelo

  • V4.1 Flash se anuncia como más barato y más capaz que el actual V4 Pro; algunos ven este patrón de “Flash supera a Pro” como la nueva normalidad.
  • Los primeros evaluadores informan que es comparable o बेहतर que GLM 5.3 Flash y cercano a los modelos de frontera para muchas tareas de programación/agentes, aunque no necesariamente de primer nivel en razonamiento puro.
  • Existe soporte de visión en un modelo API de vista previa, y ya se está usando para refactorizar kernels, portar código y otras tareas pesadas de programación.

Precios y economía

  • El precio oficial (fuera de horas punta) para Flash está bajando en caché aciertos, caché fallos y tokens de salida; surgió cierta confusión al comparar distintos proveedores y precios antiguos.
  • Las horas punta cuestan 2× las horas fuera de punta, pero esto ya era así; los usuarios señalan que sigue siendo extremadamente barato frente a los laboratorios de EE. UU., lo que hace viables nuevos casos de automatización.
  • Varios sostienen que el cambio clave no es “Flash reemplaza a Pro”, sino “Flash hace que muchas tareas pequeñas y repetitivas merezcan automatizarse”.

Rendimiento, herramientas y despliegue local

  • Las pruebas de la vista previa informan 300–400 tok/s, a veces más rápido que las herramientas a las que llama.
  • Los pesos abiertos y las cuantizaciones GGUF permiten ejecutar localmente modelos grandes de Flash/visión en 128 GB de RAM mediante llama.cpp, dwarfstar y otros runtimes.
  • Flash se usa ampliamente como “worker” junto con planificadores más capaces (por ejemplo, Opus, Sol, GLM Max), especialmente para implementación de código.

Fiabilidad, razonamiento y ergonomía

  • Las experiencias divergen: algunos encuentran V4 Flash extremadamente fiable para programación y agentes; otros ven bucles infinitos, alucinaciones, llamadas de herramientas inválidas y cadenas patológicas de “pero espera”, especialmente a través de proveedores de terceros o con cuantización pesada.
  • La robustez en las llamadas a herramientas varía; se destaca que el diseño del harness (reintentos, esquemas tolerantes, salidas estructuradas) es crítico.
  • Se critican los niveles de razonamiento (bajo/alto/máximo): bajo ≈ apagado, alto ≈ máximo, lo que causa ejecuciones lentas, verbosas y costosas; la gente quiere un verdadero “medio”.

Comportamiento lingüístico y problemas de la interfaz web

  • El chat web a menudo responde o “piensa” en chino incluso cuando se le pide en inglés, especialmente después de búsquedas web; añadir “en inglés” solo ayuda parcialmente.
  • El uso de la API aparentemente no muestra este problema tan a menudo; se especula con prompts de sistema en chino y resultados de búsqueda que superan las instrucciones de idioma.

Uso en producción, estabilidad del modelo y cambios de enrutamiento

  • DeepSeek enrutará temporalmente todas las solicitudes Pro a V4.1 Flash a precios de Flash.
    • Los partidarios lo llaman fácil de usar y eficiente en cómputo.
    • Los críticos temen romper flujos de trabajo ajustados y quieren modelos explícitos fijados por versión u opciones de “Auto” frente a “modelo exacto”.
  • Debate más amplio:
    • Una postura: los LLM en la nube son inherentemente no deterministas, por lo que fijar modelos exactos es irrealista; los usuarios serios deberían autoalojar.
    • La otra: incluso con no determinismo, los modelos tienen “sabores” característicos, y los cambios no anunciados socavan evaluaciones, revisiones de seguridad y monitorización.

Privacidad, jurisdicción y uso de datos

  • Algunos siguen desconfiando de los proveedores chinos; otros señalan que EE. UU./Meta/OpenAI también vigilan o reutilizan datos, así que la jurisdicción quizá no cambie el riesgo de forma significativa.
  • Los pesos abiertos permiten evitar servidores chinos, aunque las políticas de “retención cero de datos” se miran con escepticismo en toda la industria.
  • Un comentarista señala que la API oficial de DeepSeek entrena con datos de usuario, lo que hace atractivos el autoalojamiento o los proxies no chinos para cargas sensibles.