Actualización de DeepSeek-V4-Flash

DeepSeek ha lanzado una importante actualización de su modelo lingüístico V4-Flash, con grandes mejoras en benchmarks de codificación y uso de herramientas que lo sitúan en la misma liga que los principales modelos propietarios como las últimas variantes GPT-5.6 de OpenAI, todo ello manteniendo un coste por token drásticamente más bajo, especialmente cuando se aprovechan los aciertos de caché. Los comentaristas destacan que los pesos abiertos, los requisitos de hardware relativamente modestos y la fuerte relación precio-rendimiento lo hacen atractivo para inferencia local, agentes de programación y tareas de “trabajo mecánico” de alto volumen, aunque todavía queda por detrás de los mejores modelos en algunas capacidades de razonamiento y multimodales. Junto con el entusiasmo, persisten preocupaciones sobre benchmarks opacos, privacidad de datos y jurisdicción china, así como los riesgos operativos de actualizar silenciosamente un modelo detrás de un nombre de API estable.

Rendimiento del modelo y benchmarks

  • La actualización muestra grandes saltos frente al V4-Flash anterior en el harness interno: mejoras importantes en Terminal Bench y Toolathlon.
  • En comparación con GPT‑5.6 Terra/Luna: Flash ahora los supera en algunos benchmarks de codificación/terminal (Terminal Bench, Toolathlon, CyberGym), pero queda por detrás en otros (DeepSWE, Agents’ Last Exam). No hay un vencedor claro en general.
  • Algunos señalan los rankings oficiales (p. ej., Terminal-Bench, DeepSWE) como las puntuaciones “reales”; otros mencionan los números autoinformados de los laboratorios y posibles erratas.
  • Varios usuarios informan que Flash se siente cercano a modelos de frontera (Opus 4.7–5.x, Sonnet 5, Luna) en tareas de codificación a un coste mucho menor.

Precios, caché y coste por tarea

  • V4-Flash se describe repetidamente como “increíblemente barato”, especialmente con caché.
  • Estadísticas de uso compartidas: cientos de millones a ~2 mil millones de tokens por menos de $20 en un par de semanas, gracias a tasas de acierto de caché de ~99%.
  • La API directa de DeepSeek se percibe como más barata y mejor para caché que algunos agregadores; otros usan planes de terceros (p. ej., OpenCode Go) que revenden DeepSeek con garantías tipo ZDR, aunque cambios recientes en la redacción generan incertidumbre.
  • Las comparaciones con Luna destacan la lectura de caché de Flash a $0.0028/MTok frente a Luna a $0.02/MTok.

Inferencia local y hardware

  • Modelo: DeepSeek‑V4‑Flash‑284B‑A13B, ~160 GiB de pesos completos, descrito como “solo 160 GiB” para un modelo MoE de ~200–300B.
  • Funciona bien en 2× DGX Spark o 2× RTX 6000/6000 Pro; un solo B300 está al límite; 128 GB M5 Max puede ejecutar cuantizaciones fuertes, pero lentamente.
  • Se discuten cuantizaciones de 4 bits e incluso de 2–3 bits; proyectos de la comunidad (p. ej., ds4) se actualizan rápidamente.

Casos de uso y harnesses

  • Uso intensivo para programación: C#, Rust, C/C++, Go, Python, TS/JS, SQL, CSS/HTML; especialmente con harnesses de agentes como pi, OpenCode y otros sistemas de subagentes.
  • Los usuarios subrayan que “el harness importa más que el modelo” para la productividad: subagentes, herramientas MCP, caché, reductores de contexto y “skills” personalizadas para revisión de código.
  • También se usa para QA sobre transcripciones de voz, clasificación, extracción, reescritura e investigación profunda en la web mediante MCPs de búsqueda.
  • Algunos combinan un planificador “frontera” (Opus/Sol/Luna/K3) con V4-Flash como ejecutor barato.

Pesos abiertos, datos y gobernanza

  • Los pesos se publican en Hugging Face; muchos consideran que esto es clave para capacidades “usables para siempre” a largo plazo y una mejor protección de datos mediante autoalojamiento.
  • Preocupaciones por enviar código a APIs alojadas en China; las mitigaciones incluyen usar intermediarios tipo ZDR o despliegue local.
  • Debate sobre el futuro de los pesos abiertos chinos y una posible regulación en EE. UU.; los participantes citan lecturas contradictorias de discursos e intenciones políticas.

Versionado y escepticismo sobre la evaluación

  • Confusión sobre el nombre del modelo: el Flash antiguo y el nuevo aparecen como deepseek-v4-flash en DeepSeek; algunos proveedores añaden -0731.
  • Varios sostienen que debería haber sido “V4.1” para evitar cambios de comportamiento silenciosos en producción.
  • Algunos desconfían del marketing impulsado por benchmarks y sospechan de ajustes finos para los benchmarks; unos pocos dicen que en gran medida ignoran los benchmarks y se apoyan en el rendimiento en el mundo real.