DeepSeek v4.1 Flash

El nuevo modelo V4.1 Flash de DeepSeek es un enorme LLM multimodal de pesos abiertos que combina un backbone disperso de 552B parámetros con 196B de memoria “Engram”, usando un novedoso diseño causal encoder–decoder para reducir drásticamente el tamaño de la caché KV y ofrecer un rendimiento muy alto a precios de API relativamente bajos. Los comentaristas destacan que, aunque el modelo es demasiado grande para configuraciones locales típicas sin hardware extremo o cuantización agresiva, su eficiencia, controles de razonamiento y sólidos benchmarks lo sitúan cerca de sistemas frontera como GPT-6 Astra y Claude Opus para muchas cargas de trabajo de programación, seguridad y agentes. El lanzamiento también intensifica debates más amplios sobre laboratorios chinos frente a los de EE. UU., modelos abiertos frente a cerrados, retención de datos de prompts y si el trabajo de seguridad y “bienestar” es una mitigación real del riesgo o en gran parte marketing y posicionamiento regulatorio.

Arquitectura del modelo y características

  • V4.1 Flash es un rediseño importante, no una pequeña versión puntual.
  • Usa un transformador Causal Encoder–Decoder (CED): ~20 capas de codificador causal + 20 capas de decodificador.
  • Solo se activan ~8B de parámetros por token durante el prefill y 16B durante la decodificación, a pesar de:
    • 552B de parámetros del “backbone” (principalmente ~FP4, ~306GB)
    • 196B de memoria FP8 “Engram” / similar a PLE (~204GB), tratada más como un almacén clave–valor y almacenable en SSD.
  • La caché KV está fuertemente comprimida: 890–900 bytes por token (1GB para contexto de 1M), alrededor de 1/4 de la de V4 Flash anterior.
  • Soporta multimodalidad (visión) y esfuerzo de razonamiento controlable (1–100), mapeado a unos pocos niveles internos (low/high/max).

Rendimiento y benchmarks

  • Muchos comentaristas dicen que es extremadamente rápido en forma de API: a menudo 250–400+ tokens/s, aunque algunos ven velocidades menores mediante ciertos proveedores de OpenRouter.
  • Benchmarks: se informa que está cerca o por encima de los anteriores modelos cerrados “frontier” en varias tareas de programación, agentes y seguridad, pero:
    • Gana algunos benchmarks y pierde otros frente a GPT-5.6 Sol, Opus 5, Kimi K3, GLM 5.3.
    • Varias personas advierten contra el “benchmaxxing” frente a la utilidad en el mundo real.
  • Uso práctico temprano: fuerte para programación, análisis de seguridad y triage automatizado de bugs; algunos lo sitúan ligeramente por debajo de los modelos cerrados de gama alta en el “sentimiento” general, pero muy por encima de la mayoría de los modelos de pesos abiertos.

Hardware y despliegue local

  • Los pesos completos son de ~510–550GB más la caché KV; se considera que el uso local rápido práctico requiere ~384GB+ de RAM o varias GPUs de gama alta.
  • Los sistemas de 256GB solo pueden ejecutarlo con cuantización intensa y/o descarga a SSD, lo que ralentiza significativamente el prefill.
  • La sparsity y el offloading de Engram deberían hacer plausible el streaming desde SSD para cargas de trabajo lentas y sin supervisión.

Precios y eficiencia

  • El precio oficial enfatiza aciertos de caché muy baratos (tan bajos como $0.003–0.006 por 1M de tokens fuera de hora punta), lo que hace que las cargas de trabajo agénticas de largo horizonte sean mucho más baratas que modelos cerrados comparables.
  • En relación con el V4 Flash y el V4 Pro anteriores, el precio es algo confuso entre proveedores; el precio directo de DeepSeek para tokens de entrada bajó frente a los picos recientes de V4 Flash, la salida es aproximadamente similar y la caché es mucho más barata.
  • Varios usuarios informan ejecuciones de varios miles de millones de tokens por unas pocas decenas de dólares.

Seguridad, apertura y política

  • Hay un fuerte entusiasmo por los pesos abiertos y los informes técnicos detallados, en contraste con el mayor enfoque de los laboratorios de EE. UU. en la seguridad/la documentación de “bienestar del modelo” y los pesos cerrados.
  • Debate sobre seguridad frente a “seguridad de marca” y captura regulatoria; algunos quieren menos guardrails para seguridad/pentesting, mientras otros argumentan que el alignment está infravalorado.
  • DeepSeek, por algunas vías, entrena con los prompts de los usuarios, lo que algunos ven como aceptable para programación, mientras que otros lo evitan para trabajo sensible o propietario.

Experiencia de desarrollador y herramientas

  • DeepSeek Harness es elogiado como un potente entorno de programación agéntica; algunos lo prefieren frente a harnesses de terceros.
  • V4.1 Flash reemplazará a V4 Pro en el routing; algunos ya lo promocionan como su principal “caballo de batalla” para fábricas de software.
  • Molestias menores: respuestas en chino en la UI oficial para algunos usuarios; comportamiento ocasional de rechazo que aparece en solicitudes “parecidas a piratería”.