DeepSeek V4 Pro 0813
El nuevo modelo V4 Pro 0813 de DeepSeek se compara tanto con su propia variante V4 Flash como con modelos “frontier” de EE. UU. como Claude Opus, Fable y Sol/Luna de OpenAI: los benchmarks lo sitúan justo por debajo de los sistemas de élite, pero a una fracción mínima de su coste por tarea, especialmente cuando se usa el caché agresivo de prompts de DeepSeek. Muchos ingenieros informan que Flash sigue ofreciendo la mejor relación precio-rendimiento para el coding del día a día, mientras que Pro puede merecer la pena para planificación, auditoría y tareas de razonamiento más difíciles, aunque los resultados varían mucho según el harness de agente y el flujo de trabajo elegidos. Los comentaristas también sopesan las compensaciones entre privacidad, la adopción de modelos chinos en empresas occidentales y el cambio anunciado por DeepSeek a precios más altos de hora punta / valle, que aun así podría seguir dejándolo mucho más barato que sus competidores occidentales.
Posicionamiento general frente a otros modelos
- Los benchmarks muestran DeepSeek V4 Pro 0813 cerca de la clase Fable 5 / Opus 5 y por encima de GLM 5.2, con Flash muy cerca detrás.
- Los usuarios lo comparan con Qwen3.8-max, Kimi-K3, GPT-5.6 (Luna/Sol), Grok 4.6, MiMo, GLM 5.2: el consenso general es “cerca de la frontera”, pero no claramente el mejor de su clase.
- Algunos informan que Pro es más débil que Luna o Kimi en sus tareas; otros dicen que supera a Luna una vez que se incluyen la caché y el costo.
Precios, caché y suscripciones
- Los precios brutos por token son muy bajos; con muchas lecturas de caché, algunos afirman que es entre 10 y 60 veces más barato por tarea que Opus, y más barato que Luna para entornos de prueba de coding.
- DeepSeek está introduciendo precios de hora punta / valle y advirtiendo de aumentos futuros “significativos”; sigue habiendo confusión sobre el calendario y las nuevas tarifas exactas.
- Debate: compradores de tokens de API frente a suscripciones de ChatGPT/Claude fuertemente subvencionadas. Muchos señalan que las suscripciones pueden, en la práctica, rebajar todos los precios por token.
Pro vs Flash y coding en el mundo real
- Benchmarks: Pro ~5 puntos por encima de Flash en tareas de coding/agentes, pero muchos consideran que Flash es “suficientemente bueno” y mucho más barato.
- Algunos flujos de trabajo: “Pro planifica, Flash implementa” o al revés; otros usan modelos de frontera (Sol/Fable/Opus) para planificar/revisar y DeepSeek para implementar.
- Varios señalan que Pro se siente más lento y no siempre compensa frente a Flash; otros dicen que Pro es más fiable por tarea y menos verboso.
- Existe un fuerte consenso en que el harness/la herramienta importa mucho: los resultados difieren drásticamente entre Pi, OpenCode, Codex, etc.
Calidad, alucinaciones y dominios
- Informes mixtos: algunos llaman a Pro “poco fiable” en pass@1 pero fuerte en pass@3; otros dicen que iguala o supera a Sol/Fable en sus bucles de agentes multi-shot.
- Se reporta que las métricas de alucinación de ArtificialAnalysis son malas para los modelos de DeepSeek; algunos usuarios confirman más alucinaciones en texto no relacionado con coding o en prosa multilingüe.
- Para revisión de seguridad, ajuste de rendimiento, investigación/evaluación y bucles agentic, varios usuarios están impresionados por la capacidad de Pro por dólar.
Privacidad, política y alojamiento
- Preocupaciones sobre la retención de datos de DeepSeek y el entrenamiento con prompts; algunos se niegan a hacer benchmarks hasta que exista un proveedor con retención cero.
- Otros descartan esas preocupaciones, o incluso prefieren datos fuera de la jurisdicción de EE. UU.
- Las empresas pueden evitar modelos de origen chino por riesgo regulatorio/político, incluso si están alojados en EE. UU./UE o se ejecutan localmente.
Ecosistema y despliegue
- Los weights de Pro 0813 aún no están ampliamente disponibles; Flash ya puede ejecutarse localmente y es elogiado como “demasiado barato para medirlo”.
- Los usuarios discuten alternativas a OpenRouter (otros routers, uso directo de la API) para mejor caché, controles de privacidad o tarifas más bajas.