DeepSeek V4 Pro 0813
O novo modelo DeepSeek V4 Pro 0813 está sendo comparado tanto com a variante V4 Flash da própria empresa quanto com modelos “frontier” dos EUA, como Claude Opus, Fable e Sol/Luna da OpenAI: benchmarks o colocam logo abaixo dos sistemas de ponta, mas a uma fração minúscula do custo por tarefa, especialmente quando se usa o cache agressivo de prompts do DeepSeek. Muitos engenheiros relatam que o Flash ainda oferece a melhor relação custo-benefício para codificação do dia a dia, enquanto o Pro pode valer a pena para planejamento, auditoria e tarefas de raciocínio mais difíceis, embora os resultados variem muito conforme o harness de agente e o fluxo de trabalho escolhidos. Os comentários também ponderam trade-offs em torno de privacidade, adoção de modelos chineses em empresas ocidentais e a mudança anunciada pelo DeepSeek para preços mais altos em horários de pico/fora de pico, que ainda assim podem continuar muito abaixo dos concorrentes ocidentais.
Posicionamento geral em relação a outros modelos
- Benchmarks mostram o DeepSeek V4 Pro 0813 perto da classe Fable 5 / Opus 5 e acima do GLM 5.2, com o Flash logo atrás.
- Usuários o comparam a Qwen3.8-max, Kimi-K3, GPT-5.6 (Luna/Sol), Grok 4.6, MiMo, GLM 5.2: o consenso geral é “próximo da fronteira”, mas não claramente o melhor da categoria.
- Alguns relatam que o Pro é mais fraco que Luna ou Kimi nas suas tarefas; outros dizem que ele supera Luna quando cache e custo são incluídos.
Preço, cache e assinaturas
- Os preços brutos por token são muito baixos; com muitas leituras de cache, alguns afirmam que o custo por tarefa é 10–60x menor do que Opus, e mais barato que Luna para pipelines de código.
- O DeepSeek está introduzindo preços de pico/fora de pico e alertando para aumentos futuros “significativos”; ainda há confusão sobre o timing e as novas taxas exatas.
- Debate: compradores de tokens na API vs assinaturas de ChatGPT/Claude fortemente subsidiadas. Muitos observam que as assinaturas podem, na prática, superar qualquer precificação por token.
Pro vs Flash e codificação no mundo real
- Benchmarks: Pro ~5 pontos acima do Flash em tarefas de código/agente, mas muitos consideram o Flash “bom o suficiente” e muito mais barato.
- Alguns fluxos de trabalho: “Pro planeja, Flash implementa” ou o inverso; outros usam modelos de fronteira (Sol/Fable/Opus) para planejar/revisar e o DeepSeek para implementar.
- Vários observam que o Pro parece mais lento e nem sempre vale a pena em comparação com o Flash; outros dizem que o Pro é mais confiável por tarefa e menos verboso.
- Forte consenso de que o harness/ferramentas importam muito: os resultados diferem drasticamente entre Pi, OpenCode, Codex etc.
Qualidade, alucinações e domínios
- Relatos mistos: alguns chamam o Pro de “não confiável” em pass@1, mas forte em pass@3; outros dizem que ele iguala ou supera Sol/Fable em seus loops de agente com múltiplas tentativas.
- Métricas de alucinação da ArtificialAnalysis supostamente são ruins para modelos DeepSeek; alguns usuários confirmam mais alucinações em textos não voltados a código ou em prosa multilíngue.
- Para revisão de segurança, ajuste de desempenho, pesquisa/avaliação e loops agenticos, vários usuários ficam impressionados com a capacidade do Pro por dólar gasto.
Privacidade, política e hospedagem
- Há preocupações sobre retenção de dados do DeepSeek e treinamento em prompts; alguns se recusam a fazer benchmarks até existir um provedor com retenção zero.
- Outros descartam essas preocupações, ou até preferem dados fora da jurisdição dos EUA.
- Empresas podem evitar modelos de origem chinesa por risco regulatório/político, mesmo que hospedados nos EUA/UE ou executados localmente.
Ecossistema e implantação
- Os weights do Pro 0813 ainda não estão amplamente disponíveis; o Flash já pode ser executado localmente e é elogiado como “barato demais para medir”.
- Usuários discutem alternativas ao OpenRouter (outros routers, uso direto da API) para melhor cache, controles de privacidade ou taxas mais baixas.