DeepSeek V4 Flash 0731
O novo modelo de pesos abertos DeepSeek V4 Flash 0731 está chamando atenção por oferecer desempenho de codificação e raciocínio próximo ao nível de modelos de fronteira, a uma fração do custo de modelos de laboratórios dos EUA como o GPT‑5.6, em grande parte graças ao cache KV agressivo e a uma arquitetura eficiente. Comentários relatam usá-lo como modelo principal para desenvolvimento de software, agentes e automação de infraestrutura — muitas vezes consumindo centenas de milhões de tokens por apenas alguns dólares —, ao mesmo tempo em que apontam trade-offs em confiabilidade, tarefas de longo horizonte e uso de ferramentas em comparação com modelos de ponta como Fable ou Opus. Há preocupação de que a DeepSeek tenha sinalizado um aumento de preço “significativo”, mas muitos observam que os pesos abertos e provedores concorrentes devem manter os preços gerais baixos e tornar amplamente acessível esse nível de capacidade.
Desempenho e capacidades do modelo
- Muitos consideram o DeepSeek V4 Flash 0731 “bom o suficiente para quase tudo”, especialmente codificação, depuração, análise de documentos e tarefas de infra/devops.
- Frequentemente comparado ao GPT‑5.6 Luna / Sol e a modelos de fronteira anteriores (Opus 4.x, Gemini, etc.): alguns dizem que ele está próximo de ou melhor que Luna em muitas tarefas, outros dizem que é claramente mais fraco e mais lento em codificação complexa do mundo real (por exemplo, gráficos, Rust, tratamento de casos extremos).
- Vários relatam que ele parece estar aproximadamente na faixa do Opus 4.5–4.8, abaixo do Fable‑5 / Opus‑5 atual, mas muito acima da maioria dos pesos abertos de nível intermediário.
- A nova versão 0731 é amplamente vista como um salto notável em relação ao preview Flash anterior.
Custo, preços e cache
- O principal atrativo é o custo extremamente baixo por tarefa; muitos descrevem o uso como “barato demais para medir”, consumindo centenas de milhões de tokens por menos de US$10.
- O preço de leitura de cache é uma ordem de magnitude mais barato do que o de outros provedores; em fluxos de trabalho agentic/codificação com taxas de acerto de cache de 90–99%, isso domina os custos.
- A DeepSeek anunciou um futuro aumento de preço “significativo”; a magnitude exata não está clara. Alguns esperam que até 2–4× ainda seria barato; outros temem uma mudança de 10× para níveis de mercado.
- Comparações com assinaturas da OpenAI/Anthropic: para uso agentic intenso, a DeepSeek com preço de API pode sair dramaticamente mais barata; para usuários casuais, assinaturas de modelos de fronteira ainda podem ter ótimo custo-benefício.
Uso no mundo real e harnesses
- Popular em ferramentas como Oh My Pi, omp.sh, Prime Agent, Codex, Cline, OpenCode Go e configurações personalizadas com pares de agentes implementador/consultor.
- Usado para correção de testes em CI, monitoramento de logs/segurança, refatorações de código, trabalho com Kubernetes/infra, fluxos de SEO e analytics e agentes de longa duração por várias horas.
- Muitos enfatizam que a qualidade do harness (ferramentas, cache, detecção de loops, disciplina de prompt) afeta fortemente a capacidade percebida e o custo.
Limitações, regressões e ceticismo em relação a benchmarks
- Relatos de loops infinitos de raciocínio, auto conversa, distração e chamada de ferramentas lenta ou instável, especialmente em alguns provedores ou harnesses.
- Alguns usuários acham que ele é materialmente pior do que Luna/Sol/Fable em codificação difícil, multietapas e tarefas de longo horizonte; outros relatam quase paridade.
- Preocupações de que benchmarks como ARC‑AGI‑2 superestimam a utilidade no mundo real, ou que os modelos são ajustados para benchmarks; os resultados do ARC‑AGI‑3 ainda estão pendentes.
- Reclamações sobre maior verbosidade e respostas mais pesadas em tokens após 0731; isso pode ser atenuado com prompts fortes.
Pesos abertos, provedores e self-hosting
- O modelo tem pesos abertos; vários provedores na OpenRouter e em outros lugares o hospedam, muitas vezes com preços base semelhantes, mas leituras de cache muito mais caras do que as da própria DeepSeek.
- Vários o executam localmente em GPUs de alto desempenho (RTX 6000 Blackwell, MI300X, DGX, Strix Halo) ou até em máquinas CPU com muita RAM, citando bom throughput e tornando-o atraente para dados classificados/on-prem.
Implicações mais amplas
- Discussão sobre se modelos chineses de pesos abertos e “bons o suficiente”, baratos, ameaçam os negócios dos laboratórios dos EUA, especialmente em empresas fora dos EUA.
- Alguns argumentam que a confiabilidade extra dos modelos de fronteira em agentes autônomos de longo horizonte justifica seu preço muito mais alto; outros acham que a maior parte do trabalho real migrará para modelos abertos baratos com boa orquestração.