Atualização do DeepSeek-V4-Flash

A DeepSeek lançou uma grande atualização para seu modelo de linguagem V4-Flash, relatando ganhos expressivos em benchmarks de programação e uso de ferramentas que o colocam no mesmo nível de modelos proprietários líderes como as variantes mais recentes do GPT-5.6 da OpenAI — ao mesmo tempo em que permanece dramaticamente mais barato por token, especialmente quando os acertos de cache são aproveitados. Comentadores destacam que os pesos abertos, os requisitos de hardware relativamente modestos e a forte relação preço-desempenho o tornam atraente para inferência local, agentes de programação e tarefas de alto volume e baixo glamour, mesmo que ainda fique atrás dos melhores modelos em algumas capacidades de raciocínio e multimodais. Junto com o entusiasmo, há preocupações sobre benchmarks opacos, privacidade de dados e jurisdição chinesa, além dos riscos operacionais de atualizar silenciosamente um modelo sob um nome de API estável.

Desempenho do modelo e benchmarks

  • A atualização mostra grandes saltos em relação ao V4-Flash anterior no harness interno: ganhos expressivos no Terminal Bench e no Toolathlon.
  • Em comparação com o GPT‑5.6 Terra/Luna: o Flash agora os supera em alguns benchmarks de código/terminal (Terminal Bench, Toolathlon, CyberGym), mas fica atrás em outros (DeepSWE, Agents’ Last Exam). Não há um vencedor geral claro.
  • Alguns apontam para os rankings oficiais (por exemplo, Terminal-Bench, DeepSWE) como os “resultados reais”; outros observam os números autorreportados dos laboratórios e possíveis erros de digitação.
  • Vários usuários relatam que o Flash parece próximo de modelos de fronteira (Opus 4.7–5.x, Sonnet 5, Luna) em tarefas de programação, com custo muito menor.

Preço, cache e custo por tarefa

  • O V4-Flash é repetidamente descrito como “insanamente barato”, especialmente com cache.
  • Estatísticas de uso compartilhadas: centenas de milhões a ~2 bilhões de tokens por menos de US$ 20 em algumas semanas, graças a taxas de acerto de cache de ~99%.
  • A API direta da DeepSeek é vista como mais barata e melhor para cache do que alguns agregadores; outros usam planos de terceiros (por exemplo, OpenCode Go) que revendem a DeepSeek com garantias tipo ZDR, embora mudanças recentes na redação tenham gerado incerteza.
  • Comparações com Luna destacam a leitura de cache do Flash a US$ 0,0028/MTok versus US$ 0,02/MTok do Luna.

Inferência local e hardware

  • Modelo: DeepSeek-V4-Flash-284B-A13B, ~160 GiB de pesos completos, descrito como “apenas 160 GiB” para um modelo MoE de ~200–300B.
  • Roda bem em 2× DGX Spark ou 2× RTX 6000/6000 Pro; um único B300 fica no limite; 128 GB M5 Max consegue rodar quantizações fortes, mas lentamente.
  • São discutidas quantizações de 4 bits e até de 2–3 bits; projetos da comunidade (por exemplo, ds4) estão sendo atualizados rapidamente.

Casos de uso e harnesses

  • Uso intenso para programação: C#, Rust, C/C++, Go, Python, TS/JS, SQL, CSS/HTML; especialmente com harnesses de agentes como pi, OpenCode e outros sistemas de subagentes.
  • Usuários enfatizam que “o harness importa mais do que o modelo” para produtividade: subagentes, ferramentas MCP, cache, redutores de contexto e “skills” personalizadas para revisão de código.
  • Também é usado para QA em transcrições de voz, classificação, extração, reescrita e pesquisa aprofundada na web via MCPs de busca.
  • Alguns combinam um planejador “de fronteira” (Opus/Sol/Luna/K3) com o V4-Flash como executor barato.

Pesos abertos, dados e governança

  • Os pesos são lançados no Hugging Face; muitos veem isso como algo essencial para capacidades “usáveis para sempre” no longo prazo e melhor proteção de dados via auto-hospedagem.
  • Há preocupações sobre enviar código para APIs hospedadas na China; as mitigadoras incluem intermediários no estilo ZDR ou implantação local.
  • Há debate sobre o futuro dos pesos abertos chineses e uma possível regulação dos EUA; participantes citam leituras conflitantes de discursos políticos e intenções.

Versionamento e ceticismo em relação à avaliação

  • Confusão sobre a nomenclatura do modelo: o Flash antigo e o novo ambos aparecem como deepseek-v4-flash na DeepSeek; alguns provedores acrescentam -0731.
  • Vários argumentam que isso deveria ter sido “V4.1” para evitar mudanças de comportamento silenciosas em produção.
  • Alguns desconfiam de marketing guiado por benchmarks e suspeitam de fine-tuning para benchmarks; alguns dizem que em grande parte ignoram benchmarks e confiam, em vez disso, no desempenho no mundo real.