Atualização do DeepSeek-V4-Flash
A DeepSeek lançou uma grande atualização para seu modelo de linguagem V4-Flash, relatando ganhos expressivos em benchmarks de programação e uso de ferramentas que o colocam no mesmo nível de modelos proprietários líderes como as variantes mais recentes do GPT-5.6 da OpenAI — ao mesmo tempo em que permanece dramaticamente mais barato por token, especialmente quando os acertos de cache são aproveitados. Comentadores destacam que os pesos abertos, os requisitos de hardware relativamente modestos e a forte relação preço-desempenho o tornam atraente para inferência local, agentes de programação e tarefas de alto volume e baixo glamour, mesmo que ainda fique atrás dos melhores modelos em algumas capacidades de raciocínio e multimodais. Junto com o entusiasmo, há preocupações sobre benchmarks opacos, privacidade de dados e jurisdição chinesa, além dos riscos operacionais de atualizar silenciosamente um modelo sob um nome de API estável.
Desempenho do modelo e benchmarks
- A atualização mostra grandes saltos em relação ao V4-Flash anterior no harness interno: ganhos expressivos no Terminal Bench e no Toolathlon.
- Em comparação com o GPT‑5.6 Terra/Luna: o Flash agora os supera em alguns benchmarks de código/terminal (Terminal Bench, Toolathlon, CyberGym), mas fica atrás em outros (DeepSWE, Agents’ Last Exam). Não há um vencedor geral claro.
- Alguns apontam para os rankings oficiais (por exemplo, Terminal-Bench, DeepSWE) como os “resultados reais”; outros observam os números autorreportados dos laboratórios e possíveis erros de digitação.
- Vários usuários relatam que o Flash parece próximo de modelos de fronteira (Opus 4.7–5.x, Sonnet 5, Luna) em tarefas de programação, com custo muito menor.
Preço, cache e custo por tarefa
- O V4-Flash é repetidamente descrito como “insanamente barato”, especialmente com cache.
- Estatísticas de uso compartilhadas: centenas de milhões a ~2 bilhões de tokens por menos de US$ 20 em algumas semanas, graças a taxas de acerto de cache de ~99%.
- A API direta da DeepSeek é vista como mais barata e melhor para cache do que alguns agregadores; outros usam planos de terceiros (por exemplo, OpenCode Go) que revendem a DeepSeek com garantias tipo ZDR, embora mudanças recentes na redação tenham gerado incerteza.
- Comparações com Luna destacam a leitura de cache do Flash a US$ 0,0028/MTok versus US$ 0,02/MTok do Luna.
Inferência local e hardware
- Modelo: DeepSeek-V4-Flash-284B-A13B, ~160 GiB de pesos completos, descrito como “apenas 160 GiB” para um modelo MoE de ~200–300B.
- Roda bem em 2× DGX Spark ou 2× RTX 6000/6000 Pro; um único B300 fica no limite; 128 GB M5 Max consegue rodar quantizações fortes, mas lentamente.
- São discutidas quantizações de 4 bits e até de 2–3 bits; projetos da comunidade (por exemplo, ds4) estão sendo atualizados rapidamente.
Casos de uso e harnesses
- Uso intenso para programação: C#, Rust, C/C++, Go, Python, TS/JS, SQL, CSS/HTML; especialmente com harnesses de agentes como pi, OpenCode e outros sistemas de subagentes.
- Usuários enfatizam que “o harness importa mais do que o modelo” para produtividade: subagentes, ferramentas MCP, cache, redutores de contexto e “skills” personalizadas para revisão de código.
- Também é usado para QA em transcrições de voz, classificação, extração, reescrita e pesquisa aprofundada na web via MCPs de busca.
- Alguns combinam um planejador “de fronteira” (Opus/Sol/Luna/K3) com o V4-Flash como executor barato.
Pesos abertos, dados e governança
- Os pesos são lançados no Hugging Face; muitos veem isso como algo essencial para capacidades “usáveis para sempre” no longo prazo e melhor proteção de dados via auto-hospedagem.
- Há preocupações sobre enviar código para APIs hospedadas na China; as mitigadoras incluem intermediários no estilo ZDR ou implantação local.
- Há debate sobre o futuro dos pesos abertos chineses e uma possível regulação dos EUA; participantes citam leituras conflitantes de discursos políticos e intenções.
Versionamento e ceticismo em relação à avaliação
- Confusão sobre a nomenclatura do modelo: o Flash antigo e o novo ambos aparecem como
deepseek-v4-flashna DeepSeek; alguns provedores acrescentam-0731. - Vários argumentam que isso deveria ter sido “V4.1” para evitar mudanças de comportamento silenciosas em produção.
- Alguns desconfiam de marketing guiado por benchmarks e suspeitam de fine-tuning para benchmarks; alguns dizem que em grande parte ignoram benchmarks e confiam, em vez disso, no desempenho no mundo real.