DeepSeek-v4-flash-vision-exp
O DeepSeek lançou uma versão experimental com visão do modelo V4 Flash, despertando interesse entre desenvolvedores que dependem dele para programação, trabalho de UI e fluxos de agentes que precisam “ver” capturas de tela, documentos e designs. Comentadores destacam forte custo-benefício e maior autonomia em tarefas como QA de frontend, OCR e raciocínio espacial, mas também apontam limitações importantes como o corte de redimensionamento de imagem para 800×800, falhas básicas ocasionais de visão (por exemplo, leitura de relógios ou marcos) e preocupações com mudanças recentes de preço. Muitos esperam que soluções no nível do harness (recorte, ferramentas de zoom, modelos externos de visão) e futuras iterações do modelo preencham as lacunas de fidelidade e confiabilidade.
Capacidade e comportamento de visão
- O DeepSeek V4 Flash antes “agia” como se tivesse visão, tentando processar capturas de tela por meio de truques apenas de texto; o novo modelo vision-exp é visto como corrigindo essa lacuna.
- Alguns observam que ele ainda é experimental e não um sistema de visão “flagship”, mas sim um modelo rápido/barato orientado a programação que agora aceita imagens.
Limites de resolução de imagem (800×800) e soluções alternativas
- As imagens são redimensionadas para um equivalente de ~800×800, com limite de ~384–400 tokens por imagem; estimativas de custo sugerem ~2.500 imagens por dólar.
- Muitos consideram 800×800 baixo demais para conteúdo denso (páginas A4, esquemas, texto pequeno, diagramas detalhados).
- Outros argumentam que isso é aceitável para capturas de tela ou pequenos recortes e que ferramentas auxiliares podem compensar:
- Ferramentas de recorte/zoom ou divisão em grade, depois reunindo os resultados.
- Uso de modelos separados de layout/OCR (por exemplo, PP‑DocLayout, Unlimited‑OCR) para dividir páginas.
- Há debate sobre se esses contornos no harness preservam relações globais e a precisão de contagem.
Casos de uso para visão
- Usos “bons” comuns:
- Ciclos de desenvolvimento frontend/UI (capturas de tela do Playwright/navegadores headless, inspeção no Figma, verificação de layouts).
- OCR / documentos digitalizados e fotos de CV; extração de texto enquanto opcionalmente “corrige” ou preserva erros.
- Diagramas, gráficos, esboços de design, wireframes, UIs de jogos, aprendizado por desenho e correção da IA.
- Texto alternativo para redes sociais, pesquisa em imagens de satélite, percepção robótica, monitoramento de impressão 3D, compactação de contexto via PNGs com fonte minúscula.
Qualidade, benchmarks e falhas
- Benchmarks: a pontuação DeepSWE relatada ficou ligeiramente acima da do Flash anterior apenas textual, com desempenho/custo notavelmente melhor em relação a alguns modelos concorrentes.
- Alguns usuários elogiam o DeepSeek Flash em comparação com modelos de preço semelhante pela persistência, validação e uso de ferramentas; outros relatam saídas incoerentes e mau uso de chamadas de ferramentas (possivelmente problemas de quantização/harness).
- A precisão em visão é mista:
- Falha ou passa de forma inconsistente em testes de “leitura de relógios”; erra alguns horários analógicos que modelos concorrentes também leem incorretamente.
- Desempenha pior do que alguns rivais na identificação de marcos (por exemplo, confundindo catedrais/pones).
- Vários enfatizam uma “inteligência irregular”: forte em programação e em muitas tarefas visuais, mas não confiável em certos casos extremos.
Abertura, ecossistema e alternativas
- Espera-se (mas não foi confirmado aqui) que os pesos possam ser liberados, em linha com a prática anterior do DeepSeek.
- Sugestões para conectar modelos de visão externos via MCP ou plugins.
- Alguns usuários estão migrando para outros modelos (por exemplo, Qwen) devido a mudanças de preço do DeepSeek, apesar do entusiasmo com suas capacidades.