DeepSeek-v4-flash-vision-exp

O DeepSeek lançou uma versão experimental com visão do modelo V4 Flash, despertando interesse entre desenvolvedores que dependem dele para programação, trabalho de UI e fluxos de agentes que precisam “ver” capturas de tela, documentos e designs. Comentadores destacam forte custo-benefício e maior autonomia em tarefas como QA de frontend, OCR e raciocínio espacial, mas também apontam limitações importantes como o corte de redimensionamento de imagem para 800×800, falhas básicas ocasionais de visão (por exemplo, leitura de relógios ou marcos) e preocupações com mudanças recentes de preço. Muitos esperam que soluções no nível do harness (recorte, ferramentas de zoom, modelos externos de visão) e futuras iterações do modelo preencham as lacunas de fidelidade e confiabilidade.

Capacidade e comportamento de visão

  • O DeepSeek V4 Flash antes “agia” como se tivesse visão, tentando processar capturas de tela por meio de truques apenas de texto; o novo modelo vision-exp é visto como corrigindo essa lacuna.
  • Alguns observam que ele ainda é experimental e não um sistema de visão “flagship”, mas sim um modelo rápido/barato orientado a programação que agora aceita imagens.

Limites de resolução de imagem (800×800) e soluções alternativas

  • As imagens são redimensionadas para um equivalente de ~800×800, com limite de ~384–400 tokens por imagem; estimativas de custo sugerem ~2.500 imagens por dólar.
  • Muitos consideram 800×800 baixo demais para conteúdo denso (páginas A4, esquemas, texto pequeno, diagramas detalhados).
  • Outros argumentam que isso é aceitável para capturas de tela ou pequenos recortes e que ferramentas auxiliares podem compensar:
    • Ferramentas de recorte/zoom ou divisão em grade, depois reunindo os resultados.
    • Uso de modelos separados de layout/OCR (por exemplo, PP‑DocLayout, Unlimited‑OCR) para dividir páginas.
  • Há debate sobre se esses contornos no harness preservam relações globais e a precisão de contagem.

Casos de uso para visão

  • Usos “bons” comuns:
    • Ciclos de desenvolvimento frontend/UI (capturas de tela do Playwright/navegadores headless, inspeção no Figma, verificação de layouts).
    • OCR / documentos digitalizados e fotos de CV; extração de texto enquanto opcionalmente “corrige” ou preserva erros.
    • Diagramas, gráficos, esboços de design, wireframes, UIs de jogos, aprendizado por desenho e correção da IA.
    • Texto alternativo para redes sociais, pesquisa em imagens de satélite, percepção robótica, monitoramento de impressão 3D, compactação de contexto via PNGs com fonte minúscula.

Qualidade, benchmarks e falhas

  • Benchmarks: a pontuação DeepSWE relatada ficou ligeiramente acima da do Flash anterior apenas textual, com desempenho/custo notavelmente melhor em relação a alguns modelos concorrentes.
  • Alguns usuários elogiam o DeepSeek Flash em comparação com modelos de preço semelhante pela persistência, validação e uso de ferramentas; outros relatam saídas incoerentes e mau uso de chamadas de ferramentas (possivelmente problemas de quantização/harness).
  • A precisão em visão é mista:
    • Falha ou passa de forma inconsistente em testes de “leitura de relógios”; erra alguns horários analógicos que modelos concorrentes também leem incorretamente.
    • Desempenha pior do que alguns rivais na identificação de marcos (por exemplo, confundindo catedrais/pones).
    • Vários enfatizam uma “inteligência irregular”: forte em programação e em muitas tarefas visuais, mas não confiável em certos casos extremos.

Abertura, ecossistema e alternativas

  • Espera-se (mas não foi confirmado aqui) que os pesos possam ser liberados, em linha com a prática anterior do DeepSeek.
  • Sugestões para conectar modelos de visão externos via MCP ou plugins.
  • Alguns usuários estão migrando para outros modelos (por exemplo, Qwen) devido a mudanças de preço do DeepSeek, apesar do entusiasmo com suas capacidades.