DeepSeek-v4-flash-vision-exp

DeepSeek ha lanzado una versión experimental con visión de su modelo V4 Flash, lo que ha despertado interés entre desarrolladores que lo usan para programación, trabajo de interfaz y flujos de agentes que necesitan “ver” capturas de pantalla, documentos y diseños. Los comentaristas destacan una fuerte relación coste-rendimiento y una mejor autonomía en tareas como QA frontend, OCR y razonamiento espacial, pero también señalan limitaciones clave como el recorte de imágenes a 800×800, fallos básicos ocasionales de visión (p. ej., leer relojes o reconocer lugares emblemáticos) y preocupaciones por los recientes cambios de precios. Muchos esperan que soluciones a nivel de andamiaje (recorte, herramientas de zoom, modelos de visión externos) y futuras iteraciones del modelo aborden las brechas de fidelidad y fiabilidad.

Capacidad y comportamiento de visión

  • DeepSeek V4 Flash anteriormente “actuaba” como si tuviera visión, intentando procesar capturas de pantalla mediante trucos de solo texto; se considera que el nuevo modelo vision-exp corrige esa carencia.
  • Algunos señalan que sigue siendo experimental y no un sistema de visión “emblemático”, sino más bien un modelo rápido/barato orientado a programación que ahora acepta imágenes.

Límites de resolución de imagen (800×800) y soluciones alternativas

  • Las imágenes se redimensionan a un equivalente de ~800×800, con un tope de ~384–400 tokens por imagen; las estimaciones de coste sugieren ~2.500 imágenes por dólar.
  • Muchos consideran que 800×800 es demasiado bajo para contenido denso (páginas A4, esquemas, texto pequeño, diagramas detallados).
  • Otros sostienen que es aceptable para capturas de pantalla o recortes pequeños y que las herramientas pueden compensarlo:
    • Herramientas de recorte/zoom o teselado en cuadrículas, y luego ensamblar los resultados.
    • Usar modelos separados de maquetación/OCR (p. ej., PP‑DocLayout, Unlimited‑OCR) para dividir páginas.
  • Hay debate sobre si estas soluciones de andamiaje preservan las relaciones globales y la precisión de los conteos.

Casos de uso para visión

  • Usos “buenos” comunes:
    • Bucles de desarrollo frontend/UI (capturas de pantalla desde Playwright/navegadores headless, inspección de Figma, verificación de diseños).
    • OCR / documentos escaneados y fotos de CV; extracción de texto y, opcionalmente, “corrección” o preservación de errores.
    • Diagramas, gráficos, bocetos de diseño, wireframes, UIs de juegos, aprendizaje mediante bocetos y corrección por parte de la IA.
    • Texto alternativo para redes sociales, investigación con imágenes satelitales, percepción robótica, monitorización de impresión 3D, compresión de contexto mediante PNGs con letra diminuta.

Calidad, benchmarks y fallos

  • Benchmarks: se informa que la puntuación DeepSWE está ligeramente por encima de la anterior Flash solo de texto, con una relación coste/rendimiento notablemente mejor frente a algunos modelos competidores.
  • Algunos usuarios elogian DeepSeek Flash frente a modelos de precio similar por su persistencia, validación y uso de herramientas; otros informan de salidas incoherentes y mala llamada a herramientas (posiblemente por problemas de cuantización/andamiaje).
  • La precisión de visión es mixta:
    • Falla o aprueba de forma inconsistente pruebas de “lectura de relojes”; se equivoca en algunas horas analógicas que otros modelos competidores también leen mal.
    • Rinde peor que algunos rivales en identificación de lugares emblemáticos (p. ej., confunde catedrales/puentes).
    • Varios enfatizan una “inteligencia irregular”: fuerte en programación y muchas tareas visuales, pero poco fiable en ciertos casos límite.

Apertura, ecosistema y alternativas

  • Se espera (aunque no se confirma aquí) que los pesos puedan publicarse, en línea con la práctica previa de DeepSeek.
  • Se sugieren modelos de visión externos a través de MCP o plugins.
  • Algunos usuarios están migrando a otros modelos (p. ej., Qwen) debido a los cambios de precios de DeepSeek, pese al entusiasmo por sus capacidades.