GPT 5.6 Sol es el mejor modelo de “visión” que OpenAI haya lanzado nunca

El nuevo modelo GPT‑5.6 Sol de OpenAI se percibe ampliamente como un gran salto en la comprensión de imágenes y vídeo, especialmente para tareas reales y complejas como la crítica de interfaces, la asistencia en compras y el razonamiento visual fino. Sin embargo, los resultados de benchmarks y los informes de usuarios sugieren que la familia Gemini 3.x de Google y Qwen 3.8 de Alibaba a menudo lo superan en detección de objetos, conteo y eficiencia de costes, sobre todo en cargas de trabajo de gran volumen o de producción. Muchos comentaristas sostienen que las herramientas de visión tradicionales (p. ej., OpenCV) y los modelos especializados siguen superando a los LLM de propósito general en tareas estrechas, pero ven a los modelos de visión-lenguaje de frontera como cada vez más valiosos para etiquetar datos automáticamente, orquestar herramientas y manejar entradas multimodales desordenadas.

Sentimiento general sobre la visión de GPT‑5.6 Sol

  • Muchos consideran que Sol supone un avance importante frente a los modelos de visión anteriores de OpenAI, especialmente para:
    • Diseños complejos (p. ej., modales anidados, interfaces de aplicaciones).
    • Subtitulado de vídeo con movimiento por debajo del segundo y robustez frente a FPS.
    • Casos difíciles de OCR (reflejos tenues, capturas de pantalla complicadas, partituras).
  • Otros informan que sigue estando “ciego como cualquier otro modelo” para el detalle fino, el “gusto” visual y la adhesión estricta a un sistema de diseño.
  • Se considera que la visión va claramente por detrás de las capacidades de texto; fallos sorprendentes (imagen en blanco → cocina alucinada, fechas ilegibles, cirílico manuscrito).

Comparaciones: Gemini, Qwen y otros

  • Varios comentaristas dicen que Gemini (especialmente 3.7 Flash) es actualmente la mejor opción práctica para visión:
    • Supera a Sol en la mayoría de los benchmarks de Roboflow, especialmente en detección/conteo.
    • Es más barato y lo bastante rápido para tareas de gran volumen; Flash Lite recibe elogios para extracción, aunque falla en entradas grandes/complejas.
  • Algunos siguen prefiriendo Gemini Pro 3/3.1 para razonamiento científico profundo, pero 3.7 Flash se ve como comparable o mejor para PDFs desordenados y tareas de visión.
  • Qwen 3.8 (Max y 27B) recibe buenas reseñas para visión y detección de objetos; el 27B de pesos abiertos se destaca para uso local.
  • Otros modelos mencionados: Fable para OCR, Luna y Seed Turbo 2.1 para buenas descripciones visuales, modelos pequeños como minicpm‑v‑4.6 para uso en el dispositivo.

Benchmarks, metodología y CV clásica

  • Los comentaristas detectan problemas de verdad terreno y de rotación de cajas en los ejemplos de píldoras/huevos; se debate la resolución de la imagen frente a la orientación EXIF.
  • Contar píldoras con ~80% de precisión se considera muy por debajo de lo que necesita una farmacia en producción.
  • Varios sostienen que estas tareas son triviales con OpenCV/matching de plantillas; otros responden que:
    • Los VLM son valiosos para autoanotar conjuntos de datos.
    • El patrón correcto es que los LLM orquesten herramientas clásicas de CV, no que las sustituyan por completo.

Diseño, UX y “gusto”

  • Experiencias mixtas al usar LLM para criticar capturas de pantalla de UI:
    • Algunos dicen que Sol puede descomponer pantallas en bloques coherentes y reutilizables.
    • Otros encuentran que los modelos son inconsistentes o clichés, especialmente con interfaces “que parecen IA”.
  • Debate sobre cuánto del diseño/UX es objetivamente medible frente al “gusto”, y si los modelos pueden captar esos matices.

Casos de uso y limitaciones

  • Éxitos reportados: encontrar y recortar productos en pasillos de supermercado, asistencia para contar píldoras en farmacias, revisión de diagramas, transcripción de partituras.
  • Fallos destacados: rompecabezas de seguir caminos sin herramientas, diagnóstico erróneo de enfermedades de cultivos, comprensión de profundidad/3D (se piden benchmarks binoculares, pero no se discuten).
  • Algunos ven a Sol y a sus pares como generalistas impresionantes, pero todavía no fiables para visión de producción crítica en seguridad o de alta precisión.