“Dibujar” la Mona Lisa con GPT-5.6, Claude, Gemini y Grok
LLMs como GPT-5.6, Claude, Gemini y Grok fueron puestos a “dibujar” imágenes como la Mona Lisa y la Noche estrellada usando solo herramientas sencillas de pintura digital, revelando niveles muy distintos de control, estilo y eficiencia en costes. Los comentaristas señalan que, aunque los resultados parezcan infantiles o simbólicos —como el arte de un principiante—, muestran capacidades emergentes sorprendentes en el uso de herramientas y el razonamiento visual, y GPT-5.6 a menudo supera a configuraciones mucho más caras. El hilo también plantea preguntas sobre los métodos de evaluación, el diseño de prompts, la especialización de los modelos y si las analogías humanas (por ejemplo, comparar modelos con niños o loros) describen de forma útil el progreso actual de la IA.
Propósito y validez de la prueba
- Varios comentaristas ven el artículo principalmente como una pieza de marketing/engagement más que como una comparación rigurosa.
- Las críticas incluyen: prompts idénticos para modelos muy diferentes, ninguna adaptación al “estilo” de cada modelo, sin ejecuciones repetidas para comprobar consistencia, y sin herramienta de “deshacer/revertir”, lo que perjudica a las estrategias de retroceso.
- Algunos argumentan que en implementaciones reales ajustarías el armazón de prueba y el prompting a cada modelo, así que la comparación cara a cara es inherentemente limitada.
¿Son adecuados los LLM para dibujar?
- Varias personas subrayan que estos son modelos de lenguaje que usan una herramienta de dibujo, no generadores nativos de imágenes, así que llamar a los resultados “inútiles” se considera injusto.
- Aun así, otros encuentran la salida poco impresionante y señalan que los modelos especializados en imagen o los sistemas de chat con capacidad de imagen rinden mucho mejor.
- Hay interés en mejores armazones de prueba: más herramientas, zoom/recorte, gestión de paleta, “deshacer” y métricas de similitud mejores (por ejemplo, embeddings de modelos de visión en lugar de SSIM/RMSE).
Comportamiento y estilo del modelo
- Muchos coinciden en que GPT-5.6 “Sol” es el ganador claro: más coherente, eficiente y “encantador”, especialmente en la rosa y la Noche estrellada.
- Los dibujos de Grok se describen ampliamente como perturbadoramente malos, surrealistas o parecidos a la infame “restauración” chapucera de una pintura de Jesús; aun así, algunos los encuentran oscuramente divertidos o emocionalmente evocadores.
- Claude y otros modelos se consideran mediocres, a veces obsesionándose con el difuminado o usando mal el conjunto de herramientas limitado.
Dibujo “infantil” y antropomorfización
- Un tema recurrente es que las salidas parecen obra de artistas principiantes o infantiles: “dibujo simbólico” basado en iconos (“azul = cristal”) en lugar de luz, forma y valor.
- Algunos ven esto como extrañamente humano y sugieren que se parece al desarrollo artístico humano; otros replican que los modelos no “se desarrollan” realmente, sino que los laboratorios solo entrenan versiones mejores.
- Hay debate sobre antropomorfizar a los LLM frente a tratarlos como meras herramientas, con cierta frustración por las analogías de “loro estocástico” tan usadas.
Costes, eficiencia y economía
- Los comentaristas destacan la gran diferencia de coste, especialmente entre GPT-5.6 Sol y Fable, señalando que Sol logra mejores resultados con muchos menos tokens y dólares.
- Algunos informan que el uso de LLM parece más barato y mejor con el tiempo; otros dicen que siguen pagando más en total, atribuyéndolo al aumento de uso más que al coste por unidad.