Show HN: Un bucle de retroalimentación entre DALL·E 3 y GPT4-Vision
Una simple app web que encadena la generación de imágenes de DALL·E 3 con los prompts imagen-a-texto de GPT‑4 Vision está llevando a la gente a explorar cómo las ideas visuales “evolucionan” a lo largo de múltiples iteraciones, a menudo derivando hacia temas surrealistas, cósmicos o steampunk. Los comentaristas lo tratan como una versión automatizada de juegos de fiesta como Telestrations o exquisite corpse, experimentando con prompts personalizados, traducción de idiomas y restricciones para ver qué elementos permanecen estables y cuáles se distorsionan rápidamente. Junto con la diversión creativa, hay escrutinio sobre los filtros de seguridad de OpenAI, los límites de tasa y las directivas de diversidad, así como preocupación por pegar claves de API en herramientas de terceros y frustración con la interfaz oficial de imágenes de ChatGPT.
Concepto y reacciones generales
- La herramienta encadena DALL·E 3 y GPT‑4 Vision: cada imagen es descrita por GPT‑4V, convertida en un nuevo prompt y luego renderizada de nuevo por DALL·E, iterando en un “teléfono descompuesto” de imágenes.
- Muchos comentarios expresan deleite y diversión; la gente comparte cadenas surrealistas (corgis, gnomos, cabras, IA pintándose a sí misma, ciclos de la Tierra, etc.).
- Algunos lo encuentran creativamente inspirador; otros dicen que los resultados son ruidosos, repetitivos o “empalagosos”, reforzando dudas previas sobre el arte con IA.
Diseño de prompts y patrones de evolución
- Los “meta-prompts” personalizados importan mucho: por ejemplo, “reemplaza todo con corgis”, “hazlo más caprichoso”, “aumenta la intensidad en cada iteración”, “hazlo más raro” o “descríbelo a través de una lente específica”.
- Las descripciones más largas y hiperdetalladas hacen que las imágenes sean más parecidas a sí mismas entre iteraciones; comprimir a texto muy breve aumenta la deriva.
- Varios señalan una convergencia hacia ciertos tópicos: cósmico/espacial, hongos, steampunk, paisajes urbanos futuristas, pósters psicodélicos.
- Los prompts con múltiples sujetos a menudo colapsan hacia un único sujeto dominante, a menudo el primero mencionado.
Comportamiento del modelo y “comprensión”
- Algunos ven una coherencia visual impresionante (sombras correctas, reflejos, estructura tipo 3D) y temas estables.
- Otros sostienen que GPT‑4V a menudo describe mal las imágenes de formas que ningún humano haría, lo que sugiere coincidencia de patrones más que verdadera “comprensión”.
- Hay debate sobre si la aparente desalineación se debe a límites del modelo o a una compresión inherentemente con pérdida al pasar de imagen a texto breve.
Seguridad, sesgo y filtros de contenido
- Los usuarios se topan con frecuencia con rechazos de seguridad y errores opacos de “rate limit” o “unsupported image”; el comportamiento se describe como inconsistente y a veces engañoso.
- El texto interno del prompt compartido para DALL·E muestra diversidad impuesta en las representaciones de personas (mezcla de raza/género), algo que algunos aplauden y otros consideran intrusivo cuando quieren escenas culturalmente específicas.
API, costes y UI / solicitudes de funciones
- La herramienta depende mucho del frontend; los usuarios la valoran como una alternativa más rápida y menos frustrante a la interfaz predeterminada de OpenAI (criticada por ser lenta, con fallos y por ocultar los prompts).
- La gente comenta límites de tasa, niveles y costes por iteración; las ejecuciones de 10 imágenes cuestan solo centavos, pero se acumulan.
- Funciones solicitadas: bifurcar cadenas, un grafo de linaje, empezar desde una imagen subida, claves de un solo uso o limitadas, mejor manejo de límites de 1 imagen/min, y arreglar errores de enlace compartido/“seguir adelante”.
Seguridad y reacciones emocionales
- Hay una fuerte reticencia a pegar claves de API en sitios de terceros; algunos aconsejan claves temporales y revocación, pero otros siguen incómodos.
- Unos pocos informan una sensación visceral de repulsión o de rareza inquietante ante el arte con IA, incluso cuando encuentran el experimento intelectualmente interesante.