Show HN: Um loop de feedback entre Dalle-3 e GPT4-Vision

Um aplicativo web simples que faz um loop de geração de imagens do DALL·E 3 com prompts de imagem-para-texto do GPT‑4 Vision está levando as pessoas a explorar como ideias visuais “evoluem” ao longo de várias iterações, muitas vezes derivando para temas surreais, cósmicos ou steampunk. Os comentaristas tratam isso como uma versão automatizada de jogos de festa como Telestrations ou exquisite corpse, experimentando com prompts personalizados, tradução de idiomas e restrições para ver quais elementos permanecem estáveis e quais se distorcem rapidamente. Além da diversão criativa, há escrutínio sobre os filtros de segurança da OpenAI, limites de taxa e diretivas de diversidade, bem como preocupação em colar chaves de API em ferramentas de terceiros e frustração com a interface oficial de imagem do ChatGPT.

Conceito e Reações Gerais

  • Encadeia DALL·E 3 e GPT‑4 Vision: cada imagem é descrita pelo GPT‑4V, transformada em um novo prompt e depois re-renderizada pelo DALL·E, iterando em um “telefone sem fio” de imagens.
  • Muitos comentários expressam encanto e diversão; as pessoas compartilham cadeias surreais (corgis, gnomos, cabras, IA pintando a si mesma, ciclos da Terra, etc.).
  • Alguns acham isso criativamente inspirador; outros dizem que os resultados são ruidosos, repetitivos ou “bregas”, reforçando dúvidas já existentes sobre arte gerada por IA.

Design de Prompt e Padrões de Evolução

  • “Meta-prompts” personalizados importam bastante: por exemplo, “substitua tudo por corgis”, “torne mais caprichoso”, “aumente a intensidade a cada vez”, “deixe mais estranho” ou “descreva por um determinado ângulo”.
  • Descrições mais longas e hiperdetalhadas tornam as imagens mais auto-semelhantes entre iterações; comprimir para texto muito curto aumenta a deriva.
  • Vários notam convergência para certos clichês: cósmico/espaço, cogumelos, steampunk, paisagens urbanas futuristas, pôsteres psicodélicos.
  • Prompts com vários sujeitos muitas vezes colapsam para um único sujeito dominante, frequentemente o primeiro mencionado.

Comportamento do Modelo e “Compreensão”

  • Alguns veem uma coerência visual impressionante (sombras corretas, reflexos, estrutura semelhante a 3D) e temas estáveis.
  • Outros argumentam que o GPT‑4V frequentemente descreve mal as imagens de maneiras que nenhum humano faria, sugerindo correspondência de padrões em vez de “compreensão” real.
  • Há debate sobre se o desalinhamento aparente se deve a limitações do modelo ou à compressão inerentemente com perdas de imagem → texto curto.

Segurança, Viés e Filtros de Conteúdo

  • Usuários frequentemente esbarram em rejeições de segurança e em erros opacos de “rate limit” ou “unsupported image”; o comportamento é descrito como inconsistente e às vezes enganoso.
  • O texto interno de prompt compartilhado para o DALL·E mostra diversidade imposta nas representações de pessoas (mistura de raça/gênero), o que alguns elogiam e outros consideram intrusivo quando querem cenas culturalmente específicas.

API, Custos e UI / Solicitações de Recursos

  • A ferramenta é muito focada em front-end; os usuários a apreciam como uma alternativa mais rápida e menos frustrante à UI padrão da OpenAI (criticada por ser lenta, bugada e ocultar prompts).
  • As pessoas discutem limites de taxa, planos e custos por iteração; execuções de 10 imagens custam apenas centavos, mas somam.
  • Recursos solicitados: bifurcar cadeias, grafo de linhagem, começar a partir de uma imagem enviada, chaves de uso único ou com limite, melhor tratamento de limites de 1 imagem/minuto e correção de bugs de link de compartilhamento/“keep going”.

Segurança e Reações Emocionais

  • Forte relutância em colar chaves de API em sites de terceiros; alguns recomendam chaves temporárias e revogação, outros continuam desconfortáveis.
  • Alguns relatam uma sensação visceral de repulsa ou estranheza “errada” diante de arte de IA, mesmo achando o experimento intelectualmente interessante.