Show HN:DALL·E 3 与 GPT-4 Vision 的反馈循环

一个简单的网页应用把 DALL·E 3 的图像生成与 GPT‑4 Vision 的图像转文本提示词循环起来,促使人们探索视觉想法在多次迭代中如何“演化”,并常常漂移到超现实、宇宙感或蒸汽朋克主题。评论者把它当作 Telestrations 或传话接龙(exquisite corpse)之类派对游戏的自动化版本,尝试自定义提示词、语言翻译和各种约束,观察哪些元素能保持稳定,哪些又会迅速失真。除了创作乐趣之外,讨论还集中在 OpenAI 的安全过滤、速率限制和多样性指令,以及把 API 密钥粘贴到第三方工具中的担忧,并对官方 ChatGPT 图像界面的糟糕体验感到沮丧。

概念与总体反应

  • 工具链将 DALL·E 3 和 GPT‑4 Vision 连接起来:先由 GPT‑4V 描述每张图片,再把描述转成新的提示词,然后交给 DALL·E 重新生成,反复迭代,形成一种图像版的“传话游戏”。
  • 许多评论表达了喜悦和逗趣;人们分享了各种超现实的链条(柯基、地精、山羊、AI 画自己、地球循环等)。
  • 有些人觉得它在创意上很有启发性;也有人说结果杂乱、重复,或者“太俗套”,进一步强化了他们对 AI 艺术的既有怀疑。

提示词设计与演化模式

  • 自定义“元提示词”非常重要:例如“把所有东西都替换成柯基”“更异想天开一些”“每次都提高强度”“变得更怪一点”,或者“通过某种特定视角来描述”。
  • 更长、超细致的描述会让图像在各次迭代中更趋于自相似;压缩成极短文本则会增加漂移。
  • 多个评论指出,内容会收敛到某些固定套路:宇宙/太空、蘑菇、蒸汽朋克、未来城市景观、迷幻海报。
  • 多主体提示词往往会坍缩成单一的主导主体,通常是最先提到的那个。

模型行为与“理解”

  • 有些人认为其视觉连贯性令人印象深刻(阴影、反射、类似 3D 的结构正确,主题也稳定)。
  • 另一些人则认为 GPT‑4V 经常以人类不会那样描述的方式误述图片,这说明它更像是在做模式匹配,而不是真正的“理解”。
  • 关于这种表面上的不对齐究竟是模型能力限制,还是图像 → 短文本这一过程本身固有的有损压缩,存在争论。

安全、偏见与内容过滤

  • 用户经常遇到安全拒绝以及含糊不清的“速率限制”或“暂不支持图片”错误;这种行为被描述为不一致,有时还会误导人。
  • 公开的 DALL·E 内部提示文本显示,对人物的呈现被强制要求多样化(种族/性别混合);一些人对此表示赞赏,另一些人则觉得当自己想要文化特定场景时这很 intrusive。

API、成本与 UI / 功能请求

  • 这个工具很偏前端;用户觉得它比 OpenAI 默认 UI 更快、更不烦人,而默认 UI 则被批评为缓慢、容易出错、还会隐藏提示词。
  • 人们讨论速率限制、套餐层级以及每次迭代的成本;10 张图的运行只要几美分,但累计起来也会不少。
  • 请求的功能包括:分叉链路、谱系图、从上传图片开始、一次性或有上限的密钥、更好地处理每分钟 1 张图的限制,以及修复分享链接/“继续运行”方面的 bug。

安全与情绪反应

  • 很多人强烈不愿把 API 密钥粘贴到第三方网站;有些人建议使用临时密钥并在之后撤销,但也有人仍然觉得不安。
  • 少数人表示,AI 艺术会让他们产生一种强烈的厌恶感或诡异的“违和”感,即使他们在智识上觉得这个实验很有意思。