用 GPT-5.6、Claude、Gemini 和 Grok 来“画”《蒙娜丽莎》

LLM(如 GPT-5.6、Claude、Gemini 和 Grok)被要求仅使用简单的数字绘画工具来“画”出《蒙娜丽莎》和《星夜》等图像,结果暴露出它们在控制力、风格与成本效率上的巨大差异。评论者指出,尽管这些作品看起来幼稚或符号化,像初学者的绘画,但它们仍显示出在工具使用和视觉推理方面令人惊讶的涌现能力,而 GPT-5.6 往往比更昂贵得多的方案表现更好。讨论还引出了评估方法、提示设计、模型专业化,以及将模型比作儿童或鹦鹉这类人类类比是否真正能描述当前 AI 进展的问题。

测试的目的与有效性

  • 一些评论者认为这篇文章主要是一篇营销/互动文章,而不是严格的比较。
  • 批评包括:对差异极大的模型使用相同提示、没有针对每个模型的“风格”进行调整、没有重复运行来检验一致性,以及没有“撤销/回退”工具,这会在面对回退策略时产生偏差。
  • 有人认为,在真实部署中,你会为每个模型调整测试框架和提示,因此这种一对一比较本质上是有限的。

LLM 适合绘画吗?

  • 多位人士强调,这些是带有绘图工具的语言模型,而不是原生图像生成模型,因此把结果说成“毫无用处”并不公平。
  • 但也有人仍觉得输出并不令人印象深刻,并指出专门的图像模型或具备图像能力的聊天系统表现要好得多。
  • 大家对更好的测试框架很感兴趣:更多工具、缩放/裁剪、调色板管理、“撤销”,以及使用更好的相似度指标(例如用视觉模型嵌入而不是 SSIM/RMSE)。

模型行为与风格

  • 许多人认同 GPT-5.6 “Sol” 是明显赢家:更连贯、更高效,也更“迷人”,尤其是在玫瑰和《星夜》上。
  • Grok 的画作被广泛形容为糟糕得令人不安、超现实,或者像那幅臭名昭著、把耶稣画像“修复”砸掉的作品;也有人仍觉得它们黑色幽默十足,或者在情感上很有感染力。
  • Claude 和其他模型被认为表现中规中矩,有时过于专注于混合,或者误用有限的工具集。

“儿童式”绘画与拟人化

  • 一个反复出现的主题是,输出看起来像初学者或儿童艺术家的作品:基于图标的“符号绘画”(比如“蓝色 = 玻璃”),而不是基于光线、形体和明度。
  • 有些人觉得这在诡异地很像人类,并认为这与人类的艺术发展相似;也有人反驳说,模型并没有真正“发展”,只是实验室训练出了更好的版本。
  • 讨论也涉及将 LLM 拟人化,还是仅把它们当作工具;有人对反复被引用的“随机鹦鹉”类比感到厌烦。

成本、效率与经济性

  • 评论者强调了巨大的成本差距,尤其是在 GPT-5.6 Sol 和 Fable 之间,指出 Sol 用更少的 token 和更少的钱就取得了更好的结果。
  • 一些人表示,随着时间推移,LLM 的使用感觉更便宜、也更好;另一些人则说他们总体花费仍然更高,认为这是因为使用量增加,而不是单价更高。