生成模型:它们知道什么?它们真的知道东西吗?让我们来看看
生成式图像模型似乎会隐式学习 3D 场景属性,如深度、表面法线、反照率和光照,尽管它们只用 2D 图像和文本训练。评论者认为,这表明这类系统构建了内部的、可供人理解的表示,而不仅仅是在“拼接”像素,由此引发了关于这是否构成真正的世界建模或理解、还是更复杂的模式匹配的争论。这项工作也引发了对视觉、VR 和 3D 重建应用的猜测,以及关于这些模型与人类感知和学习有多接近的更广泛问题。
访问 / 设置
- 一些用户在主站上遇到了 SSL 问题;其他人则确认了证书,并提供了 GitHub 镜像。
- 有人分享了证书的指纹细节,以表明它至少在某些位置是有效的。
内部 3D / 场景表示
- 许多人对生成式图像模型似乎会隐式表示深度、表面法线、反照率,以及可能的材质属性(如镜面反射)感到震惊。
- 这被拿来与传统的基于物理的渲染流水线和 deferred shading/G-buffers 相比较。
- 仅用 2D 图像 + 文本训练的自回归和扩散模型,竟然能生成高质量的深度/法线图,这一点让人惊讶,并被视为其内部存在“世界模型”或 3D 引擎的证据。
“理解” vs 随机鹦鹉
- 一方认为,这些模型显然学到了抽象的、可供人理解的结构,从而削弱了“随机鹦鹉”/ 仅仅复读的观点。
- 另一方反驳说,没有“任何证据”表明存在真正的理解,而模型仍然只是在优化以复现训练数据的统计特征。
- 中间观点认为:“理解”最好被看作一种可泛化的内部因果模型;按这个标准,它是一个连续谱,而不是二元判断。
Qualia、意识与人类比较
- 有人把对 AI 理解能力的批评等同于关于灵魂的旧争论。
- 也有人坚持存在根本差异:人类有 qualia 和意志,而模型没有;我们甚至不知道该如何检测这些东西。
- 也有人反驳说,qualia 可能定义不清,并且可能可以归约为内部状态和自我模型;如果是这样,这类系统最终也可能符合条件。
对世界模型的怀疑
- 批评者认为,真正一致的 3D 推理应当消除伪影(多余肢体、错误透视),但这些问题仍然存在。
- 有人指出,传统工具可以从单张图像估计法线/深度,而无需声称进行了完整的世界模拟。
- 目前并不清楚底层的 UNet 是否曾在配对的 G-buffer 数据上训练过;有人怀疑这可能是隐藏的“秘密武器”。
I-LoRA 的工作方式(高层)
- 解释强调,I-LoRA 会在冻结的基础模型之上增加少量可训练参数(LoRA),并只对这些参数进行微调。
- 因为尽管修改的参数不到 <1%,却能得到很好的法线/深度结果,评论者推断基础模型里本来就已经包含了几乎可直接提取的表示;LoRA 只是把它们“读”出来。
应用与扩展
- 人们预见这对 VR / 空间计算(立体视图)、可重新打光的 3D 重建(例如 gaussian splatting)以及更好的深度图会有帮助——尽管也有人指出,常见深度图在实际使用中会失效。
- 也有人好奇类似技术是否能应用到文本模型(例如编辑事实知识)以及其他生成系统,包括 NN-generating NNs。
Sora、世界模拟与幻觉
- 有人将这项工作与对 Sora 的反应联系起来,认为两者都表明视频模型在运行某种隐式物理模拟,而不只是“把片段粘在一起”。
- 另一些人则强调 Sora 明显的伪影(例如多余肢体),认为这说明其物理建模并不稳健。
- 人类幻觉和梦境般的扭曲被拿来作类比:有缺陷的输出并不一定意味着没有世界模型。
LoRA 规模与“真正提取” vs 新模型
- 一个担忧是,拥有数百万参数的 LoRA 本身可能承担了大部分工作,只是在生成看起来合理的法线/深度,而不是真正暴露出已有结构。
- 支持者指出了对照实验:当 LoRA 在随机初始化的 UNet 上训练时,内在映射会崩塌,说明预训练模型的特征是必不可少的。
真实图像使用与深度 / 法线提取
- 论文声称扩散模型本就是图像到图像的结构,因此将其应用于真实照片很直接。
- 文中展示了从真实照片中提取深度和法线;而从真实照片中提取反照率/光照仍属推测,但被认为在重新打光方面尤其令人兴奋。
与更广泛可解释性工作的关系
- 评论者将其与其他机制可解释性结果联系起来(例如 Othello-playing transformers 中的内部结构、LLM 中的事实编辑)。
- 正在浮现的图景是:大型生成模型编码了丰富的中间表示,并且可以通过相对轻量的额外训练加以利用。
资助与标题 / 流行文化反应
- 对于企业资助方(例如汽车和创意软件公司)支持一项带有俏皮、受电视剧启发标题的研究,人们既觉得好笑,也有些惊讶。
- Bojack Horseman 游戏秀的引用广受欢迎,引发了对该剧幽默与阴郁混合风格的讨论,以及这种风格如何呼应论文对严肃工作的俏皮包装。