视频生成模型作为世界模拟器

OpenAI 的新模型 Sora 能根据文本提示生成长且高质量的视频,令许多人将其视为早期的“世界模拟器”,它似乎从原始视频中隐式学到了 3D 结构、物理和物体持续性。评论者强调了诸如从其输出训练类似 NeRF 的 3D 重建、以及模拟 Minecraft 等游戏的惊人能力,同时也指出了在透视、运动和诸如玻璃碎裂之类的物理交互方面的明显失败。该讨论探讨了它对机器人、AGI、创意产业和游戏设计的影响,并反复出现一种张力:到底应将 Sora 看作迈向具身智能的变革性一步,还是看作一个强大但本质上只是追求合理性的、没有显式物理模型的视频合成器。

视频和 3D 一致性的感知突破

  • 许多人对 Sora 的时间一致性和 3D 一致性感到震撼,尽管它没有显式的 3D 先验。
  • 用户指出,NeRF/Gaussian-splat 工具可以从 Sora 视频中重建 3D 场景,而这在更早的视频模型上并不可行。
  • 与此前工具(Runway、Pika 等)相比,Sora 更长的片段和更强的连贯性被视为一个重大的质量飞跃。

局限、伪影与物理准确性

  • 认真观看的人报告了许多不一致之处:扭曲的透视、视差错误、不稳定的阴影、变形的物体、多余的肢体,以及“游动”般的运动。
  • 具体失败包括:玻璃并没有真正碎裂、奇怪的走路姿态、物体摆放错误(雨伞、多出的手),以及奇怪的 Minecraft 输出(FOV、纹理、光照翻转)。
  • 该模型被描述为更接近“梦境般的合理性”,而非严格现实主义;看起来合理,但物理并不可靠准确。

世界模型、机器人与 AGI

  • 一些人认为 Sora 是朝着学习到的“世界模拟器”迈出的一步,类似于 AlphaGo 变强的方式,能让机器人预测未来视频帧并规划动作。
  • 另一些人则认为,在像素空间进行预测以及经典 RL 理论过去曾被过度承诺;AGI 仍然遥远,尤其是在主体性和即时泛化方面。
  • 也有人讨论了替代方法(例如压缩的潜空间世界模型、V-JEPA),认为它们比完整视频生成更适合控制和规划。

3D 表示与像素空间模型

  • 有几位参与者惊讶于系统绕过了显式几何(网格),直接处理像素,却隐式学到了 3D、光照和遮挡。
  • 网格被批评为脆弱且难以使用,但尚未发现明确更优的通用 3D 表示。
  • 还有人提出直接在立体视频或游戏数据上训练,或将 Sora 的输出作为 3D 重建和场景补全的先验。

应用与行业影响

  • 设想的用途包括:高质量文本生成视频、视频延展、风格迁移、数字世界模拟、从图像或绘画生成 AR/VR 世界、仓库/机器人控制,以及自动生成游戏或可视化。
  • VFX 和素材视频从业者被描述为感到担忧;其他人则预计会出现混合工作流,由传统工具提供草稿,再由模型进行“润色”或补缺。
  • 讨论还涉及成人视频生成(减少人类剥削 vs. 加剧成瘾)、个性化/交互式电影,以及无处不在的深度伪造视频风险。

训练数据、版权与偏差

  • 有人推测数据来自 YouTube/twitch 风格内容,而 Minecraft 的质量主要反映了海量公开数据集。
  • 有人认为平台所有者的合作对版权风险至关重要。
  • 一些话题偏差(例如人们吃东西的镜头很少)被提出为某些失败模式的可能原因,但这一点仍不明确。

哲学与“模拟”争论

  • 多条支线在争论:越来越好的模拟是否意味着我们生活在一个模拟中;也有人强烈反驳这些概率论证。
  • 关于“物理模拟”到底是什么、意识是什么,以及仅靠视频预测器是否能建模真实底层物理的更广泛问题,仍未解决。