Sora:从文本创建视频
OpenAI 新推出的 Sora 模型可根据文本提示生成长达一分钟、极为逼真的视频,被认为是对 Runway、Pika 和 Google 最近的 Lumiere 演示等现有工具的一次重大飞跃。评论者在兴奋与担忧之间分裂:一方面看好电影创作民主化、新的创作工作流以及对机器人/物理建模的潜在应用;另一方面则严重担心其会被用于政治深度伪造、削弱人们对视频证据的信任,并对艺术家、电影人和其他创意工作者造成经济冲击。许多人还指出,OpenAI 领先优势扩大、训练数据与安全立场不透明,以及这次发布与 Google Gemini 1.5 同期出现,都表明 AI 军备竞赛正在加速。
总体反应
- 很多人感到震惊;不少人称 Sora 相比现有的文本转视频模型(Runway、Pika、SVD、Google 的 Lumiere 等)实现了数量级的飞跃。
- 也有人提醒要谨慎,指出 OpenAI 的示例经过精挑细选,而且此前 DALL·E 的热度并未完全对应日常使用体验。
- 还有不少评论提到时机问题:Sora 的发布被广泛视为抢了 Google Gemini 1.5 发布的风头。
能力与技术猜测
- 亮点包括:长片段(约 60 秒以上)、强时间一致性、令人信服的视差和镜头运动、相对逼真的人类和动物,以及电影化构图。
- 许多人猜测它是在压缩潜空间上做扩散,可能涉及 NeRF 或 Gaussian splatting;也有人引用 OpenAI 的描述,认为其使用了 patch tokens 和 transformer diffusion。
- 有些人认为 Sora 不只是“像素生成器”:它可能更像一个“数据驱动的物理引擎”,以隐式方式建模现实世界动力学,对机器人和 AGI 也有启发。
- 也有人反驳说,“理解物理”可能只是营销说法;他们认为这更像是复杂的模式匹配,而不是真正的因果理解。
局限与伪影
- 反复出现的故障包括:多余的肢体/爪子、腿部滑动或互换、尺寸不一致(巨人/迷你人物)、背景和道具的变形、物体恒常性不稳定。
- 物理规律往往在细微处失效(雪像烟一样运动、翻页方式怪异、椅子漂浮等)。
- 标志/文字大多毫无意义;背景有时会发生梦境般的变化,一些人把这和真实梦境相类比。
用例与行业影响
- 短期内:可替代素材视频、广告、社交媒体/TikTok 风格短片、分镜、预可视化、游戏过场动画、低成本广告。
- 更长期的愿景:AI 生成电影、个性化剧集、以观看者为主角的超定向广告、AI 增强游戏、VR/类似“全息舱”的体验。
- 许多人预见这会深刻冲击 VFX、素材媒体、动画以及部分电影制作领域;也有人认为以人为主导的叙事、写作和导演仍然是核心。
滥用、虚假信息与选举
- 人们强烈担心,高度逼真的伪造内容会加剧政治操纵、深度伪造和历史扭曲。
- 有人指出社会已经适应了 AI 图像;但也有人认为视频的逼真度和规模会显著提高风险。
- 关于水印/检测的讨论:OpenAI 提到了元数据和分类器;怀疑者指出元数据可以被剥离,并质疑其在现实中的有效性。
工作、经济与公平
- 大量讨论集中在 AI 挤压创意工作和白领工作,而体力劳动领域的变化则相对滞后。
- 有人把这视为创造力的民主化;也有人强调这会贬值创作劳动并削弱经济安全感。
- 强烈批评认为,这些模型很可能是在未经充分同意或补偿的情况下,基于海量现有媒体训练的,相当于把创作者的作品“武器化”来对付创作者。
- 有人提出对生成式 AI 重税,用于资助 UBI;反对意见则强调执行难度和全球竞争。
OpenAI 的姿态与开放性
- 多条评论指出,OpenAI 已从“开放”研究转向高度受控、商业化的发布方式,且技术细节披露很少。
- 有人认为出于安全和竞争原因,保密是合理的;也有人担心权力集中和监管俘获。
心理与文化反应
- 许多人表达了兴奋,以及亲历历史时刻的感觉;也有人描述了恐惧、恶心(字面上是因运动效果,隐喻上则是因其后果),并想回到更“人类化”的体验中(戏剧、现场音乐、书籍、自然)。
- 一个反复出现的主题是:人们不确定该如何在情感上消化如此迅速、可见的进展及其社会后果。