Lumiere:用于逼真视频生成的时空扩散模型
一项新的 Google 研究项目 Lumiere 展示了一种视频扩散模型,能够生成短而出人意料地连贯的、由文本驱动的视频片段,并执行修补和宽高比扩展等任务。评论者对质量提升的速度印象深刻,并预见它会对广告、动画、色情内容和创意工具等领域产生重大影响,同时也指出这类模型很可能会被用于深度伪造和 AI 生成的“噪音”。不过,许多人也对 Google 不透明的演示、长期不发布或仅限产品化的历史,以及围绕训练数据和滥用的法律与伦理问题表示怀疑。
对 Lumiere 能力的总体反应
- 许多人认为这是迄今为止最先进的文生视频模型:更长、更连贯的片段;更少像脚部滑动这类伪影;与之前的工作相比,运动和一致性都令人印象深刻。
- 但也有人仍然觉得这些视频明显是合成的:带有“梦境感”、模糊,人物面部也较弱;那种“AI 感”有点像现代 CGI,总是无法完全让人觉得真实。
- 还有几位指出,2–5 年前这看起来会是不可能的;他们把这种进步速度描述为惊人,甚至“可怕”。
对 Google、开放性与可复现性的担忧
- GitHub 仓库只托管了项目页面;没有发布模型、代码或权重。评论者批评用 GitHub 承载非开源工作的做法。
- 很多人强烈认为,既然它来自 Google,要么永远不会发布,要么多年后才会以封闭的云 API 形式出现,或者实际上就会“烂在架子上”。
- 人们在 Gemini 视频争议之后对 Google 的 AI 营销缺乏信任,并质疑 Lumiere 演示中有多少是精心挑选的。
- 有人认为,如果没有可复现的产物,这项工作不应被当作真正的科学;也有人回应说,核心思路仍然有价值,而且会被其他人重新实现。
技术讨论
- 关键设计:先生成完整的低分辨率时空表示,再在空间和时间上进行上采样;这有利于时间一致性,但目前限制了片段长度。
- 建议包括:通过拼接重叠片段生成更长视频;把“一致性”当作单独阶段;扩展到 3D 世界或 VR 场景生成。
- 讨论还涉及这类模型究竟是真的学到了 3D 结构,还是只是在伪造它;有人提到已有工作显示扩散模型内部存在深度/场景表示。
用途、影响与风险
- 预计早期采用者包括:电视和制药广告、YouTube 内容、广告 CGI、前期可视化/分镜、宽高比转换(例如 4:3 → 16:9)以及 TikTok/IMAX 重制。
- 很多人预测中等水平的创意岗位会受到重大冲击(素材图片/视频、广告制作、VFX、部分动画师),而高端专家和独立创作者更可能被增强,而不是被取代。
- 反复出现的预期是,一旦这类模型广泛可用,色情内容以及深度伪造/滥用内容会爆炸式增长。
- 一些人认为 AI 视频会侵蚀人们对视频证据的信任;另一些人则认为,这可能推动社会形成更健康的怀疑态度和来源核验习惯。
伦理、法律与内容审核
- 关于使用受版权保护数据训练的争论:当前是否合法、是否适用“合理使用”,以及未来是否会有新立法迫使进行授权许可。
- 现有 AI 产品中过于严格的安全过滤也引发不满;一些用户转而使用越狱手段,并希望有更少审查、更“原始”的模型。