Stable Video Diffusion

Stable Video Diffusion 是 Stability AI 新推出的开源图像到视频模型,它让拥有足够 GPU 显存的人也能生成相对高质量、时间一致的短视频片段,从而吸引了大量关注。评论者对从静态图像扩散快速迈向视频的进展感到惊讶,但也指出了当前限制:显存需求高、时长短、闪烁和细节不一致,以及精确编辑或场景控制工具薄弱。此次发布也重新引发了对非商业许可证可执行性、在错误信息和色情内容中的潜在用途,以及对电影、3D 场景生成和个性化媒体的长期影响的担忧。

模型发布与使用

  • 两个 Stable Video Diffusion 变体的权重已在 Hugging Face 上公开可用,并附带自定义的非商业许可证。
  • Stability 的 generative-models 仓库中有官方脚本,但评论者认为与 notebooks 相比,CLI 工作流显得笨拙。
  • 当前模型是图像到视频;文本到视频则被预告为“稍后推出”。

硬件与工具

  • 许多人表示默认配置需要约 40GB VRAM;24GB 显卡可以通过减少并行帧数来运行。
  • 一些托管服务(例如网页 UI)已经在封装该模型,以避免本地安装;有时需要 Google 登录来限制滥用。
  • Mac M 系列的性能以及微调可行性也备受关注,但目前还没有明确的基准测试。

许可与合法性

  • 围绕模型权重是否受版权保护、以及非商业许可是否可执行展开了长时间讨论。
  • 一种观点认为:许可证就是合同;违反使用条款会带来民事责任,尤其是对企业而言。
  • 另一种观点认为:如果模型本身不受版权保护且发生泄露,那么从未同意条款的下游用户就可能不受限制。
  • 法院会如何将模型输出视为衍生作品尚不明确;这被认为是一个开放的法律问题,更像风险权衡而非已定论。

时间一致性与技术挑战

  • 时间一致性(无闪烁、细节稳定、运动连贯)被视为生成式视频的主要未解难题。
  • 现有工具如 ControlNet 和 AnimateDiff 有助于姿态/运动控制,但速度较慢且仍会抖动;跨帧注意力和其他技术很有前景,但并非“已解决”,尤其是在复杂运动和长片段上。
  • 时间/3D 卷积以及“时间层”被强调为架构上的“特殊调料”。

编辑、控制与 3D 流水线

  • 许多人希望能进行迭代式、基于指令的编辑(例如“把自行车移到左边”),而不是一次性生成。
  • 目前的部分解决方案包括:inpainting、image-to-image、负面提示词、基于指令的编辑器(如 InstructPix2Pix、Emu Edit/Video),以及主流套件中正在出现的交互式工具(如 Adobe)。
  • 不少人认为未来会是通过 Blender 之类的引擎渲染的文本到 3D 场景生成(对象、光照、相机),从而实现精确编辑和物理一致的光照;也有人指出数据稀缺和格式复杂性是主要障碍。

感知质量与应用

  • 反应从“令人着迷的飞跃”到“只是会动的明信片”不等。许多人注意到伪影、光照错误和运动不对齐。
  • 共识是:它很适合短的 GIF 式循环、标题和实验;但距离稳健的长篇、角色一致性视频还有很大差距。
  • 预期用途包括:色情、库存视频、营销、对现有素材的风格化重混,以及最终更沉浸式或交互式的媒体。
  • 有些人担心错误信息;也有人认为由于伪影明显,短期影响不会太大。

更广泛的 ML 进展与未来影响

  • 讨论了近期进展的推动因素:transformers、attention、diffusion、充足的数据、GPU 可用性(包括加密货币热潮之后)、大型基础模型,以及巨额资本押注。
  • 对时间线的看法不一:有人预计十年内会出现大片级 AI 电影;也有人认为最后那 1% 的质量和叙事最难,且还要更久。
  • 一种可能的模式是:为工作室带来生产力提升,同时低质量内容泛滥,而受众则会“向质量迁移”。

哲学插曲:模拟假说

  • 旁支讨论提出,越来越逼真的生成模型是否会加强“现实可能是模拟”的想法。
  • 回应强调:目前连单个细胞都无法完整模拟,所需算力极其庞大,而且这一假说本质上不可证伪,带有准宗教性质。