Flux 3
Flux 3 是一款新的多模态生成模型发布,目标是统一视频、图像、音频和动作预测;它引发了褒贬不一的反应。一些人对其表面上的视觉质量以及在电影制作、机器人和消费级硬件本地使用方面的潜力感到印象深刻;批评者则质疑其营销说法,指出缺少长时间、真实的人物片段,对“world model”等术语的使用也较为宽泛,并且对其承诺的开放权重版本相较于专有系统究竟有多强仍存疑问。这场讨论也反映出人们对 AI 生成媒体“slop”的普遍不安,以及它对创意和技术领域劳动的影响,还有越来越强大的合成视频工具所带来的社会风险。
发布演示与宣传
- 许多评论者觉得这次发布“很奇怪”或令人失望:几乎没有有人物的示例,没有长时间连续片段,很多跳切,而且尽管有相关说法,却看不到清晰的 20 秒序列。
- 有些人表示提供的片段(例如 FPV 摩托车)看起来惊艳,甚至真假难辨;但也有人仍然看到了模糊、缺乏细节,以及“没有生气”的结果。
- 几位评论者注意到,逼真的人脸连续出现超过几秒的内容很少;原因不明(可能是安全/审核、技术限制,或者只是演示选择)。
- 营销文案被批评为千篇一律的“LLM slop”,这让一些人很快失去兴趣。
- “world model”和“multimodal”等术语的使用引发了争论;有人认为这些词已经被稀释成流行语,也有人认为这里的用法(共享潜变量、逆动力学、视频+音频+图像+动作)是合理的。
开放权重、质量与硬件
- 提供开放权重的多模态骨干模型(“FLUX 3 Dev”)对许多人来说是一个重大积极因素,尤其是爱好者和小团队。
- 先前的 Flux 2.x 开放模型在一些人看来,已经接近本地可运行模型中的 SOTA;但也有人表示,它们在提示词遵循和图像质量上明显落后于顶级专有系统。
- 有人担心“Dev”模型可能是 cfg 蒸馏或以其他方式被“削弱”,从而降低微调效果。
- 之前的问题包括较高的 VRAM 要求、更慢的推理速度和限制性的许可证;人们希望 Flux 3 能改善 VRAM 使用,同时保持有竞争力的质量。
- 大家也对 3D 生成和面向机器人能力(空间推理、动作预测)很感兴趣,而开放权重在这些方面目前落后于闭源模型。
使用场景与更广泛影响
- 有些人认为 Flux 3 对电影制作人和 VFX 流水线尤其相关,而不是面向廉价“slop”内容,尤其是在高端视频质量和行业顾问的加持下。
- 也有人对“家用”SOTA 感到兴奋:在消费级 GPU 上实现强大的本地图像/视频生成。
- 一些评论者对文本到图像/视频持悲观态度:他们把它与低成本的“AI slop”、操纵性的政治内容以及在线媒体质量下降联系在一起。
- 这也牵涉到更广泛的 HN 争论:AI 疲劳、负面情绪上升、工作安全感下降,以及关于社会影响的批评是否应该与技术讨论放在一起。
- 也有人将此与真正积极的应用作对比(例如实时通用翻译),认为尽管存在反弹,当前 AI 已经具有变革性。