Stable Cascade
Stable Cascade 是 Stability AI 基于 Würstchen 架构推出的新文本生成图像模型,它通过在高度压缩的潜在空间(空间压缩约 42 倍)中运行,承诺比 SDXL 更好的提示词遵循能力和更快的生成速度。评论者在图像质量、硬件需求和内存占用之间权衡利弊,指出虽然它可以在 CPU 和中低端 GPU 上运行,但认真本地使用仍然会受益于高 VRAM 显卡和各种卸载技巧。这次发布也重新引发了关于 Stability AI 对模型权重采用非商业许可、其作为 VC 资助企业的可持续性,以及 ComfyUI 和网页服务等流行 UI 能多快集成新模型的讨论。
性能与硬件需求
- 许多用户反馈 Stable Cascade 比非 turbo 的 SDXL 快 2–3 倍,而且对于机器人和日常使用来说已经“足够快”。
- 提示词遵循能力广受好评;整体视觉质量目前被认为略低于顶级 SDXL 模型。
- 对 VRAM 的需求存在争议:一条泄露的说明提到最大配置大约需要 20GB;也有人说在 FP16 下每个阶段约需 6GiB,但当前代码并未针对内存进行优化。
- 建议按顺序加载/卸载各阶段(C → B → A),以适配 8–12GB VRAM;PCIe 带宽使交换开销相对温和。
- 仅 CPU 推理是可行的,但每张图常常需要很多分钟到数小时;有人表示即便经过大量优化(BLAS、jemalloc、线程调优),仍然受限于内存带宽。
- 较旧或低 VRAM 的 GPU(2–4GB)被认为只能勉强使用;带有大共享内存的集成 GPU 有时反而更实用。
架构、压缩与能力
- 基于 Würstchen 构建:在高度压缩的潜在空间中运行(空间压缩约 42 倍),从而加快训练和推理。
- 讨论中澄清,这是一种有损的“抽象”,而非传统意义上的图像压缩;解码器阶段更像一种高级、会“幻觉”的编解码器。
- 人们推测其可应用于视频编解码和超分辨率,并指出在更高 batch size 下表现很强。
- 有人提出将提示词遵循和“adherence-fix”串联(例如 Cascade → SDXL/refiner)作为工作流。
- 已知限制仍然存在:模型在计数和结构化物体方面仍有困难(钢琴键、球的正确数量)。
许可、商业模式与伦理
- 代码采用 MIT 许可;模型权重则以“技术预览”的形式采用非商业许可。
- 早期一次提交短暂地把整个仓库显示为 MIT 许可,引发了争论:
- 一种观点认为:那个快照仍可按 MIT 使用;许可不能被追溯撤销。
- 另一种观点则认为:错误许可可以撤回;法院可能会把它视为文书错误,而且并没有明确的判例法。
- 非商业条款与建立收入模式的需要有关,也用于防止大型商业玩家免费搭便车。
- 有人主张为模型和数据集设计一种更适合的“类似 GPL”或 Creative Commons 框架。
- 讨论串提到 VC 的高额投入、盈利前景不明,以及会员制、定制模型和托管服务等新兴策略。
生态系统与工具链
- 用户提到 ComfyUI、Auto1111、fal.ai、Hugging Face Spaces 以及其他前端已经快速支持或计划支持。
- AMD 支持已经存在,但性能和稳定性仍落后于 NVIDIA;一些人认为 AMD 未来可能成为价格性能方面的竞争者。