Stable Diffusion 3
Stable Diffusion 3 是 Stability AI 最新的开放图像生成器版本。它因清晰的文本渲染、复杂的空间推理以及基于类似 OpenAI Sora 的新扩散 Transformer 架构所带来的写实输出而受到称赞。评论者热切期待其最终开放权重发布,并讨论在硬件需求、许可以及微调便利性(尤其是 NSFW 和小众风格)上的取舍,是否会让它取代广泛使用但更老的 SD 1.5。讨论中很大一部分聚焦于“安全”防护:一些人认为它们有助于限制深度伪造、滥用和法律风险,而另一些人则认为它们主要是在保护公司声誉、过度审查无害内容,并可能把强大的通用工具变成受严格控制的服务。
图像质量、文本与能力
- 很多评论者认为样图“惊艳”,其中文本渲染尤其更好(招牌、标题等都能读),被视为相较之前的 SD 模型以及 Midjourney/DALL‑E 的重大进步。
- 一个广为分享的例子(“蓝色立方体上的红色球体,绿色三角形,猫/狗在左/右”)让人印象深刻:空间关系、光照和全局照明看起来都比旧模型准确得多。
- 也有人提到偶尔会出现构图怪异之处(例如公交车的透视),并强调在大量提示词上的可靠性仍未知。
架构、性能与硬件
- SD3 使用扩散 Transformer(DiT)加上 flow matching,精神上类似于 Sora。
- 目前模型规模为 800M–8B 参数;较小版本面向移动端/边缘设备,较大版本面向高端 GPU。人们讨论量化和批处理,以及消费级 GPU(例如 12 GB 显存的卡)是否仍然可行。
- 许多人期待,只要有足够的训练数据和 GPU,这种架构也能扩展到视频和 3D。
安全、审查与滥用
- 发布公告的措辞非常“安全导向”,引发了大量争论。
- 一派认为:安全 = 公司/企业保护(公关、诉讼、监管机构、支付处理商),而不是用户安全。可预期的护栏主要是为了避免 CSAM、未经同意的深度伪造色情、政治/名人滥用以及种族主义输出。
- 另一些人则认为,安全确有必要,以防骚扰(例如学校深度伪造)、诈骗(伪造文件)和与选举相关的深度伪造。
- 也有人批评“安全”是对裸体的清教徒式执念,并可能成为更广泛意识形态控制或“思想犯罪”的载体。
- 还有人指出,对于嵌入式使用者(应用、内网)来说,拥有一个绝不会意外输出色情或血腥内容的模型确实很有用。
NSFW、微调与开放发布
- 历史上:SD 1.5 很快衍生出强大的 NSFW 微调;SD 2.x 因更重的审查和 CLIP 变更而普遍不受欢迎;SDXL 很受欢迎,但仍被认为更“保守”。
- 一些 API 用户表示过度模糊的问题很严重(例如温和的人物肖像也被处理),使得 SaaS 版本不如本地模型好用。
- 普遍预期是:一旦 SD3 权重发布,社区会出现微调版本(包括 NSFW),尽管安全技术可能更难被“还原”。
许可、开放性与商业
- SD3 承诺在预览期后以“开放”形式发布,但确切许可证尚不清楚;近期模型(例如 Stable Cascade)限制商业转售,一些人称之为“限制性”条款,另一些人则认为这很合理。
- 讨论中提到 Stability 需要变现(API、企业)以及完全开放权重与可持续商业模式之间的张力。
与其他模型的比较
- 与 Gemini 相比:SD3 被认为技术范围更窄(只做图像),但政治约束可能更少;Gemini 的“多样性”失败经常被拿来作参照。
- 与 Midjourney 和 DALL‑E 3 相比:SD 因本地可控性和生态系统(ComfyUI、LoRA、controlnet)而受赞扬;不过也有人仍觉得 Midjourney 开箱即用时能产出更好看的“艺术感”作品。