Nightshade:艺术家对抗 AI 绘图生成器的进攻性工具
一款名为 Nightshade 的新工具会故意“投毒”数字艺术作品,使在其上训练的 AI 图像生成器产生被破坏的结果,目标是让对艺术家作品进行未授权抓取的成本更高、吸引力更低。评论者争论这种技术防御是否能跟上模型改进以及去噪、预处理等简单对策,许多人认为这只是不可避免的猫鼠游戏的一部分。整条讨论更广泛地围绕版权、合理使用和权力展开:有人认为大型 AI 公司应被法律要求为训练数据付费授权,而另一些人担心过度监管会巩固既有巨头,并让开放、研究或无障碍导向的模型更难构建。
Nightshade 的目的与概念
- 该工具通过微妙的扰动对图像进行“投毒”,使自动标注器(例如 CLIP)在训练过程中误解内容。
- 目标:提高抓取未授权艺术作品的成本和风险,推动公司转向许可数据集,而不是直接“破坏”模型。
- 支持者将其视为与 robots.txt 或 “no‑ai.txt” 之类的退出信号相对应的“进攻性”工具。
有效性与技术批评
- 许多人怀疑它能否长期奏效:对抗性技巧往往依赖模型和版本,且可通过重新训练或预处理来击败。
- 有人认为,简单的去噪、下采样→上采样、img2img diffusion,或更强健的标注器(GPT‑4V、BLIP2、LLaVA)可能在很大程度上中和它。
- 也有人指出,可见伪影和细节损失会让许多艺术家难以接受,从而限制其在高质量作品集中的使用。
- 还有人建议,大型、带标注的“被投毒”数据集实际上可能帮助模型学习检测并避开这类伪影。
伦理、同意与数据所有权
- 立场分歧很大:
- 一方认为,在未获同意的情况下抓取公开图像用于商业训练是不道德的;像 Nightshade 这样的工具是正当自卫。
- 另一方认为,从公开可得的作品中学习(无论人类还是机器)是文化的一部分,应当被允许,尤其是用于非商业或具有社会效益的模型。
- 关于公司是否应被要求大规模许可训练数据的争论;有人声称这在经济上如今不可行。
法律不确定性与类比
- 关于合理使用、衍生作品,以及在受版权保护的数据上训练模型是否合法的持续争论。
- 类比对象包括:搜索引擎索引、音乐采样、Google Books、地图中的“陷阱街道”、DRM、恶意软件和 CAPTCHA。
- 有人预见法院或新立法会强制实行退出/加入、水印,或对商业与研究模型施加不同规则;也有人预计全球范围内会掀起放宽限制的“竞赛”。
对艺术家与文化的影响
- 担忧包括:人类创作艺术的贬值、生计流失,以及低价值“商品化”图像的泛滥。
- 反驳则称:生成式工具让图像创作民主化,将价值转移到策展和实体/表演性工作上,并且类似过去的技术变迁。
- 普遍预期是,投毒工具与模型训练者之间将持续展开猫鼠游戏式的军备竞赛。