用于训练 Midjourney AI 的艺术家数据库引发批评
一份据称泄露的 16,000 名艺术家姓名列表,与 Midjourney 的提示系统相关,重新引发了人们对生成式 AI 模型如何未经同意使用受版权保护艺术作品进行训练的担忧。评论者讨论 AI 生成图像是否应具备版权、如何区分“AI 辅助”与“AI 创作”的作品,以及未来监管究竟能否真正保护艺术家,还是只会让买得起授权数据集的大型平台更加稳固。有人认为这场变化类似过去的自动化浪潮,是不可避免的技术冲击;也有人则主张,能够复述训练数据的模型已经越过了法律与伦理边界,最终法院必须对此作出回应。
AI 生成作品的版权状态
- 一些评论指出,在美国,完全由 AI 生成的图像目前无法获得版权;只有混合作品中由人类创作的部分才受保护。
- 也有人强调这问题很复杂:美国版权局允许登记 AI 辅助作品,只要人类贡献足够具有创造性,但不允许将 AI 作为主要作者的作品登记版权。
- 争论点在于,写提示词再加上筛选与迭代,是否足以构成作者身份;有人认为这类似摄影或 Photoshop,也有人认为单靠一个提示词并不足够。
- 界限并不清楚:AI 衍生图像要经过多少“修饰”或编辑才可获得版权,仍然很模糊。
执行、检测与来源溯源
- 许多人认为,笼统地规定“禁止 AI 艺术”或“AI 艺术属于公共领域”在实践中无法执行,因为 AI 输出很难检测,尤其是在被编辑之后。
- 有人提出将默认规则反转(假定是 AI 作品,除非证明不是),并要求创作者保留制作过程的证据;批评者认为这对大多数艺术家来说负担过重,也不现实。
- 还有人建议为数字艺术建立经过加密认证的编辑历史;另一些人则指出,这些机制可能被钻空子,且跨不同媒介类型会带来繁重负担。
训练数据的合法性与伦理
- 关于使用受版权保护作品训练模型究竟是合法的“合理使用”还是彻头彻尾的盗窃,存在强烈分歧。
- 有人认为模型就像压缩;只有当用户强行要求逐字复述时才构成侵权。回应者则表示,记忆研究表明模型确实会存储受保护作品,因此权重本身就可能构成侵权。
- 讨论还涉及输出在多大程度上可称为“衍生作品”、如何为数百万训练样本分配价值,以及艺术家是否应获得版税。
Midjourney 艺术家名单的具体情况
- 多位评论者指出,这份 16,000 位艺术家的名单并不是实际训练集,而是事后整理出的名单(从 Wikipedia 等来源抓取),用于优化风格提示词。
- Midjourney 被描述为是在广泛的“所有内容”上训练的,而不只是针对这些艺术家;不过,这种大规模抓取本身也受到批评。
经济与政策影响
- 有人认为,由于开源模型激增以及宽松司法辖区的存在,这场争斗已经输了;也有人以 Napster/Spotify 为例,认为法律和许可机制可以重塑实践。
- 也有人担心,更严格的知识产权规则会让能够购买海量授权数据集的大型既有企业受益,进一步集中权力。
- 讨论还将其与历史上的自动化(卢德运动、机械织机)相比较;争议仍在于,这究竟是类似的技术转变,还是因为它需要大规模、未经同意的复制而具有独特的剥削性。