《纽约时报》要求销毁所有使用 Times 数据训练的 LLM
《纽约时报》针对 OpenAI 和 Microsoft 的诉讼要求销毁使用 Times 文章训练的 AI 模型,这引发了关于版权如何适用于大语言模型的更广泛争论。评论者在争论:对受版权保护文本的训练,应被视为类似人类学习和合理使用,还是视为未经补偿、规模巨大的利用,损害了那些作品可能被逐字复述的创作者。许多人预计法院会把重点放在模型输出和市场影响上,而不是单看训练本身;可能的结果包括许可和版税,更严格的限制则可能巩固大型科技公司的地位,并重塑未来 AI 系统的构建方式。
诉讼范围与“销毁模型”要求
- 讨论围绕《纽约时报》针对 OpenAI/Microsoft 的诉讼,以及要求删除使用 Times 内容训练的模型展开。
- 多位评论者认为,法院只能对被点名的被告作出救济,不能针对“所有 LLM”下令,因此广泛销毁的请求更多是修辞上的施压。
- 也有人认为,这起诉讼是必要的反制,因为个体创作者负担不起类似诉讼。
训练受版权保护材料的法律状态
- 普遍指出,合法性尚未定论;多起正在进行的诉讼预计将澄清训练是否属于合理使用。
- 一方观点:训练 = 阅读/学习;版权限制的是复制,而不是学习或记忆观念。有人类比学生、搜索引擎,以及 ISP/浏览器缓存。
- 另一方观点:LLM 是商业工具,不是人;把它们当成人类来对待具有误导性。未经许可大规模使用受版权保护的文本牟利,被视为侵权或盗窃。
- 争论还包括:如果模型能输出几乎逐字的文本,那么模型权重本身是否可以算作作品的“复制品”。
输出、复述,以及可能的补救措施
- 大致共识是:逐字或近乎逐字复现付费墙后或受版权保护的文本,在法律上风险很高。
- 提议的技术修复包括:用后置过滤器将输出与《纽约时报》文本进行比对;不使用 NYT 数据重新训练;或让模型无法复现长段落。
- 有人认为,侵权应当附着于具体输出及其用户,而不是模型本身的存在。
伦理与经济视角
- 观点分裂明显:
- 一些人认为 LLM 是工业规模的剽窃,会伤害记者、艺术家和程序员,并进一步加剧财富集中。
- 另一些人认为,它们只是另一层技术(如 VCR、工业化或文字处理器),建立在既有文化之上,并最终提高生产力。
实践与战略影响
- 不使用 NYT 内容重新训练被描述为极其昂贵,几乎接近从头开始。
- 许多人认为许可授权是最终结局,但担心这会开创先例,引发大量类似索赔,并偏向拥有专有数据的大型既有企业。
- 有人建议使用公有领域模型,或强制实行许可/版税方案;也有人更激进地提议,强制模型,甚至所有已发表作品,都必须可用于训练。