NY Times 版权诉讼要求 OpenAI 删除所有 GPT 实例

纽约时报对 OpenAI 和 Microsoft 的诉讼指称,其 AI 模型在未经许可的情况下使用了数百万篇受版权保护的 NYT 文章进行训练,且有时会逐字复现这些内容,如今还与该报依赖订阅的业务形成竞争。评论者们争论这种训练究竟属于受保护的“公平使用”,还是更接近大规模盗版,并将其类比为搜索引擎、人类学习和以往的版权案件,同时争辩付费墙和服务条款的作用。许多人预计,这起案件——或类似案件——将为生成式 AI 如何使用受版权保护内容设定关键法律先例,而其结果对大型科技公司以及更小规模或开源的 AI 努力都将产生重大影响。

NYT 诉讼的范围与目标

  • NYT 的要求:销毁基于其内容训练的 GPT 模型、删除训练数据集,并发布永久禁令以及支付巨额金钱赔偿。
  • 许多人认为这是一种最大化的开局策略,意在迫使达成许可协议,而不是真的要“杀死” GPT。
  • 有些人认为,时机与更广泛的 AI–出版商谈判有关(例如与 Apple 以及其他公司)。

版权、公平使用与抓取

  • 核心问题:将受版权保护的文章用于训练本身是否构成侵权,还是只有当输出与原文过于接近时才算侵权?
  • 关于公平使用因素的争论:
    • 目的/性质:具有变换性的学习 vs. 商业替代。
    • 内容性质:新闻部分属于事实性内容,但也包含创意表达。
    • 使用数量:模型吞入整个档案库。
    • 市场影响:LLM 是否会实质性替代 NYT 的读者或许可市场。
  • 抓取的合法性与 ToS:一些人引用先例,认为公开网页抓取可能是合法的;另一些人则指出付费墙、NYT 条款变更以及 robots.txt 都表明并未获得同意。

记忆、复述与技术修复

  • NYT 最有力的例子是对付费文章和首段的近乎逐字复现。
  • 一种观点:这证明模型“包含”了受版权保护的作品,训练更像是压缩式复制,而不是人类式学习。
  • 另一种观点:这些是罕见的过拟合边缘案例,可以通过降低温度、过滤器(n‑grams/bloom)、RLHF,或对来源进行预先摘要来缓解。
  • 额外担忧:模型会幻觉出虚假的 NYT 内容,从而引发诽谤和商标淡化方面的问题。

人类与机器的类比

  • OpenAI 的支持者将训练比作一个人阅读后再总结,或被 NYT“影响”,认为法律上不应因为架构不同而区别对待。
  • 批评者强调规模、可复现性和商业部署:数百万用户、自动绕过付费墙,以及一家企业将他人作品变现。
  • 反复反对“如果人类能做,模型也能做”这一推理,指出工具与人的法律处理不同。

经济、竞争与社会影响

  • 许多人预计最终会形成许可制度:大型出版商直接获得报酬,小型创作者可能通过资金池分配;LLM 访问会变得更昂贵。
  • 有人担心,强版权判决会让资金雄厚的公司(OpenAI、MS、Apple、Google)占优势,伤害开源和初创公司,并可能把前沿工作推向知识产权执法更弱的司法辖区。
  • 另一些人则认为,这种约束对于维持新闻业和创作劳动的激励,以及防止少数 AI 公司将网络价值私有化,是必要的。
  • 讨论串反映了对当前版权期限和范围的更广泛不满,但对 AI 训练是否应被明确划入合法公平使用存在尖锐分歧。