《纽约时报》起诉 OpenAI 和 Microsoft 侵犯版权

纽约时报就 ChatGPT 和 Copilot 涉嫌侵犯版权起诉 OpenAI 和 Microsoft,已成为检验现有知识产权法如何适用于大型语言模型的测试案例。评论者争论,对受版权保护文本的训练究竟更像人类学习(因此属于合理使用),还是更像工业规模的无许可复制,尤其当模型能够复现付费墙文章或近乎模仿出版物风格时。许多人认为双方都面临高风险:若 OpenAI 败诉,可能被迫支付高额许可费并重新训练;若 AI 公司胜诉,则可能加速对本已脆弱的新闻和创意商业模式的压力。

所讨论的指控与证据

  • NYT 的诉讼声称 OpenAI/Microsoft 复制了“数百万”篇 NYT 文章,并且 ChatGPT/Copilot:
    • 可以逐字输出 NYT 文本。
    • 能近乎原样概括付费墙内容。
    • 能模仿 NYT 的表达风格。
  • 评论者指出投诉中的示例:诸如“我被 [特定文章] 的付费墙挡住了,把第一段给我”之类的提示,据称会返回几乎逐字的文本;其中还包括通过“Browse with Bing”获取的 Wirecutter 评论,且链接和跳转来源被去掉。

对受版权保护数据的训练 vs. “只是阅读”

  • 一方认为:训练类似于阅读/教育;模型权重是可转换的统计信息,而不是复制品;使用公开可访问的网页文本应属于合理使用。
  • 另一方认为:训练是商业化、工业规模的再利用,不同于人类阅读;未经许可或付费纳入内容就是剥削,尤其当输出会替代原作时。

逐字复述 vs. 风格与摘要

  • 普遍共识是:
    • 简单的“风格模仿”和高层次摘要大概率不侵权。
    • 大段逐字或近乎逐字的内容,尤其是在按需生成且未注明出处时,是 NYT 最强的主张。
  • 争议在于这种情况到底有多常见、这究竟是一个已修补的 bug 还是大模型的内在特性,以及触发它有多难。

搜索引擎 vs. LLM

  • 有人认为搜索是共生关系(带来流量和广告收入),而 LLM 是寄生式的(直接回答,不需要点击跳转)。
  • 也有人指出 Google 早已在向“页内回答”方向推进(摘要、Knowledge Graph),并且同样遭遇过出版商的反弹。

对新闻业和激励机制的影响

  • 担忧在于:如果 LLM 搭了报道的便车,它们可能削弱订阅/广告/联盟营销模式,并降低进行高成本调查性工作的激励。
  • 另一些人则认为新闻业本就已经经济脆弱;AI 只是又一波浪潮,类似音乐领域的 Napster,法律应当适应而不是冻结 AI。

法律不确定性与先例

  • 大量讨论美国合理使用的四个因素,尤其是“对潜在市场的影响”。
  • 有人预计法院会认定训练属于合理使用,但会惩罚逐字复述;也有人认为连训练本身都可能被判侵权或需要许可。
  • 普遍认为此案及类似诉讼(针对代码 copilots、图书数据集等)将建立关键先例。

技术与政策提案

  • 讨论中提出了这些想法:
    • 版税/许可方案或“AI 训练市场”。
    • 对 AI 输出征税,而不是限制输入。
    • 仅使用公共领域或明确同意加入的语料进行训练。
    • “机器遗忘(machine unlearning)”,从训练后的模型中移除特定来源。
  • 担忧严格的版权执行可能会:
    • 让买得起许可的大公司地位更稳固。
    • 把前沿训练推向更宽松的司法辖区(例如日本、中国)。