《纽约时报》对微软和 OpenAI 提出强有力的诉讼理由
纽约时报就其文章被用于训练和驱动 AI 系统起诉微软和 OpenAI,已成为关于版权、合理使用与 AI 生成内容的未决问题的焦点。评论者剖析了从逐字复制和 DMCA 主张,到 AI 服务是否非法竞争或替代新闻机构等法律理论,并争论对受版权数据的训练是否应当需要许可,或应受合理使用保护。该案的结果被视为可能重塑 AI 开发者与内容生产者的商业模式,并对开源模型、全球竞争力以及未来版权制度产生影响。
NYT 主张的范围
- NYT 并不只是挑战训练本身;投诉针对的是:
- 能够逐字输出 NYT 文章或大段摘录的模型。
- “合成搜索”/浏览功能(Bing Chat、ChatGPT Browse),这些功能会实时抓取 NYT 内容并进行改写或引用。
- 未经许可使用 NYT 内容,包括据称移除版权管理信息(DMCA §1202)。
- NYT 将 OpenAI/Microsoft 描述为在创建可直接替代 NYT(包括 Wirecutter)的产品,从而损害其商业模式。
合理使用、训练与逐字复制
- 一种观点:对受版权保护文本的训练可能属于合理使用;大规模训练模型偶尔“复述”内容本身,不应自动构成侵权。
- 另一种观点:本案部分问题对 NYT 来说很“容易”,因为这些系统据称几乎逐字重现文章,或充当绕过付费墙的工具。
- 争论焦点在于:关键问题是“训练是否属于合理使用”,还是下游使用与市场替代(并引用 Warhol 先例中“使用不具变革性”)。
RAG、付费墙与竞争
- “落地”/检索增强生成据称会:
- 复制 NYT 页面(包括付费墙内页面),将其输入模型,再输出改写或长段引用。
- 去除署名和联盟链接(例如 Wirecutter),使 NYT 变成一个未获补偿的后端。
- 有人认为这类似 Google 摘要,可能属于合理使用;也有人指出 Google 会回链,并且在某些司法辖区已经支付授权费用。
责任、诽谤与幻觉
- 讨论串争论:幻觉生成的 NYT“引语”能否支持诽谤或商标主张:
- 有人认为,如果公司明知模型经常捏造内容,那么“实际恶意”或鲁莽漠视可能成立。
- 也有人认为这很薄弱:损害很难证明,而 LLM 输出本来就明确带有不可靠的免责声明。
- 对于把输出称为“谎言”“幻觉”还是“捏造”,存在强烈分歧。
人类与软件学习,以及人格性
- 另有大段讨论围绕“人类会从受版权保护作品中学习,所以 AI 也可以”这一类比是否成立:
- 一方认为:软件只是工具;只有人类/公司才能承担责任,而且规模与精确复制很重要。
- 另一方认为:如果在其他工具中,自动化人类可合法执行的行为是允许的(例如 Photoshop),那就不清楚为什么 LLM 应被区别对待。
- 还有关于公司人格、未来 AI 人格,以及人类在法律和道德上是否“特殊”的讨论。
经济、竞争与政策影响
- 一些人预计最终会以和解和授权机制收场(可能是集体许可或强制许可),而不是形成“扼杀 AI”的先例。
- 也有人警告:
- 严格的授权要求可能巩固大科技和大媒体的地位,把开源项目和小玩家排除在外。
- 美国若作出严格裁决,可能让放宽训练规则的司法辖区受益(例如提到日本/EU 的争论)。
- 若干评论者认为,NYT 的最终目的其实是争取更好的授权条款,而不是原则上反对 AI。
技术与开源说明
- 评论者讨论了:
- temperature=0 和精心构造的提示词如何使模型逐字复述;但在正常使用中这有多常见仍不清楚。
- 通过后处理(查重、强制引用、带明确链接的 RAG)来降低侵权的可能性。
- 有人预测,诉讼主要会伤害美国专有模型,而在美国法律触及不到的地区训练的开源模型和外国模型仍会继续推进。