法官驳回了书籍作者针对 ChatGPT 的大部分版权主张

美国一名法官驳回了书籍作者针对 OpenAI 的大部分版权主张,但主要保留了加州关于未经许可使用受版权保护作品进行训练的“非公平竞争”主张。评论者围绕用盗版或未授权文本训练大语言模型是否构成侵权展开争论,把长期以来针对媒体盗版的论点与如今大型 AI 公司获得的宽容态度相对照。这场讨论凸显了现有版权与合理使用原则如何适用于 AI 训练、人类学习与机器学习在法律上的不对称性,以及这可能对开源 AI 模型和职业作者带来的影响。

裁决范围与保留下来的主要主张

  • 许多人认为,关键的、仍然保留的问题是关于未经许可将受版权保护作品用于训练的州法“非公平竞争”主张。
  • 一些人认为文章标题具有误导性,因为即使大多数版权主张被驳回,这一剩余主张也可能具有非常重大的影响。
  • 有人指出,法官不愿仅凭一般性判断就把所有 LLM 输出都视为侵权,而需要将输出与特定作品建立具体联系的证据。

盗版、复制与合理使用

  • 围绕使用盗版副本进行训练是否应当明确违法,出现了强烈争论,尤其考虑到几十年来反盗版言论的背景。
  • 一方认为:下载/使用盗版副本实际上一直被默许;真正被执法的只是传播。
  • 另一些人反驳说,未经授权的复制(包括下载)本身就是侵权,只是很少被起诉,而且这里混淆了民事与刑事执法。
  • 还有人认为,如果训练属于合理使用,那么副本是如何获得的在法律上可能并不重要。

人类学习与 LLM 训练

  • 反复出现将其类比为人类读书:如果人可以从书中学习并随后进行创作,模型为什么不行?
  • 反方观点:法律将人类记忆视为“无形”的、不是“复制品”的东西,而计算机存储则是固定的、有形媒介。
  • 一些人坚持,人类认知在法律上是特殊的;机器不会自动继承这些例外或权利。

思想与表达,以及衍生作品

  • 大体上都同意,版权保护的是表达,而不是思想、程序或抽象概念(引用了美国法条措辞)。
  • 讨论举例:从科幻作品中汲取思想去构建现实技术是可以的;复制原文则不行。
  • 多条评论强调,应评估 LLM 输出是否存在实际复制/市场替代,而不只是看训练过程中是否摄入了受版权保护的作品。

经济与竞争层面的影响

  • 一派担心,若训练必须获得许可,会巩固那些能为海量语料付费的大公司优势;开源模型将受损。
  • 另一派认为,“直接付费”(书籍、新闻、图像)是公平的,而且会同样适用于所有参与者,因此本质上并不反竞争。
  • 也有人预计,如果需要许可,会出现类似 Spotify 的机制:媒体公司赚到数十亿美元,创作者得到很少,最终只有少数 AI 供应商存活。

被感知到的不对称与版权合法性

  • 有人对这样一种现象感到不满:过去用于针对个人的严厉反盗版论点,如今在面对大型 AI 公司时似乎被放软了。
  • 一些人认为,如果法院认可对未授权作品进行大规模训练,这实际上会削弱未来盗版案件中版权的合法性。

监管、未来法律与政策方向

  • 几位评论者认为,现有版权框架并不适合 LLM,新的立法势在必行。
  • 对于是否应创建特殊的“AI 训练权”或明确的训练例外,意见分歧。
  • 有人预测,强大的媒体利益集团不会允许对所有受版权保护作品进行“免费利用”;也有人希望能有狭窄的、专门针对 AI 的豁免。

训练数据的质量与来源

  • 少数人认为,书籍比一般网页文本更适合作为高质量训练数据,并指出许多人也依赖盗版电子书。
  • 另一些人强调,如果要使用书籍,AI 公司应当合法获取和/或获得授权,而不是抓取盗版副本。