法官批准 Anthropic 为用于训练 Claude 的盗版书籍支付 15 亿美元和解金

美国法官已批准一项 15 亿美元的和解协议,要求 Anthropic 为使用盗版电子书训练其 Claude AI 模型支付每本约 3,000 美元,同时确认用合法获取的书籍训练属于合理使用。评论者对这究竟是有意义的补救,还是仅仅一种让大型 AI 实验室得以通过支付“经营成本”来挤出小玩家的做法,存在尖锐分歧。讨论进一步延伸到对现代版权执法的批评、出版商与作者在补偿中的分配角色,以及当 AI 系统学习并可能复述人类创作时,现行法律是否足以保护创作者。

裁决的范围

  • 讨论反复强调:法院批准的是针对 盗版 的和解,而不是针对“使用书籍进行训练”的和解。
  • 用合法获得的书籍训练 LLM 被认定为合理使用;侵权行为在于保留了一个庞大、中心化的盗版电子书库(例如来自 LibGen)。
  • 另外,Anthropic 还购买了数百万本纸质书,对其进行破坏性扫描,并丢弃原件;法院认定这属于合理使用,因为副本仅供内部使用,而且纸质书已付费购买并被销毁。

和解金的规模与意义

  • 15 亿美元(约每本书 3,000 美元)被一些人视为轻罚,只是近万亿美元公司的“经营成本”。
  • 也有人认为,这大约是购买这些书成本的 100 倍,因此作为民事赔偿是合理的,尤其因为它避免了审判风险。
  • 常见提法是:符合条件的每个标题中,作者与出版商大致五五分成;律师拿走相当可观但较少的份额;集体诉讼代表得到小额奖金。
  • 许多人指出,这只是自愿的民事和解,不是刑事案件;这里从来就没有坐牢的风险。

合理使用、记忆与衍生作品

  • 一派观点认为:训练类似于人类从书本中学习;LLM 通常不会逐字输出整部作品,因此这属于“具有变换性”的合理使用。
  • 另一派观点认为:模型在某些情况下会大量复述受版权保护的长段落,甚至近乎逐字复现整本书,因此把这称为“具有变换性”很可疑。
  • 争论还包括:模型带来的盈利是否应触发版税或利润分成,以及输出是否构成“衍生作品”。

收益与损害的分配

  • 作者通常收入很低;很多书连预付款都赚不回来。有人说每个标题 3,000 美元比许多作者一生能拿到的还多;也有人认为,相比 Anthropic 的收益,这只是象征性赔偿。
  • 有人担心大部分钱会流向出版商和律师,而不是单个作者。
  • 还有几条评论认为,这一结果会巩固大型实验室的地位:只有资本充足的玩家才能承担大规模购书和法律风险,这提高了开源和小规模模型的门槛。

更广泛的版权与政策争论

  • 对版权价值存在激烈分歧:有人希望缩短甚至废除版权;也有人认为版权对资助创作工作至关重要。
  • 有人提出对训练数据收取持续版税,甚至采用类似公用事业的资金模式;也有人坚持,如果使用了受版权保护的作品,就应该开放权重发布。
  • 还有人对感知到的双重标准感到愤怒:个人曾因盗版被毁掉,而公司如今只需支付可承受的和解金,却仍保留其模型。