我们追踪了一批稀有书籍的货运。它最终到了亚马逊的 AI 训练设施

亚马逊被追踪到购买了大量所谓“稀有”的二手书,这些书最终被送往用于 AI 训练的设施,据称实体书会被销毁。评论者争论这究竟是文化破坏,还是过度反应,因为许多此类书其实是冷门、低需求的手册,本来也可能被打浆;同时也指出,现行版权法反而在激励私下、具破坏性的数字化,却阻碍公开保存。讨论还引发了对长期知识流失、信息被集中在企业 AI 模型中的更广泛担忧,以及关于缩短版权期限、公共数字化项目,或要求保存并最终释放扫描文本的改革呼吁。

“稀有书籍”究竟是什么意思,以及损失有多严重

  • 许多人指出,“稀有”这个词用得很宽泛:可能只是印量少、外语书、旧手册,或过时的技术书,而不一定是无价的初版。
  • 怀疑者认为,文章之所以不公开书名,是因为那些书其实很平常(例如 1990 年代的软件指南),并把这种愤慨称作人为制造的点击诱饵。
  • 也有人反驳说,即便是冷门或小众作品(地方史、布道文、手册、期刊)也可能变得具有历史价值,或对特定研究具有独特重要性。

破坏性扫描、版权与法律背景

  • 一些评论把这种销毁直接归因于版权策略:在至少一宗美国案件中,扫描并销毁购入副本已被视为合理使用(Bartz v. Anthropic)。
  • 争议在于判决究竟允许什么;有人说法律上必须销毁,有人则说这只是增强了合理使用的论点。
  • 还有强烈批评认为,版权法如今正在激励私下进行破坏性的数字化,却惩罚像 Google Books / Internet Archive 这样的公开数字化努力。

保存 vs. 销毁与访问

  • 一方认为:AI 实验室保存了原本会被送去填埋的内容;图书馆一直在淘汰书籍,遗产继承人会丢弃藏书,出版社也会把书打浆。
  • 另一方认为:在模型权重里“保存”并不算保存——没有逐字文本、没有出处,而且专有模型可能消失或被修改。
  • 还有人担心,多家 AI 公司为了争夺同一日益枯竭的资源池,可能会销毁某些作品最后的实体副本,而不会留下公开记录,也没有保证会释放扫描件。

冷门纸质数据对 AI 的价值

  • 支持者认为:书籍通常比网页包含更高质量、更深入的写作;前沿 LLM 的工作普遍认为“更多样的数据”显然有益。
  • 怀疑者则认为:这些绝版冷门书籍的边际价值,与现有数字语料相比微乎其微;这看起来更像竞争性的囤积,而非必要。

图书馆、市场与规模

  • 许多人指出,在 AI 之前就已经存在大规模的书籍销毁,尤其是图书馆的清理和旧货店的倾倒。
  • 也有人回应说,受 AI 驱动的扫描在性质上不同:规模工业化、针对未数字化作品,而且没有公开编目。

企业激励与可能的补救措施

  • 人们反复担心私有的知识“围墙花园”以及静悄悄篡改数字记录的能力。
  • 提出的缓解办法包括:
    • 承诺在版权到期后把扫描件存入公共信托。
    • 公开已扫描/已销毁书名清单。
    • 通过国家图书馆进行政府资助的大规模数字化。
    • 版权改革(缩短期限、把保护与“在售”状态挂钩、批量许可 / clean rooms)。

对文章及媒体叙事的反应

  • 有人称赞这篇调查追踪了批量购书商的供应链。
  • 也有人批评 404 Media 的语气像愤怒诱饵,细节不足(没有书名、价格或数量),让人难以判断其伦理分量。