OpenAI 与新闻业

OpenAI 对《纽约时报》版权诉讼的回应重新点燃了关于使用在线文本训练大语言模型是否构成合理使用的争论,尤其是在模型偶尔会逐字复现付费墙或受版权保护材料的情况下。评论者围绕关键的法律与伦理问题展开争论:如果未经同意抓取数据进行训练是允许的,复述是否能被视为“漏洞”而不予理会,AI 对新闻业及其他创作者的商业影响有多大,以及退出机制或技术过滤是否真正能解决这些担忧。许多人认为,这是一个可能成为先例的时刻,或将重塑 AI 的开发实践,以及在互联网上创作原创内容的经济激励。

合理使用与训练数据

  • 围绕是否对受版权保护的文本进行训练属于合理使用,存在重大争议。
  • 一些人认为这显然具有变换性,并与先前案例类似(例如大规模图书扫描 / 搜索)。
  • 另一些人则认为,使用他人的作品来打造竞争性产品并不属于合理使用,尤其是在使用盗版或付费墙内容时。
  • 围绕“公开可获取”是否排除付费墙或部分付费墙来源(如大型报纸)展开争论。

复述 vs. 变换

  • 许多人接受训练可能属于合理使用,但认为逐字复述显然构成侵权,无论意图如何或出现得多么罕见。
  • 另一些人认为,如果人类可以合法地回忆或转述,那么 AI 也应被同样对待;反驳观点是,大规模、自动化复制在根本上不同。
  • 提出的问题是:如果复述比例低于 1%,这是否会实质性削弱“模型会替代阅读原始来源”的主张?

法律类比与责任

  • 有人将其类比为:
    • 在公共场合背诵文章。
    • Google/YouTube/Dropbox 在 DMCA 安全港下托管用户内容。
    • 一位“天才”凭记忆复现书籍,而不是摘要/分析。
  • 有人表示,推理输出并不属于 DMCA 意义上的“用户生成”,因此平台不受该保护。
  • 关于责任应由谁承担存在争论:工具制造者,还是下游用户与中介。

退出机制、透明度与数据集

  • 对仅在最近才引入、且不具有追溯效力的退出机制,批评非常强烈。
  • “你无法遗忘”这一说法被视为自利的借口;其他人则回应说,完全重新训练在技术上可行,但成本高昂。
  • 也有人呼吁模型至少应披露其训练所用的数据集,即使原始数据无法公开。

技术缓解

  • 建议包括:输出过滤器以检测受版权保护的文本、生成后重写、基于训练语料建立参考搜索。
  • 对可行性存在分歧:有人说简单的文本过滤是可行的;也有人指出 LLM 没有显式存储/索引,无法可靠地“遗忘”特定条目。

对新闻业和互联网的影响

  • 有人担心,如果 AI 系统取代阅读原始来源,那么生产高质量新闻和人类创作内容的激励将被侵蚀。
  • 反方观点认为:当前复述用例与现有的付费墙绕过方式相比只是边缘问题;一些人认为,为了安抚出版商而放缓 AI 进步,代价过高。

对 OpenAI 回应的看法

  • 许多人认为这篇博客文章是面向公众和企业客户的公关,而不是严肃的法律论证。
  • 对于“任何单一来源(例如一家大型报纸)对模型都‘不重要’”的说法,普遍持怀疑态度,因为这些来源整体上都是必需的。