微软高管称 AI 抓取是“人类历史上最大规模的劳动盗窃”
一份解封的法庭文件显示,一位微软高管将 AI 训练称为“人类历史上最大规模的劳动盗窃”,这引发了关于建立在抓取网页内容之上的大语言模型究竟构成盗窃、侵犯版权,还是变革性合理使用的争论。评论者在把它类比为人类学习、盗版和历史奴役上激烈交锋,也批评曾经反盗版的科技公司如今大规模吸收受版权保护作品的虚伪,以及个人因侵权受罚而企业却因侵权获利的失衡。许多人认为,即使训练合法,它也会贬低创意劳动、将权力集中到少数 AI 供应商手中,并可能正当化新的税收、版税或开权重要求,以便重新把收益平衡回公众一侧。
AI 训练是“盗窃”还是只是侵犯版权?
- 许多人认为,用于训练的抓取是“最大的劳动盗窃”:模型未经同意或付费就从数百万作品中提取价值,然后与创作者竞争。
- 另一些人坚持认为,从严格意义上说这不是“盗窃”:原作仍然存在,最多只是侵犯版权,而法律传统上保护的是复制品,而不是“观念/事实/模式”。
- 一个反复出现的反驳点是:人类从书本学习是合法的;反对者则回应说,不可竞争的人类心智不能与用于商业用途、可大规模扩展的机器学习器相提并论。
- 法律状态被描述为尚未定论:一些法院已认定训练的某些方面属于合理使用;合理使用与市场损害仍然是核心且有争议的问题。
规模、自动化与双重标准
- 评论者强调规模会改变一切:一个人盗版,和大型公司大规模抓取整个网络、付费墙内外甚至盗版数据集,然后将输出变现,两者不可同日而语。
- 许多人指出其中的虚伪:个人因盗版曾遭到严厉惩罚;而 AI 实验室以同样行为的大规模版本却获得万亿美元估值。
- 实验室抱怨模型“蒸馏盗窃”被视为尤其虚伪,因为它们自己的模型也是用未授权材料训练的。
对创作者、文化和劳动的影响
- 人们强烈担忧 AI 会通过销售由其作品构建的廉价替代品,冲击作家、艺术家、程序员、研究人员、音乐人等的市场。
- 一些开源作者和博客作者说他们后悔公开发表;他们现在看到自己的无偿工作正在为可能终结其职业生涯的工具提供动力。
- 也有人认为,聚合与再混合一直是文化发展的方式;而版权极大化本身则被视为由大型媒体公司推动的历史性异常。
- 还有人担心原创网络内容会随着网站死亡而消失(成本、机器人负载、流量流失),知识实际上被“困”在专有模型里,并被 AI 生成的“垃圾内容”淹没。
公地 vs 财产与再分配
- 一派欢迎 AI,认为这是“信息应该自由”的终极时刻,也是对过度扩张的知识产权的一次部分回调,尤其是那些理应进入公有领域的作品。
- 另一派坚持知识产权是一项正当权利;如果允许用受版权保护的作品进行训练,那么模型和权重也应被视为公地的一部分。
- 提出的补救措施包括:对 AI 公司征收重税或利润分成、与训练数据挂钩的创作者版税方案,或由 AI 收益资助的全民福利。
监管与结构性提案
- 想法包括:
- 训练必须获得同意和许可,并且要有真正有效的退出机制。
- 强制披露训练数据并公开较旧的模型权重。
- 宣布模型输出不可受版权保护,并可能受到原作者主张的约束。
- 限制公司规模或算力,甚至禁止某些专有前沿模型。
- 有人指出,在地缘政治竞争和企业游说的背景下,执法在政治上会很困难。
开源与闭源模型,以及蒸馏
- 开权重模型被引用为某种民主化,但批评者说,用未授权数据训练的开权重模型仍然是“洗白后的盗窃”。
- 一些人为蒸馏辩护,称这是与基于人类全部知识库训练的模型合作的“人权”;另一些人则担心这会进一步巩固最初未经补偿的攫取。
更广泛的社会担忧
- 讨论还涉及:
- 如果 AI 同时自动化脑力和体力劳动,财富与权力会进一步集中。
- 大型数据中心带来的环境与基础设施成本。
- 与监控的类比:当“公开”数据的使用被自动化并在极端规模下集中化时,就会变得问题重重。