作者方诉微软/OpenAI案中未封存的简报
作者协会起诉 OpenAI 和 Microsoft 的案件中,未封存的法庭文件指控这两家公司明知故犯地使用了 LibGen 等盗版图书数据集来训练大型语言模型,同时在内部更担心 Hacker News 和 Twitter 等平台上的“公关形象”,而不是合法性。评论者就此争论:这种大规模抓取和 AI 训练究竟受不受合理使用保护,还是构成前所未有的版权侵权和“劳动盗窃”;同时也凸显了个人与科技巨头在知识产权法下受到的双重标准。该讨论串还提出了对 AI 影响创意生计、文化公地被圈占、低质量“AI slop”泛滥,以及在日益由强大专有模型中介的经济中人类控制力与议价能力流失的更广泛担忧。
LibGen 的使用与“公关形象”
- 公开的诉状文件显示,员工在讨论使用 LibGen 的大型盗版图书语料库时,主要担心的是如果 HN/Twitter 注意到会带来糟糕的“公关形象”,而不是合法性。
- 有些人认为“俄罗斯可疑网站”这句评论很虚伪,因为实验室做了规模大得多的抓取/盗版;也有人说,担心的是公关问题(俄罗斯、与水军农场的关联),而不是版权或 LibGen 的伦理。
- 对 LibGen 的定位存在分歧:一方认为它是充满受版权保护教材的盗版网站,另一方则认为它在贫困国家事实上成了研究型图书馆。
盗版与训练及合理使用
- 大家普遍同意,从 LibGen/Anna’s Archive 下载书籍属于版权侵权。
- 主要争议在于:对合法取得的受版权保护作品进行 训练 是否属于合理使用?
- 一方援引近期美国案件(如 Anthropic),认为对合法取得的书籍进行训练具有“转换性”,属于合理使用,但对盗版副本进行训练则不行。
- 另一些人认为模型可以复现受版权保护的文本,因此训练+部署应被视为复制,而不是单纯的“阅读”。
- 讨论还涉及现有证据是否显示系统性逐字复述;有人说这种情况很少见且已被拦截,另一些人则提到诉讼(新闻、歌词)和“slop”式输出。
工作、权力与资本主义
- 一派把 AI 看作又一轮自动化浪潮(汽车之于马,计算器之于人类“计算员”);失业是正常扰动。
- 另一派认为 AI 不同:它大规模攫取人类创造性劳动,削弱工人的议价能力,并可能导致权力极端集中(后劳动时代的“封建主义”/“神王”)。
- 讨论分成了想放慢/阻止 AI 的人,和接受技术进步、转而关注安全网、再培训或后工作经济的人(UBI、“奢侈太空共产主义”)。
文化、署名与“slop”
- 人们强烈担心模型会抹去作者署名、用低质量 AI 书籍/图片淹没市场,并侵蚀文化信号、真实性与手艺。
- 另一些人反驳说,AI 输出目前还无法匹配熟练的长篇写作,主要用于低端文案和类型文学填充。
- 有些人主张应缩短甚至废除版权;反对者指出,版权也支撑 copyleft(例如 GPL)。
不平等与执法
- 反复出现将对个体盗版者的严厉处理,与对支付得起和解金的十亿美元级实验室的宽容作对比;人们感觉法律主要是在保护资本。
- 有人把大实验室的不合规看作推动版权改革的杠杆;也有人担心这只会巩固企业豁免。
Hacker News 的角色与元讨论
- 员工明确担心 HN 的负面报道,这意味着在科技精英圈子里,HN 仍然对“公关形象”有影响。
- 该讨论串还在争论 astroturfing、版主管理,以及 AI 公司是否积极试图塑造 HN 的舆论。