现在是让 LLM 访问 ACM 数字图书馆的时候了
将 ACM 数字图书馆向大型语言模型开放,正在引发围绕谁应控制并受益于数十年学术成果的争论。许多人认为,图书馆应当对人类和机器一并完全开放,尤其是考虑到研究往往由公共资金资助,以及 AI 公司很可能已经抓取了大部分内容;而另一些人则更关注版权、作者同意,以及担心向大型 AI 公司出售付费许可会加剧不平等,并进一步侵蚀本已脆弱的同行评审体系。其背后还有一种更广泛的担忧:LLM 可能会巩固科学知识的新守门人,而不是扩大全面、真正的可访问性。
开放获取与 ACM 的政策
- 有人认为,ACM 的数字图书馆本应在讨论 LLM 访问之前很久就完全对人类开放。
- 也有人指出,ACM 已承诺从 2026 年 1 月起让所有出版物实现开放获取,不过一些人认为当前的“开放获取”概念令人困惑、带有付费墙,或与作者费用绑定。
- 一些人把 ACM 的举措视为一种“营销式”的开放获取定义,并以 Sci‑Hub/LibGen 事实上构成开放获取为例。
LLM、访问与研究价值
- 一些研究人员表示,LLM 通过帮助他们把论点追溯到原始论文,极大地增加了他们对一手文献的使用。
- 另一些人认为,LLM 几乎肯定已经通过 arXiv、Sci‑Hub 和其他 PDF 来源摄取了大多数 ACM 内容;少数人对此“完整摄取”的程度表示异议。
- 一个反复出现的观点是:阻止 LLM 只会伤害守规矩的人;恶意者无论如何都会去抓取。
许可、所有权与补偿
- 一派认为 ACM 的许可计划虚伪:作者完成了工作,出版商却攫取了 LLM 收益,而作者还要面对越来越重的负担(学生使用 AI、同行评审失灵)。
- 另一派反驳说,学术作者历来并不指望版税;通过发表,他们追求的是声望和知识传播,而不是报酬。
- 有人建议:对开放权重/非营利模型免费开放,对封闭式商业模型收取许可费。
版权、公平使用与合法性
- 关于训练 ACM 论文是否构成版权侵权还是公平使用存在争论:
- 一方强调版权保护的是表达而不是思想;阅读并使用思想(无论人类还是机器)一直都是允许的。
- 另一方强调逐字或近似逐字的复述、衍生作品以及最近的诉讼;认为 LLM 输出可能替代原作,因此构成侵权。
- 目前没有共识;发帖者指出,法院仍在澄清边界,而且人们常常对现有判决的实际含义意见不一。
对同行评审与学术界的影响
- 一些人认为 LLM 会“毁掉”同行评审(除了硬实验工作之外),而且同行评审本就存在严重缺陷,或大多只是象征性的。
- 另一些人说,这一体系在 AI 出现之前就已经坏了;arXiv 的预印本文化被拿来作为证据。
- 也有人主张,如果掠夺性出版结构开始充当 AI 守门人,而不是促进开放学术,就应该把它们彻底摧毁。
公平、权力与社会影响
- 有人担心,将访问权卖给大型 AI 实验室会进一步加剧权力集中,并排斥更小型/开放的参与者。
- 也有人怀疑 AI 驱动的“丰裕”是否会惠及所有人;许多人预见的是更大的不平等、潜在的威权控制或社会动荡,而不是普遍繁荣。