“没有版权材料就不可能”创建像 ChatGPT 这样的 AI 工具,OpenA
围绕 OpenAI 认为若没有受版权保护的材料就无法构建像 ChatGPT 这样的工具这一说法,争论集中在:用这些数据训练 AI 更像人类学习,还是更像把内容复制进一个可能复现受保护作品的数据库。评论者在法律和道德责任上分歧明显:有人认为只要输出不是逐字照搬,训练就应属于合理使用;也有人认为大规模商业 AI 模型在未经同意或付费的情况下利用了创作者的劳动成果。讨论还引发了对版权期限、开源模型前景、企业权力,以及未来法律如何在创新与知识产权之间取得平衡的更广泛担忧。
AI 与人类学习及权利
- 关于 LLM 是否“像人类一样学习”的争论很大。
- 一方认为:人类和 LLM 都会从大量语言中学习,因此在接触受版权保护的作品时,法律和道德上应当受到类似对待。
- 另一方认为:实现方式根本不同;神经网络中的“接收”文本更像是复制到一个类似数据库的系统里,不同于人脑。
- 更广泛的哲学分歧:
- 有人认为,道德权利源于意识/自我意识,而不是生物学上的人类身份,因此先进的 AI 未来也应得到类似对待。
- 也有人坚持法律是由人制定、为人服务的;机器只是财产,不是权利主体,把权利扩展给 AI 只会浪费政治资本,并掩盖企业利益。
版权、训练数据与合理使用
- 一派观点:用受版权保护的数据进行训练类似阅读;只要系统不会原样复述作品,就不构成侵权。
- 反对者认为:把受版权保护的材料加载进训练语料库本身就是复制和改编,直接落在版权范围内,与“训练”或“学习”的标签无关。
- 有人建议应当为内容付费许可;也有人担心这会巩固富有公司的垄断,并压垮开源努力。
输出、记忆化与侵权
- 纽约时报中 GPT 复现文章的例子被引用为记忆化和侵权的证据。
- 反驳意见:许多例子都依赖于提示词提供了文章的一部分;批评者称这是一种“作弊”,类似于诱导工具去侵权。
- 持续存在的问题是:责任应由模型提供方承担、由发出提示的用户承担,还是双方都承担?
商业模式、规模与利润
- 一些人认为,对个人可容忍的行为(个人用途盗版、私有模型),一旦在大规模商业化后就变得不可接受。
- 也有人为 OpenAI“先行动、事后再道歉”的做法辩护,认为这是展示可能性的必要方式;另一些人则说,他们显然是利用了他人的工作牟利,现在必须补偿。
监管、法域与未来影响
- 有人担心,严格的许可要求可能会:
- 削弱开源模型,
- 让硅谷既有巨头地位更加稳固,
- 或者限制未来具身、持续学习的 AI。
- 文中提到日本对 AI 训练采取较宽松立场,作为对照先例。
- 潜在主题是:当前版权期限可能过长,导致现代 AI 以及其他公共利益用途所需的公共领域作品不足。