生成式 AI 的情况即将变得更糟

像 ChatGPT 和 DALL·E 这样的生成式 AI 系统,正日益能够从模糊提示词中复现受版权或商标保护的角色,甚至新闻文章,这使得用户和 AI 提供方都面临无意侵犯知识产权法的风险。评论者争论谁应承担法律责任——模型运营方、用户,还是权利人本身——以及现有版权框架是否可以或应该被扩展,以涵盖对抓取数据进行的大规模机器训练。许多人预计最终会出现混合结果:商业模型会有更严格的许可和过滤,主流媒体与娱乐公司会加强执法,同时还会并存一个由未受限制或非法数据集训练而成的“盗版”或开放模型生态。

责任归属与“该起诉谁”的问题

  • 对于主要侵权者究竟是以下哪一方,存在强烈分歧:
    • 发布 AI 生成内容的终端用户。
    • 使用受版权保护的数据训练并分发输出结果的模型提供方。
  • 使用的类比包括:
    • 一位会复制“Stairway to Heaven”即兴乐句的录音室乐手。
    • 承包商与雇主之间的知识产权归属。
    • 作为中性工具的 Photoshop/Xerox,与一个已经“包含”受保护作品的模型。
  • 有人指出,像 OpenAI/Microsoft/AWS 这样的供应商提供有限赔偿,隐含地承认了某种风险。

基于受版权保护数据的训练 vs 输出侵权

  • 一种观点:对受版权保护作品进行训练本身就是侵权;整理者必须确保数据只来自已适当授权或属于公有领域的内容。
  • 另一种观点:训练属于变革性的“文本与数据挖掘”,很可能属于合理使用(或在某些司法辖区中被明确豁免),侵权只发生在使用/输出阶段。
  • 文中提到欧盟和日本都有特定的 TDM 例外,但附带退出机制或“无理损害”之类的限制;法律结果被认为仍未解决/不明确。

来自模糊提示词的商标与版权角色

  • 例子包括:“电子游戏水管工”、“经典科幻电影里的金色机器人”、“动画海绵”,生成出明显对应 Mario/C-3PO/SpongeBob 的形象。
  • 有人认为这些提示词实际上只是对特定 IP 的间接请求,因此并不令人意外,也不能免责。
  • 也有人强调,这使用户很容易在不知情的情况下侵权;当前模型既不会警告,也不会注明来源。
  • 提出的缓解措施:
    • 后处理过滤器或单独的检测模型(类似 YouTube ContentID)。
    • 基于商标数据库或模型识别器进行提示词级或输出级拦截。
    • 批评者认为这在技术上很脆弱、法律上模糊,而且容易过度拦截。

对艺术家、激励机制与版权政策的影响

  • 线程中的许多艺术家/创作者认为 GenAI 已经在损害自由职业工作和委托订单,尤其是对个人而非大型权利人影响更大。
  • 反方观点:人们创作是出于内在动机;过去的技术(摄影、合成器)并没有杀死艺术;创作会适应变化。
  • 更广泛的批评:
    • 现行版权期限(终身 + 几十年)被一些人视为过长,并偏向大型公司。
    • 提议包括缩短期限并加强合理使用,到废除版权或转向赞助/酬谢模式。
    • 也有人警告说,削弱版权主要会让大科技公司更容易在不给补偿的情况下将所有人的作品变现。

监管、地缘政治与未来走向

  • 有人预测,强有力的版权约束会在美国/欧盟“削弱”商业 GenAI,而开放/盗版模型以及非西方司法辖区会继续推进。
  • 有人将其类比为 Napster 与 torrents:即使主要服务受到限制或被迫重新训练,未审查的模型和数据集仍会存在。
  • 对结果的推测包括:
    • 许可协议,以及对提示词或模型征收“AI 税”。
    • 针对高风险用途制定单独、更严格的规则,而对私人、非商业生成采取更宽松的处理。
    • 如果输出经过大量后过滤且不透明,AI 输出的可信度可能会受到抑制。