OpenAI在ByteDance用GPT训练其自有AI模型后暂停其账号

OpenAI因ByteDance据称使用GPT输出训练竞争模型而暂停其API访问,这引发了人们对AI公司如何控制其系统下游用途的审视。评论者争论这究竟是对专有技术的正当保护,还是一种明显的虚伪:毕竟OpenAI自身也曾在未经个人同意的情况下,使用海量互联网内容进行训练。讨论还涉及法律灰色地带(版权、合同与反垄断)、模型蒸馏的技术问题,以及围绕谁有权制定先进AI规则的更广泛地缘政治与伦理担忧。

感知到的虚伪与公平性

  • 许多人认为OpenAI的举动很虚伪:它用海量人类创作的互联网内容进行训练(往往并未获得明确同意),却禁止他人用其输出进行训练。
  • 也有人认为这并不一样:OpenAI使用的是公开网页数据;而ByteDance据称试图通过蒸馏OpenAI已训练好的模型来走捷径,规避高昂的训练成本。
  • 还有人把这与搜索引擎或Google的行为相比:抓取所有人的内容,却不允许别人抓取它们,或者在自己重新托管素材的同时惩罚重复内容。

法律、合同与反垄断

  • OpenAI的ToS明确禁止将输出用于训练竞争模型以及以程序化方式提取输出。许多评论者指出,ByteDance看起来违反的是合同条款,不一定是版权法。
  • 关于是否可以用受版权保护的材料进行训练是否构成知识产权侵权,讨论仍在继续;现行法律被认为尚不明确。
  • 一些人提出反垄断担忧:占主导地位的模型提供商限制竞争对手使用其输出,可能会被视为类似禁止逆向工程或数据库权利案件,随着市场成熟,可能会引来审查。

用GPT进行训练的技术方式

  • 多条评论解释了“蒸馏”:使用GPT-3.5/4生成大量合成数据集(问答、指令跟随、推理轨迹),然后对另一个模型进行微调,使其模仿GPT的行为。
  • 这种方式被描述为最能提升指令/RLHF式行为和回答结构,而不是原始知识;原始知识仍然可以来自公开网页语料。
  • 有人指出,与完整预训练相比,这种方式相对便宜,而且据说其他项目(例如各种开放模型)也做过类似的事情。

地缘政治与平台权力

  • چند条评论将这次暂停与美中紧张关系联系起来,并担心中国公司利用美国AI去帮助PRC的国家和军方,引用了近期美国关于出口管制的政策讨论。
  • 另一些人认为,实际上很难阻止这种行为;有意为之的人可以通过第三方代理API调用。

数据抓取与不对称性

  • 评论者把这与一个更广泛的模式联系起来:大型平台自由抓取开放网络,但随后把自己的数据/模型锁起来(例如Google、Reddit、Stack Overflow)。
  • 令人沮丧的是,内容创作者和小型网站帮助构建了今天的模型和索引,但却无法对这些“衍生”资产进行对等访问或再利用。

OpenAI的使命与品牌

  • 许多人批评“用于善”的说法是在进行道德姿态展示,并指出最初“为全人类开放研究”的使命与如今封闭、以利润驱动的行为之间存在鸿沟。
  • 也有人为公司保护昂贵专有资产的权利辩护,但承认“OpenAI”这个名字如今确实显得有误导性。