政府、公司和非营利组织应投资于自由、开源 AI [pdf]

呼吁政府和机构资助自由、开源 AI 的声音,凸显了公众获取强大模型的愿望与构建这些模型所需的巨大资本和算力成本之间的张力。评论者将 AI 与 Linux 等早期开源成功相类比,但也指出,前沿 LLM 更像曼哈顿计划或阿波罗计划这类大型科研工程,而非普通软件项目,因此令人怀疑志愿者或小规模资助是否能跟上。除了奖项竞赛和许可强制等提议外,也有人质疑 AI 目前是否带来了足够的社会价值,足以 justify 大规模公共投资,尤其是在能源消耗、权力集中以及训练数据和版权问题尚未解决的情况下。

开源与闭源 AI 的经济学

  • 有人认为,政府和机构应大力投资开源 / 开权重 AI,以避免未来被少数私营实验室主导,并捕捉过去 FOSS 成功所体现的协作优势。
  • 也有人反驳说,前沿模型极其依赖资本和算力,因此志愿者或轻度资助的 OSS 无法与投入数十亿美元并期待回报的公司竞争。
  • 还有一种折中观点指出,许多重要的 OSS 本就由公司资助;类似模式也可能适用于 AI,但前提是经济账算得过来。

商品化,以及 OSS 在哪里能赢

  • 有人将其与操作系统、数据库和编译器相比较:在这些领域中,OSS 最终在很多情况下占据主导。
  • 怀疑者回应说,OSS 最擅长的是某个领域已经商品化、研究接近公共前沿时;而在私有研究和巨额资本投入至关重要的地方(例如前沿 LLM),OSS 就会吃力。
  • 有些人认为,token 生成和中端 LLM 已经在走向商品化,多种模型可以互换,价格也在持续下行。

开放贡献的现实障碍

  • 传统 OSS 允许任何有笔记本电脑的人参与贡献;而 LLM 训练需要昂贵算力。
  • 这把“竞争”从代码质量转移到 GPU 获取能力上,提高了有意义贡献的门槛,也让经典的 OSS 开发模式不再那么适用。

替代性的资助与奖项模式

  • 有人提议设立定期激励奖,奖励在固定 VRAM 限制下、满足严格基准的开源模型,并可能由企业共同出资。
  • 支持者认为这能推动优化与认可;批评者指出,评测构建、保密性和可复现性会很昂贵且复杂,甚至可能比奖池本身还高。

政府角色:投资、监管,还是限制

  • 有人希望大规模公共投资,甚至由国家主导开展“曼哈顿 / 阿波罗式”的 AI 项目;也有人认为,以当前政治和经济条件来看,这种支出并不现实,或者优先级低于气候、能源或社会需求。
  • 另一派则主张对 AI 算力征收重税或关税,认为前沿 AI 对社会有害、耗能巨大,而且主要受益的是“卖铁锹的人”(GPU 厂商、云服务商)。
  • 还有建议包括强制开权重(可能仅限非商业用途)、公开训练数据,甚至在高风险情况下由国家接管——同时也有人担心国家安全竞争,以及完全开放的前沿模型带来的滥用风险。

伦理、数据与公地

  • 关于在未获同意的情况下使用公开数据进行训练是否属于“盗窃”,以及是否符合长期以来的互联网规范,争论仍在继续。
  • 有人认为,用公共数据训练出的模型若要商业化,就应当把输出共享回公地;也有人指出,这种说法带有虚伪性,毕竟此前广泛存在盗版和对免费可得信息的再利用。