由英特尔和美国政府支持的一万亿参数模型训练已开始

一个由美国政府支持、与英特尔合作的项目已开始在 Aurora 超级计算机上训练一个一万亿参数的 AI 模型,目标是与 GPT‑4 等系统竞争或接近,并推动科学研究。评论者讨论了不断增大的模型是否仍是正确方向,还是需要新的架构与训练方法,并质疑是否有足够高质量的数据继续大规模扩展。该项目还引发了对强大 AI 的国家控制、使用受监控或机密数据的可能性、最终模型的开放性,以及持续升级 AI 带来的更广泛社会风险与收益的担忧。

模型规模、架构与对比

  • 有人指出,1T 参数可能只是把这归入 GPT‑4 的同一类,而不一定更强;GPT‑4 的真实规模以及它是否是 Mixture‑of‑Experts(MoE)仍未得到证实且存在争议。
  • 也有人指出,目前已知的所有 1T+ 模型都是 MoE;这款新模型是 dense 还是 MoE 尚不清楚,但这对比较至关重要。
  • 缩放假设被广泛引用:到目前为止,“更大的模型 + 更多数据 + 更多算力”确实能可靠地提升能力,不过许多人预计最终会遇到极限。
  • 也有人认为,未来的进步将需要架构变革和更高的数据效率,而不仅仅是增加参数。

数据、训练与人类对比

  • 关于我们是否正在“耗尽数据”存在争论;有人声称大型实验室仍然可以找到或生成大量数据,另一些人则认为确有上限。
  • 粗略估算将人类的感官输入(数百 TB 到 PB 级)与 LLM 训练语料进行比较,暗示人类可能接收远更多的原始输入,但以更具交互性和多模态的方式。
  • 还有人强调,人类通过与现实世界的主动交互和反馈来学习,而不仅仅是文本;一些人认为,未来的 AI 也必须同样在环境中行动,才能达到更高智能。

超级计算机与硬件

  • Intel/Argonne 的 Aurora 系统被视为 Intel GPU 和大规模并行能力的展示。
  • 讨论集中在传统超级计算机架构(例如 HPC 互连、偏向 FP64)是否适合 LLM 训练,还是大规模 GPU 集群更合适;意见不一。

收益与科学目标

  • 许多人对一个面向特定领域、经过科学训练的模型持乐观态度:更好的文献检索、自动化发现,以及研究加速。
  • 一些人认为这可能是最引人注目的公共部门 AI 项目之一。

风险、伦理与治理

  • 强烈的“AI 灾难论”观点认为 AI 净有害,并将其类比为化学武器以及更广泛的技术危害(气候、塑料、工业化农业)。
  • 也有人反驳说,技术(包括 AI)带来了巨大收益,而问题通常源于滥用、经济因素和治理,而非科学本身。
  • 对于由政府还是公司来控制强大的 AI,存在重大争论,并伴随大量关于国家与公司暴行的历史论据。
  • 有人对监控数据提出担忧:有人推测情报机构可以用数十年的通信记录训练强大的私有模型;这被认为令人警惕,但未得到证实。

开放性、访问与安全

  • 有人询问模型权重是否会发布或可通过 FOIA 申请获得;大多数人预计会被归类为“国家安全”。
  • 开源模型的愿望与担心将先进能力交到对手手中的顾虑之间存在紧张关系。