人工智能系统被发现擅长模仿,但不擅长创新

关于当今 AI 系统擅长模仿却缺乏真正创新的说法,引发了关于机器“创造力”和“理解”究竟意味着什么的争论,而这些机器主要是在文本和图像上训练出来的。评论者将概率性的下一词预测与人类经验、具身性、意志和反馈回路作对比;也有人认为,重组、统计模式发现和自我博弈已经能够产生新颖且有用的输出。许多人预计,未来具备更丰富世界交互和明确原创激励的系统将缩小创新差距,但对于责任在于根本限制还是当前训练设置,意见仍然不一。

研究范围与基准

  • 一些评论者表示,这篇论文在潜台词上把“AI”等同于当前的 LLM,并使用了一个高度偏向推理和受限任务的基准;而众所周知,现成模型在这类任务上表现较弱。
  • 有人指出,原始数字(任务部分环节中的创新率接近人类)让“AI 缺乏创新”这个标题感觉像是在不断调整标准。

模仿、组合与“真正的”创新

  • 广泛共识是,LLM 擅长模仿,尤其擅长组合:把已有想法(代码、主题、风格)重新组合成连贯的新产物。
  • 一种观点认为,大多数人类知识工作本身也只是带着小幅修改的组合,因此 LLM 是强有力的竞争者。
  • 反对观点则认为,AI 的输出常常显得肤浅且与高质量人类作品可区分;它主要威胁的是低端内容工作。

创新作为反馈、意志与随机性

  • 一方认为:创新需要意志或内在目标;AI 只是由人类设计者定义的强大目标寻求工具。
  • 相反观点认为,真正重要的是反馈和评估,而不是“意志”。自我博弈和科学方法被引用为反馈如何驱动创造力的例子;未来能够生成自身经验的系统可能会更具创新性。
  • 另一条论点是:所有创新都是组合与(伪)随机变化的某种混合;批评者回应说,这忽略了人类感官经验的丰富性以及深思熟虑的抽象能力。

创造力测试、抽象与寓言

  • 有人提议,把真正新颖的寓言和深层抽象模式解码出来,作为有意义的创造力测试;他们表示 LLM 在这类任务上表现很差。
  • 也有人以轶事反驳,称 LLM 能生成非平凡的类比和定制 GUI 代码,认为怀疑者系统性地高估了失败案例。

幻觉、推理与规划

  • 幻觉被描述为模型在没有规划、也不承认自己无知的情况下“说在知识前面”。
  • 建议的缓解方式包括推理附加模块、tree-of-thought 展开,以及自动自我批评循环。

意识、感知与定义

  • 一派认为,关于“理解”“感知”和“意识”的争论只是模糊词汇之争,会分散对具体能力的关注。
  • 另一派则认为,即便这些定义不会改变近期的技术判断,它们对伦理、权利和法律仍然重要。

对创新与同质化的需求

  • 一些评论者指出,许多市场(菜单、好莱坞系列片、流行设计)实际上更奖励安全、熟悉的产出而非创新,这让 LLM 式模仿在商业上很有吸引力。