通过梯度下降学习的每个模型都近似地是一个核机器(2020)
通过梯度下降训练的神经网络在数学上可以被改写为核机器,但评论者认为这种等价更多只有理论意义:其隐含的核依赖完整训练轨迹,并不能提供经典核方法那种实际优势。讨论随后延伸到更大的争论:现代深度模型——尤其是大语言模型和生成式视频模型——究竟主要是在记忆训练数据,还是在真正泛化,涉及效率、联想记忆的作用,以及这些行为对人工通用智能主张意味着什么。
核机器 vs 神经网络
- 一些评论者指出,简单神经网络与核方法和高斯过程之间的联系早已为人所知;在他们看来,2020 年这篇论文更多是阐释性的,而非原创性的。
- 一个关键批评是:构造出来的“核”取决于梯度下降的完整训练轨迹。这使它不同于经典核方法,在后者中,核大多与数据无关(例如参数可调的高斯核)。
- 由于每一个新数据点都会改变整个训练路径,你得不到核方法式的增量更新;所有复杂性可能只是“被搬进了核里”,从而限制了其实用洞见。
- 还有人指出,许多机器学习方法在宽松意义上,本质上都是围绕某种特征表示进行的高级记忆,因此把经梯度下降训练的模型称为“核机器”在技术上或许没错,但并不太能提供启发。
现代模型中的记忆与泛化
- 一个主要分支在争论大模型(LLMs、视频模型)的惊艳结果,究竟主要是记忆,还是更广泛泛化能力的证据。
- 一方认为:细粒度的视觉或文本细节很可能来自对训练数据的机械复述;不透明的训练/测试划分使“数据洗白”成为可能。
- 另一方则以似乎需要真正模式学习和算法归纳的任务反驳(例如上下文中的回归、遵循语法、围棋系统、新颖图像组合)。
- 分歧集中在“记忆”的定义:是对示例的精确复用,还是从示例中学习压缩的、高层次的表示与算法。
人类智能、记忆与 AI 对比
- 很多评论都在作类比:人类专家(管道工、律师、工程师、国际象棋大师)高度依赖记忆和模式复用;创造力往往也是派生性的。
- 也有人提出反驳,强调人类处理真正新颖情境、跨领域复用技能以及解释推理过程的能力——这些能力当前模型只部分具备。
局限、失败与臆造
- 图像示例(例如穿着宇航服的马)既展示了创造力,也暴露出“基础”不一致(头盔或宇航服并未完全包裹身体),这让人怀疑此类臆造是否能够被彻底消除。
- 有人认为这些只是相对于整体复杂度而言的轻微瑕疵;也有人把它们视为缺失世界模型或逻辑结构的证据。
元话题:论文的反响与更广泛的文化
- 有人认为“万物皆核机器”的表述过于夸张,甚至从实践角度看是“胡说”,因为那个核是依赖数据的。
- 文中还提到核/SVM 风格方法、经典统计学与深度学习社区之间持续存在的张力;一些研究者非常不喜欢深度学习的主导地位。