深度学习的数学导论:方法、实现与理论

arXiv 上一本高技术含量、600 页的“深度学习数学导论”在程序员、数学家和 ML 研究人员中引发了褒贬不一的反应。有人称赞它以泛函分析风格严谨地处理神经网络、优化和 PINNs,并且记号密集恰好是所需的形式化;也有人认为它在教学上过于不友好,证明了太多底层引理,却几乎无法解释 ResNets、Adam 或 transformer 等现代方法为何有效。讨论进一步扩展到:从业者到底需要多少高等数学、当前理论是否真能指导深度学习实践,以及教材、代码优先资源,甚至 GPT-4 这类数学导师工具应扮演什么角色。

数学在深度学习中的作用

  • “数学是必不可少的基础”与“数学对从业者来说过于繁琐”之间存在鲜明分歧。
  • 支持数学的一方认为:理论提供保证,澄清正在优化什么,揭示失败模式和局限性,而且当你不再局限于现成库时,它是必需的。
  • 怀疑的一方认为:大多数实际工作的 ML 研究人员和工程师很少使用高阶结果(例如 Lyapunov 稳定性、繁重的泛函分析);这本书可能主要只是提供“精神支持”,而非实际指导。
  • 一些人指出,深度学习的关键进展一直主要来自经验,而理论往往滞后,且对实践中真正有效的东西解释甚少。

目标读者与记号密度

  • 包括受过数学训练的人在内,许多评论者都觉得记号极其密集,存在多层下标/上标以及大量新符号。
  • 也有来自数学/物理背景的人表示,这种风格在应用数学中很常见,并且适合理论读者。
  • 关于“Mathematical Introduction”这个标题是否具有误导性存在争议,因为这本书似乎默认读者具备高年级本科或研究生水平的数学基础(例如度量理论、泛函分析)。

教学法:数学、代码与直觉

  • 有些人希望有更多文字说明、图示,以及从零开始用 NumPy 实现,而不是 TensorFlow 和大量形式化推导,认为这样更能建立直觉和实践理解。
  • 也有人称赞这本书正是他们想要的那种严谨、统一的处理方式,与以 API 为中心的材料形成对比。
  • 一个反复出现的批评是:书中用很多页证明基础引理和经典不等式,却省略或仅引用更相关的现代结果的证明(例如常用优化器的收敛性、现代架构的行为)。

深度学习的理论性与经验性

  • 普遍共识是,深度学习目前仍主要是经验驱动的:我们可以系统地测试方法,但缺乏能预测关键现象的统一理论。
  • 举例包括:为什么 ResNets、Adam 和 batch norm 能如此有效,仍在一定程度上依赖启发式解释且存在争议。
  • 一些人认为像这样的书是通向最终理论的重要基础;另一些人则认为它们只是把容易的部分形式化,而回避了真正困难且有趣的问题。

用 LLM 学数学

  • 一种观点推荐 GPT-4 作为优秀的交互式导师,帮助解析密集的公式和记号。
  • 另一种观点警告初学者:幻觉足够常见,过度依赖是有风险的;对于已有严格训练的人来说它有用,但不能作为唯一且可信的来源。