通过揭开其背后的数学之谜来理解 transformer 的工作原理
Transformer 作为现代大语言模型背后的核心架构,在代码上看似简单、在行为上却极其复杂,因此人们呼吁需要兼顾直觉教程与严谨数学的解释。评论者们交换了关于机械可解释性、位置编码和 attention 的资料,同时纠正了关于反向传播、神经网络术语以及 softmax 稳定性等数值问题的误解。除技术澄清外,一个反复出现的主题是:现有的“下一 token 预测器”不断扩展,究竟能否真正产生“AI”,还是需要新的架构、可学习的计算图以及更强的推理能力。
高层反应
- 许多人发现 transformer 很难真正“理解”:简单的模型是可解释的,但并不实用;而有用的模型又庞大到难以把握。
- 有人将其类比为“monad 教程”:你必须亲自折腾它们,一旦你理解了,就很难再把它们清楚地解释出来。
- 有些人很喜欢这篇文章;另一些人则认为“背后的数学”这种说法夸大了它的数学深度。
Transformer、Attention 与计算图
- 一种观点认为,“神秘感”主要来自于把静态层权重换成了可学习的 Q/K/V 矩阵以及大量并行化;attention 被视为结构上简单但很僵硬。
- 反驳意见是:真正特别之处在于对所有先前 token 的完整、无损访问,这与将历史压缩的 RNN 不同。
- 对未来进展是否需要让计算图本身也变得可学习展开了争论;有人提出了图空间离散性以及基于梯度训练的问题。
- 建议包括遗传算法、可微架构搜索,以及用于连接子图的类 Hebbian 机制。
进展、“真正的 AI”与工具使用
- 有人认为当前 LLM 的能力在 GPT‑3.5/4 左右已接近平台期,主要提供高效的“信息压缩”,并不是真正的“AI”。
- 另一些人则认为功能已经明显提升,而且概念学习与多步推理(例如 ReAct/Tree-of-Thoughts)已经超越了简单查找。
- “真正的 AI”有多种定义:对未见问题的稳健推理、自动构建计划,或能够端到端设计复杂工件的系统。
- 许多人强烈支持让 LLM 与外部工具和模拟器结合,而不是试图在网络内部模拟 CPU/NAND 门。
与大脑和神经网络的关系
- 关于大脑是否“使用 transformer”存在分歧:有人说不;也有人指出有研究显示,类似 transformer 的表征与海马体网格细胞/位置细胞相似。
- 有人澄清,transformer 确实是用反向传播训练的神经网络,尽管线程里对此有些混淆。
- 还提到 forward-forward 算法以及其他更符合生物学的学习方案,作为替代灵感来源。
数学、嵌入与位置编码
- 多条评论要求更深入地讲解:
- 分词(tokenization)与嵌入(embeddings)以及“去量化”(dequantization)。
- 位置编码,为什么用 sin/cos、频率如何选择,以及可学习编码与固定编码的区别。
- attention 中点积、softmax、缩放和残差的详细作用。
- 有人称赞一页纸的“用方程描述的 Transformer”资料,认为那正是他们想要的简洁数学说明。
实现问题与数值问题
- 读者指出解码器残差连接可能存在代码问题,并且缺少 layer norm。
- 将 NaN 归因于“梯度爆炸”的一节受到批评;真正的问题被描述为激活值过大以及数值不稳定的 softmax。
- 对位置编码公式和索引也有些轻微困惑;有人注意到它与原论文代码略有不同,但认为并非关键问题。
下一 token 预测与泛化
- 问题是:“仅仅”下一 token 预测器如何处理未见过的标识符,或遵循新的 in-context 示例?
- 回答强调:
- 学到的高维潜在概念(包括“乱码/占位符”)会映射到新的 token 字符串。
- 基于 token 序列的 in-context learning 和模式匹配。
- 一个理论要点:正确的条件下一 token 分布会隐式定义整个序列的分布,因此能够表示丰富的行为。