Markov 链是最早的语言模型
Markov 链正被重新审视为现代大语言模型的一个简单、直观的前身,这也引发了关于当今 AI 相比早期统计文本生成器究竟进步了多远的争论。评论者将经典 n-gram 和隐马尔可夫模型的严重局限,与 transformers 处理长程上下文、语义和涌现行为的能力进行对比,同时指出二者最终都在对文本进行下一个 token 预测。许多人认为 Markov 链是很有价值的教学工具和历史上的垫脚石,但也认为 LLMs 的规模、架构和能力代表的是质变,而不只是量变。
比较的范围:Markov 链 vs LLMs
- 许多人仍记得 Markov 链文本机器人(IRC、论坛、Twitter、MUD、音乐、俳句)作为早期令人惊叹的时刻。
- 有些人认为 LLMs 只是“更好的 Markov 链”,共享相同的下一个 token 预测直觉。
- 也有人坚持差距极其巨大:Markov 链只是有趣的玩具;现代 LLMs 是用于解决问题、问答、编码和创意写作的日常工具。
LLMs 真的“只是” Markov 链吗?
- 一方观点:
- 按定义,如果下一个 token 的概率只依赖于有界上下文,那它就是 Markov;LLMs 符合高阶或潜在空间 Markov 模型。
- Markov 模型可以定义在任意状态上,包括长上下文或潜在向量。
- 反对方观点:
- 经典 Markov 链是浅层、线性且通常基于表格的;transformers 使用深度、非线性的神经网络和 attention。
- Transformers 打破了简单的 Markov 状态视图(多个特征、对许多 token 的 attention、隐藏计算)。
- 有人认为把它们等同起来,就像把“金鱼 vs 人脑”或“发条玩具 vs 文明”混为一谈。
技术区别与局限
- Markov 链:简单统计 / 查表,随上下文扩展性差,语义能力弱,适合作为教学工具。
- LLMs:数十亿参数、深度非线性层、attention、涌现行为、长而灵活的上下文。
- 关于计算表达能力以及 transformers 是否有根本限制,还是在增加记忆后具有理论上的图灵完备性,仍存在争论。
- 隐马尔可夫模型以及更新的状态空间模型(例如类似 S4 的架构)被提及为相关但不同的路线。
教学、直觉与基础设施
- 有几位推荐将 Markov 链作为教授“会学习的代码”以及高层解释 LLMs 的极佳方式。
- 也有人强调,LLMs 的实现与训练基础设施(数据流水线、GPU、工程投入)远远超过了 Markov 模型能做到的任何事情。
- 文中提到了一些资源,如简短的 Markov 实现、Norvig 的 n-gram 工作,以及教育视频。
哲学与“智能”争论
- 关于“模仿 vs 真正智能”的争论仍在继续,类似于“飞机真的会飞,还是只是在模仿鸟?”
- 有些人强调结果和行为比匹配人类机制更重要;另一些人则把类人认知视为科学目标。