Markov 链是最早的语言模型

Markov 链正被重新审视为现代大语言模型的一个简单、直观的前身,这也引发了关于当今 AI 相比早期统计文本生成器究竟进步了多远的争论。评论者将经典 n-gram 和隐马尔可夫模型的严重局限,与 transformers 处理长程上下文、语义和涌现行为的能力进行对比,同时指出二者最终都在对文本进行下一个 token 预测。许多人认为 Markov 链是很有价值的教学工具和历史上的垫脚石,但也认为 LLMs 的规模、架构和能力代表的是质变,而不只是量变。

比较的范围:Markov 链 vs LLMs

  • 许多人仍记得 Markov 链文本机器人(IRC、论坛、Twitter、MUD、音乐、俳句)作为早期令人惊叹的时刻。
  • 有些人认为 LLMs 只是“更好的 Markov 链”,共享相同的下一个 token 预测直觉。
  • 也有人坚持差距极其巨大:Markov 链只是有趣的玩具;现代 LLMs 是用于解决问题、问答、编码和创意写作的日常工具。

LLMs 真的“只是” Markov 链吗?

  • 一方观点:
    • 按定义,如果下一个 token 的概率只依赖于有界上下文,那它就是 Markov;LLMs 符合高阶或潜在空间 Markov 模型。
    • Markov 模型可以定义在任意状态上,包括长上下文或潜在向量。
  • 反对方观点:
    • 经典 Markov 链是浅层、线性且通常基于表格的;transformers 使用深度、非线性的神经网络和 attention。
    • Transformers 打破了简单的 Markov 状态视图(多个特征、对许多 token 的 attention、隐藏计算)。
    • 有人认为把它们等同起来,就像把“金鱼 vs 人脑”或“发条玩具 vs 文明”混为一谈。

技术区别与局限

  • Markov 链:简单统计 / 查表,随上下文扩展性差,语义能力弱,适合作为教学工具。
  • LLMs:数十亿参数、深度非线性层、attention、涌现行为、长而灵活的上下文。
  • 关于计算表达能力以及 transformers 是否有根本限制,还是在增加记忆后具有理论上的图灵完备性,仍存在争论。
  • 隐马尔可夫模型以及更新的状态空间模型(例如类似 S4 的架构)被提及为相关但不同的路线。

教学、直觉与基础设施

  • 有几位推荐将 Markov 链作为教授“会学习的代码”以及高层解释 LLMs 的极佳方式。
  • 也有人强调,LLMs 的实现与训练基础设施(数据流水线、GPU、工程投入)远远超过了 Markov 模型能做到的任何事情。
  • 文中提到了一些资源,如简短的 Markov 实现、Norvig 的 n-gram 工作,以及教育视频。

哲学与“智能”争论

  • 关于“模仿 vs 真正智能”的争论仍在继续,类似于“飞机真的会飞,还是只是在模仿鸟?”
  • 有些人强调结果和行为比匹配人类机制更重要;另一些人则把类人认知视为科学目标。