如果有两头没有腿,十头大象有多少条腿?

大型语言模型经常在看似简单的数学和逻辑谜题上失手,例如在“大象有多少条腿”这类题目里,即使某些大象“没有腿”也会算错,错误从基础算术失误到荒诞解释不等。评论者借这些失败指出,LLM 生成的是统计上看似合理的文本,而非真正的推理,并讨论给它们加上 Python 解释器等工具能否实质性弥补这一差距。线程还涉及分词机制的怪异、对常见谜语的过拟合,以及这些行为对当前 AI 系统局限性与 AGI 目标意味着什么。

总体主题:LLM 与基础数学/推理失败

  • 线程围绕一个简单的谜语(“十头大象,两个没有腿”)以及许多 LLM 如何给出明显错误的答案展开。
  • 据称出现的答案包括:32(正确)、36、38、40、64、78,甚至还有“十八”,而且经常伴随着自信但不连贯的推理。
  • 有些模型断言大象有 8 条腿,错误地应用减法,或者把“缺失”的腿重复计算。另一些则把反向问题搞错(已知总腿数,推断大象数量)。

为什么 LLM 会在数学上挣扎(如线程中所述)

  • 几条评论强调,LLM 是概率性的下一个 token 预测器,而不是符号数学引擎或逻辑系统。
  • 数字只是 token:0、10、100 可能各自是单个 token;98 可能是多个。模型并不会天然切换到“数值推理”模式。
  • 算术/数学在训练语料中只占很小一部分,而且与分词方式匹配得很差,因此表现脆弱且不稳定。
  • 有些人把这些错误视为 LLM 缺乏真正理解或推理的证据;另一些人则认为它们仍然是强大的模式匹配器,只是没有为数学进行优化。

工具使用 vs. “纯” LLM 行为

  • 多个人指出,GPT‑4 经常会通过在沙箱解释器中编写并执行 Python 代码,正确回答大象和日期类问题。
  • 围绕这是否是令人印象深刻的“泛化 + 工具使用”,还是仅仅给自动补全引擎外挂一个计算器,存在争论。
  • 讨论中明确区分了原始 LLM 与其周边系统(LLM + 工具)。

不同模型与提示之间的不一致

  • 同一个提示在 Bard、GPT‑3.5、GPT‑4、Claude、Mixtral 和 Bing 上会得到不同答案;即使是同一个模型,其行为也可能随时间变化。
  • 一些更小或更新的模型能正确回答;另一些则给出奇怪的逻辑(例如把负腿数四舍五入到 1)。
  • 还观察到对常见谜语的过拟合(例如对羽毛/砖块变体总是说“它们重量相同”)。

更广泛的反思

  • 这些失败被用来论证 LLM “只是自动补全”,也被用来说明它们正在快速改进(尤其是在更大的模型和工具支持下)。
  • 几条评论将 LLM 描述为高度能干的“筛选器”或助手,而不是推理者,并把这些谜题视为检验其极限的良好压力测试。