当一个 LLM 从未见过五年级以上的材料时,会发生什么?
将语言模型的训练数据限制为美国 K–5 课程材料,会得到一个能模仿“见多识广的小孩”的 AI,但它仍会幻觉,并且会对远超其表面知识水平的问题自信作答。评论者探究年级过滤到底做得有多好、这种模型是否真能可靠地说出“我不知道”,以及这对更广泛的 LLM 意味着什么——也就是它们的能力实际上被预训练数据范围紧紧束缚,而不是从某种抽象“智能”中自然涌现出来。有人把这视为研究知识上限和模型谦逊的有价值探针;也有人认为它主要只是再次证明,如今的系统本质上仍是高级自动补全,而不是真正的推理者。
实验范围与设置
- 模型在经过筛选、约为“≤五年级”/美国 K–5 课程范围的文本上训练。
- 过滤流程:从教育类网络语料开始,应用词汇习得年龄阈值(丢弃超过 5% 的单词年龄超过 12 岁的样本),移除更高阶的数学符号,然后训练一个分类器来细化划分。
- 一些评论者希望有更多透明度:例如纳入数据的样例以及对年级水平的人类抽查;数据集尚未发布。
泄漏与数据质量问题
- 多个回复认为模型显然知道五年级以上的概念(瑞利散射、量子纠缠、薛定谔的猫笑话、基础 Python 等)。
- 有人推测过滤并不完美;“允许 5% 高级词汇”以及成人撰写的儿童材料可能会把更高层次的知识偷偷带进去。
- 也有人认为这些解释很多确实会出现在儿童科普书里,因此它们仍可能处于一个合理的 K–5 语料范围内。
行为、答案质量,以及“五年级智能”
- 用户报告了各种离谱或不连贯的答案(例如:五的乘法表、-1 的平方根、石棉的影响、函数最大化、导致无限循环的排序算法)。
- 有人认为这“只是一个弱模型”,并不是一个有原则的五年级学生类比;真正的孩子往往会说“我不知道”。
- 另一些人把它比作一个把所有小学文本都读过的博学读者,拥有完美记忆,却几乎没有真正的推理能力。
幻觉、无法说“我不知道”,以及 RLHF
- 一个很长的分支讨论了为什么 LLM 很少说“我不知道”:
- 一种观点:基础模型在模仿文本,而人们在文本里几乎不会以“我不知道”收尾。
- 反对观点:指令微调和 RLHF 可以明确训练模型表达不确定性,但这会与奖励自信答案的基准测试相互竞争。
- 关于“什么都懂”的行为也有讨论:LLM 过于讨好,主观上很少拒绝某个想法;也有人指出更新的前沿模型确实更常反驳或纠正用户。
- 有人把 RLHF 和方差降低联系起来:更少的拒绝可能最大化基准分数和互动参与度。
能力上限与对 AGI 的含义
- 线程里对论文的一个核心说法(转述)是:规模化、指令微调、RL 以及上下文内技巧会放大课程所教内容,但不会突破它;预训练过滤器设定了一个有效能力上限。
- 许多人认为这个结果很重要:它表明智能与训练数据范围紧密绑定,挑战了“仅靠规模就能从有限语料中涌现出质的新知识”的希望。
- 有人把这视为对“随机鹦鹉”批评的印证;也有人仍想知道,更强的推理训练、记忆以及长时程任务,是否仍能在受限课程下带来新的发现。
替代训练思路与潜在用途
- 有人提出的方案包括:
- 严格按年级进行课程式训练,并在每个年级设置检查点。
- 由好奇心驱动的增长:当模型承认无知时,由更大的模型去获取并加入新数据。
- 使用高度验证、均衡良好的语料进行训练,而不是嘈杂的网络混合语料。
- 少数人看到了小众应用:一个受限的 K–5 模型可用于家庭自动化或更安全的助手,不过持续幻觉的问题仍令人担忧。