模型正被故意训练得更笨
大型语言模型正越来越多地被优化为在权重中存储更少的事实知识,而转而依赖工具、搜索和外部知识库,这引发了如何在“推理引擎”和最新信息之间取得平衡的问题。评论者争论专用、可插拔的专家模型是否可取,甚至是否与当前架构兼容;而历史趋势则表明,大型通用模型配合广泛训练往往会胜过手工设计的专门化方案(“苦涩的教训”)。另一些人批评所引用的文章过时且很可能由 AI 生成,并强调把事实从权重中移出本身并不能解决幻觉,也不能保证引用可信。
基准有效性与文章时效性
- 多条评论指出,文章依赖过时的基准(SimpleQA 只到 2025 年),并且误述了当前领先者和能力。
- 有人提供了更新后的 SimpleQA-Verified 图表链接,显示了更好的表现,以及具体示例日志。
- 多位发帖者声称这篇博文本身很可能是 AI 生成且已经过时,这削弱了它关于“模型变笨”的权威性。
知识与推理的分离
- 许多人喜欢将“推理引擎”和“工具/知识库中的知识”进行概念拆分,并把较小的推理模型(例如 Needle、VibeThinker)视为早期例子。
- 另一些人认为推理与世界知识和语言使用紧密交织;你无法干净地剥离“事实”而不削弱推理。
- 还有人提出哲学上的反对意见:推理总是嵌入在特定的语言实践之中。
专用 / 可插拔模型 vs 通用模型
- 一段很长的子线程探讨了“可插拔知识库”的设想:小型核心推理 + 可替换的领域模块(Swift、GIS、前端等),理想情况下还能本地运行。
- 批评者回应说,当前的 transformer LLM 并不是这样组合工作的;跨领域数据(例如多种语言)往往会因为共享抽象结构而提升性能。
- MoE 经常被误解:评论者解释说,“专家”并不是像“Swift 专家”那样整齐的领域模块,而是抽象的模式子网络。
- “苦涩的教训”被频繁提及:手工设计的模块化架构,很可能会被大型通用模型加上简单提示词/agent 框架所超越。
幻觉、工具使用与搜索质量
- 多人指出,把事实从权重中移到工具/RAG 里并不会自动“解决幻觉”;模型仍然可能编造或错误处理检索到的数据。
- 可靠的“我不知道”行为被视为至关重要,但仍未解决/尚不清楚。
- 有人表示,现代聊天机器人幻觉更少,是因为更积极地调用工具,并通过提示要求用网络搜索进行核实。
- 也有人担心对网络搜索的依赖很脆弱,因为公共搜索质量正在下降,不过经过整理的/领域特定的知识库和内部索引可能会缓解这一问题。
使用模式与 agentic 系统
- 发帖者讨论现实中的使用方式:许多非开发者把 LLM 用于学习、文本处理和起草,而不是编程或重度 agent。
- 另一些人认为,即使用户数量分布并非如此,令牌密集型的编程/agent 使用也可能主导算力消耗。
- 多 agent 系统和专用框架被提议为当下实现“模块化智能”的实用途径,而不是重写模型权重。
智能、知识与信任
- 有人强调,LLM 是统计序列模型,并非人类意义上的“智能”;也有人指出,智能本身就没有明确定义。
- 多位评论者担心,AI 撰写、轻度核查的文章会侵蚀读者信任,并迫使读者自己对推理和事实做 QA。