按幻觉率划分的 LLMs

关于 GPT‑4 和其他大型语言模型在摘要任务中的幻觉率低至 3% 的说法,引发了人们对这类基准到底有多大意义的争论。评论者质疑其方法论(包括用一个模型去评判另一个模型),争论“hallucination”还是“confabulation”更贴切,并指出一旦离开摘要这类狭窄任务,表现会明显恶化。许多人认为幻觉是当前自回归架构的内在特性,并强调在把 LLMs 用于高风险场景之前,需要更好的检测、上下文约束或重新设计方案。

LLM“幻觉”的本质

  • 核心观点:自回归的逐 token 预测本质上就会产生猜测;你不可能把编造完全消除。
  • 有人认为 LLMs 一直都在做同样的过程,所以它们要么是“一直在幻觉”,要么这个词本身就有误导性。
  • 也有人强调,虽然机制相同,但输出的事实正确性不同;“幻觉率”依然是一个有用的指标。

与人类认知的比较

  • 多条评论指出,人类也会“补全空白”、误解问题,或者自信地说出错误内容;为了高效交流,做出假设是必要的。
  • 争论点在于:智能是否必须补空,还是必须知道什么时候说“我不知道”。
  • 有人把 LLM 的行为比作幼儿讲故事,或“脑子短路”与编造记忆,尤其是在记忆/上下文有限时。

架构与缓解措施

  • 提出的替代方案:模型先在内部工作一段时间,然后一次性输出完整答案,而不是自回归流式生成。
  • 讨论的技术包括:chain-of-thought、把先前输出再喂回去进行自我批评、迭代验证直到“收敛”。
  • 人们希望模型更常回答“我不知道”,但也怀疑如今的 LLMs 是否真的在内部表征知识或真相。
  • 还提出了诸如“backspace token”或更激进的 RLHF 来惩罚编造的想法,但数据和实现方式都不明确。

术语争议

  • 许多人认为“hallucination”不是合适的比喻;更偏向使用“confabulation”或“statistical guess”。
  • 反对意见认为,“hallucination”把只是在建模语言而非感知或真相的系统拟人化了。

基准范围与方法论

  • 排行榜只做摘要任务,评论者认为这是一项相对低幻觉的任务;这些数字未必能推广。
  • 幻觉检测本身又依赖另一个模型;批评者指出,如果基于模型的检测真能完全可靠,我们基本上就把问题解决了。
  • 文中提到对该基准方法论的外部批评;因此一些人对报告的百分比只给予有限权重。
  • 另有说明:约 17% 的文档因内容过滤器而被至少一个模型拒绝。

模型差异与实际可靠性

  • GPT‑4 约 3% 的摘要幻觉率被广泛质疑;用户报告在小众或技术问题上的错误率要高得多,尤其是代码(不存在的库/函数)。
  • 有人观察到 Mistral 和其他模型很容易生成“看起来合理的胡说”,这可能与 RLHF 选择有关。
  • 评论者强调,对于关键应用,即使当前最好的指标,在没有人工监督的情况下也仍然高得不可接受。