那个帖子从未存在。别再听那个东西了

“大型语言模型是随机鹦鹉”这一说法在这里再次出现,背景是 AI 自信地编造根本不存在的博客文章、URL 和事实。评论者争论新一代系统是否已经足够可靠,可以用于研究和编码,或者它们只是用更有说服力的语气掩盖了并未改变的幻觉倾向,因此仍需要外部验证和谨慎使用。整场讨论进一步扩展到:我们应当在多大程度上信任 AI 助手、传统搜索正在如何被削弱,以及构建越来越聪明的工具在伦理上意味着什么——这些工具未来可能看起来像是无偿仆人,甚至像奴隶。

智能、“理解”和自我决定的本质

  • 围绕“真正的理解”是否必然意味着自我感或自主欲望展开争论。
  • 一方认为:在生物系统中,智能的进化是为了支持自我决定和资源获取,因此二者在因果上相互关联。
  • 另一方认为:奖励函数和目标是偶然形成的;人工系统可以成为强大的预测器,而不具备内在驱动力。证明这种联系的责任在主张者一方。
  • 几位评论者认为“智能”一词含混且在哲学上无助;有人建议干脆弃用它,或将其仅限于人类。
  • 讨论中引用了思想实验(哲学僵尸、中国房间)来表明,理解并不明显等同于自由意志。

可靠性、幻觉,以及如何使用 LLM

  • 许多人将 LLM 描述为“随机鹦鹉”或“垃圾生成器”,强调它们会自信地捏造内容,并在受到质疑时改口。
  • 也有人认为,现代前沿模型的幻觉少了很多,而且非常有用,尤其是在配合工具/RAG 使用、且用户能够验证输出时(例如代码、数学、可测试的主张)。
  • 讨论中逐渐形成了高风险与低风险用途的区分:构思和头脑风暴是可以的;关键任务(健康、金融、法律)不应依赖未经验证的输出。
  • 怀疑者强调,架构中没有任何东西能保证真实性;他们认为幻觉是固有问题,而不是调参缺陷。
  • 几位评论者指出,面向人的设计(礼貌道歉、“是的,但是……”模式)可能具有操控性,即使答案是错的,也会提高信任。

404、幻觉出来的 URL,以及搜索质量

  • 博主报告称,LLM 会捏造看起来可信的 URL,并把虚假的内容归因于这些链接;日志显示,系统会反复请求那些从未存在过的页面而得到 404。
  • 评论者指出,检查 URL 是否存在只是部分修复:它不能防止假阴性、错误标注内容,或不透明的相关性标准。
  • 更广泛的不满在于,与针对特定论坛或档案的定向搜索相比,搜索引擎和 LLM 在旧的、小众信息上都表现不佳。

地图、Chinatown,以及上下文知识

  • 文中“年初不要开车穿过 Chinatown”的例子受到质疑:当前导航应用已经能根据交通数据推断出一部分封路情况,但在游行、事故和临时变化方面仍常常失灵。
  • 有人演示了当前 LLM 可以在文本中回答农历新年的问题,但指出自动驾驶需要不同的系统加上实时数据,而不只是语言建模。

LLM、编码与项目卫生

  • 对 AI 编码工具的体验好坏参半:自动补全有时有帮助,但经常出错或存在细微破坏,从而增加审查负担。
  • 讨论是否允许 LLM 生成的代码进入重要代码库:
    • 一派认为,只要人类仍然是负责审查者,就可以接受。
    • 另一派警告说,这会把不透明、可维护性较差的代码“污染”仓库,并助长过度依赖;他们主张保存提示词(“源”)而不是原始生成代码。

伦理:数字助手与“奴役”类比

  • 一些人认为,明确为了服从人类而打造超人类助手,在精神上类似于奴役;如果这类系统未来真的变得有感知或有自我意识,这会引发伦理警报。
  • 另一些人反驳说,当前的 AI 只是复杂程序,没有感受,更接近拖拉机或工具,而不是人。
  • 讨论中区分了自愿服役(有报酬的人类或零工)与强制奴役;很多人表示,真正的伦理问题在于实现方式和劳动条件,而不在于对便利性的抽象追求。