我们把胡扯自动化了

批评者认为,像 ChatGPT 这样的大语言模型在哲学意义上是“胡扯生成器”:它们会生成流畅、具有说服力的文本,却并不内建对真相的关注,这使得当用户不去验证输出时,它们自信的错误尤其危险。另一些人则反驳说,如果由有知识的人把它们当作工具使用——例如用于代码辅助、搜索、总结或构思——只要清楚理解其局限、训练数据质量以及被滥用的风险(如宣传或法律失误),这些系统就能显著提升生产力。

有用性 vs. “胡扯”本质

  • 很多评论者说,LLM 在难以检索的事实、头脑风暴、改写、总结,以及对问题进行“橡皮鸭调试”方面极其有用。
  • 也有人强调,这并不与它们是“胡扯生成器”相矛盾:它们优化的是看起来合理的语言,而不是真相。
  • 还有人认为,这篇文章低估了这种二元性:产生胡扯的同一机制,也能比传统工具更快地浮现有价值的信息。

验证、专业知识与风险

  • 普遍共识是:答案必须验证;不少人会习惯性地交叉核对输出。
  • 批评者指出,很多用户并不会验证,并举例称有律师因提交来自 ChatGPT 的伪造案例而受到制裁。
  • 一个反复出现的观点是:当用户本身具备领域知识、能够判断正确性时,LLM 最安全也最有效。
  • 担忧在于:在高风险领域(法律、医疗、政策)里,自信但错误的答案可能很危险,而且没有内置的“闭环”事实核查。

与搜索引擎和 Wikipedia 的比较

  • 有人觉得 LLM 在冷门查询上比 Google 更好;也有人怀疑这些轶事,或将其归因于 Google 的衰退。
  • Wikipedia 常被拿来对比:它会引用来源,并且有社区纠错;LLM 不会揭示来源,也无法被系统性纠正。
  • 有几位预测 LLM 最终会像 Wikipedia 一样被广泛接受,只是失败模式不同。

“胡扯”的定义与认识论

  • 多条评论提到哲学上的定义:对真相无所谓的言说,而不只是“错误”。
  • 按这个角度看,LLM 总是在产出胡扯,因为它们建模的是文本概率,而不是真实世界或意图。
  • 也有人反驳说这有些言过其实:模型编码了大量准确信息,而且常常表现得像一个知识渊博的普通人。

编码与生产力用例

  • 许多开发者报告了很大的生产力提升:生成样板代码、重构、文档、RAG 风格的代码搜索,以及解释代码片段。
  • 也有人记录到很高的出错率,尤其是在 C/C 类语言中,或者一些细微问题(安全性、边缘情况)看起来“能跑”但其实是错的。
  • 常见看法是:它们像一个聪明但资历尚浅的助手——适合草稿和模式,不适合未经审查的生产代码。

数据、对齐与社会层面的担忧

  • 有人把胡扯归咎于质量参差不齐的训练数据(社交媒体、宣传),也有人归因于架构本身(没有世界模型或事实核查)。
  • 担忧包括:可规模化的宣传、诈骗、在法庭中的滥用,以及信息信任的侵蚀。
  • 也有人认为 LLM 只是把既有的“胡扯经济”自动化了(官僚报告、营销文案),其影响既有解放性,也有威胁性。