神话化 AI 会让我们更可能无法把它运用好(2023)
围绕什么应该算作“人工智能”的争论主导了这场讨论;许多人将当下的大语言模型——强大但容易出错的统计系统——与长期想象中的类似人类或“AGI”级智能进行对比。评论者争辩当前模型究竟是真在推理,还是只是在模拟推理;“智能”和“AI”的定义变化如何扭曲公众预期;以及为何对这项技术过度吹捧或神话化可能导致管理不善、恐慌失当和糟糕政策。与此同时,也有人呼吁更清晰的术语、AI 输出的数字来源机制,以及在经济影响和未来存在性风险方面保持谨慎的文化。
文章的范围与时效性
- 有几位评论者指出这篇文章大约有 3 年历史;有人认为它如今仍然有效,因为现代 LLM 只是同一基本方法的放大版。
- 也有人认为现在转发它是在钓鱼,因为模型进展得太快,而且一些用户在 LLM 遭到批评时会变得很防御。
什么算作“AI”和“智能”
- 对把 LLM 称为“AI”存在强烈分歧:
- 一方认为它们是高级文本生成器,不是自主智能;“AI”应该保留给类似人类或达到“AGI”级别的系统。
- 另一方则认为,这个领域几十年来一直把“AI”用于从游戏 AI 到 NPC 的各种东西,而 LLM 在实践中显然符合“人工”加“智能行为”。
- 许多人指出“智能”并没有清晰、可衡量的定义;人们常常是在各说各话,而当计算机攻克某项任务时,目标又经常被移动。
- 有人建议放弃把“智能”当作科学术语,而改为讨论具体能力或技能。
LLM 的能力与失败
- 支持者强调它们能解决原创数学题、编程、通过考试;这无法与计算器进行有意义的比较。
- 怀疑者则强调其失败模式:幻觉、不合逻辑的计划(例如走路 vs. 开车)、提示注入、工具状态混淆、语言漂移,以及脆弱的推理。
- 讨论的焦点之一是,这些失败是否在本质上不同于人类错误,还是只是另一种形式的易错推理。
- 有人把当前的多次调用/代理式配置类比为概率算法:反复运行,直到出现一个足够好的答案。
图灵测试、AGI 与拟人化
- 对于现代模型是否“通过”了稳健的图灵测试存在争议,尤其是在面对有动机的人工评审时。
- 有人把 LLM 看作一种“外星”智能;也有人认为把这称作“推理”不过是在重新包装模式匹配。
- 有人担心,对系统进行神话化和拟人化(例如用“推理”“代理”等营销术语)会误导公众和政策制定者。
风险、自主性与实用性
- 一派观点认为:当前系统是强大的工具,但离自主接管还远得很;关于“存在性风险”的讨论显得为时过早,甚至带有准宗教色彩。
- 另一派则认为谨慎并不为时过早;随着自主性增强以及对基础设施的访问能力提高,系统可能会变得危险,尤其是当本地、快速模型持续改进时。
来源、隐私与治理
- 许多人对 AI 输出的“数字来源”(digital provenance)很感兴趣——一种相当于“查看源代码”(View Source)的机制,用来说明哪些训练数据模式塑造了行为,以支持问责和调试。
- 有人更愿意把隐私定义为对数据被提取内容的控制,而不是模糊的“免受打扰的权利”或“免受操纵的权利”。
- 还有人认为,命名和概念框架非常重要:对技术的错误命名会导致错误预期、炒作和政策失误。