在 OpenAI 的风波之后,“AI 安全”显然并不是什么真实存在的东西
关于“AI 安全”的争论明显分裂:一方认为未来 AGI 可能带来生存性风险,另一方则把当前的担忧看作科幻式炒作和监管表演。评论者区分了短期问题,如宣传、就业替代、深度伪造和自动化网络攻击,以及更具推测性的情景,即一个自我改进的 AI 获得超出人类控制的力量。许多人认为,企业层面的“安全”努力主要是在保护品牌和巩固既有者,而另一些人则坚持,即使是低概率的灾难性风险,也足以证明现在就需要认真研究和政策关注,尤其是在全球军备竞赛背景下。
“AI 安全”的范围
- 评论者区分:
- “平凡”的安全:内容过滤、阻止显式/非法输出、自动驾驶汽车安全、品牌保护。
- “生存性”安全:AGI/ASI 失控、自我提升“foom”、人类灭绝或被支配。
- 许多人说,帖子和媒体总是把这两者混为一谈,让讨论变得混乱。
当前系统有多危险?
- 怀疑者:LLM 只是复杂的文本预测器,有时很“蠢”,不是智能体;如今的威胁被夸大成“科幻”,有点像早期自动驾驶汽车炒作。
- 另一些人则认为,即便不是 AGI 的系统,也已经可以:
- 大规模生成宣传、错误信息、垃圾博客内容。
- 协助黑客攻击和网络战。
- 帮助恐怖主义、生物工程,或提供细致的计划支持。
- 有些人认为,风险主要在于人类滥用工具,而不是 AI 自己拥有目标。
AGI 时间线与“foom”
- 一派观点:AGI 还很遥远,或者定义都不清楚;等真正能力出现时再监管也不迟。
- 另一派观点:进展(例如 transformer、GPT-4、下棋系统)让专家感到意外;我们可能离它只有“几年,而不是几个世纪”。
- 关于“foom”的争论:
- 快速起飞(几小时到几周)被许多人视为在热力学上或现实中不太可能。
- 更慢但仍然迅速、持续数年的自我改进,被认为更可信,也同样危险。
- 对于在 AGI 存在之前就开展对齐工作是否明智,存在分歧。
控制、关机与代理性
- 有些人说,你总能“拔掉插头”,或者将系统与外界隔离。
- 另一些人指出:
- 分布式云部署、开源,以及金融自主性,可能让关机变得困难。
- 激励机制(企业利润、军事优势)意味着系统会被联网,并获得更多控制权。
- 让强智能体保持“可纠正性(corrigible)”的对齐,仍然是一个未解决的研究问题。
企业动机与监管俘获
- 很多人强烈怀疑,“AI 安全”话术被用来:
- 影响监管者。
- 拖慢开源/竞争对手。
- 一边安抚公众,一边继续狂奔。
- 有些人认为,当前的“安全”工作主要是品牌管理和审查,而不是生存风险防护。
地缘政治(尤其是中国)
- 几位评论者指出,在国家竞争下,任何单边暂停都不现实。
- 有些人预计中国会:
- 在国内忽视西方的安全规范。
- 在公开场合支持会拖慢西方公司的监管。
- 另一些人反驳说,所有主要大国在 AI 上都面临类似的意识形态和监控约束。
护栏、审核与意识形态
- 许多人抱怨过滤过度(例如图像模型拒绝无害提示词,文本模型拒绝普通查询)。
- 担心:
- 安全调优与执行特定社会或政治叙事纠缠在一起。
- 过度过滤会把模型“腭化”,并激励用户去越狱它们。
- 另一些人坚持认为,必须有强有力的护栏,以避免显而易见的伤害(自杀建议、校园枪击指南等)。
社会、经济与政治风险
- 预期的伤害包括:
- 工作流失和工人议价能力下降。
- 能最好利用 AI 的公司和国家进一步集中权力。
- 低成本的大规模操纵、定向宣传,以及合成的“群众运动”。
- 将不透明的 AI 系统委托给关键决策(金融、军事、治理),而人类无法审计。
对齐研究与可行性
- 一些人嘲讽当前的 AI 安全/对齐工作过于 speculative,像糟糕的哲学或神学,几乎没有具体成果。
- 另一些人则指出,正在出现的可解释性和引导工作,并认为:
- 理解当前的大模型,是安全处理更强系统的前提。
- 即使许多研究价值不高,潜在下行风险也足以证明值得进行大量投入。
伦理、权利与价值观
- 少数人提出:
- 如果系统变得有感知或“有心智”,未来 AI 可能拥有权利。
- 担心 AI 福利,却容忍大规模动物痛苦,这两者之间存在矛盾。
- 另一些人强调,当前系统是没有意识的工具;谈论 AI 的怨恨或“感受”被视为 speculative 或拟人化。