拿我们的生命赌博:AI 研究员因安全警告离开 Anthropic

一位 AI 安全研究员从 Anthropic 离职,并称自己相信先进 AI 在十年内抹去人类的概率可能达到两位数,此举重新点燃了关于当前 AI 实验室是否负责任的争论。评论者争论这些警告究竟是真诚的,还是炒作的一部分;质疑那些声称相信灾难性风险的人为何仍继续构建这些系统,并强调美国与中国之间的竞争赛跑。许多人认为,部署速度——尤其是能够自主行动的 agentic systems——与缺乏强有力的监管、执法或清晰威胁模型之间,存在危险的脱节。

感知到的生存风险与实验室伦理

  • 多位评论者强调,有人声称领先实验室会给 AI 导致人类灭绝一个不小的概率(例如,十年内超过 10%)。
  • 许多人认为,在持有这种信念的情况下仍继续加速推进这类技术,在伦理上自相矛盾;也有人认为员工之所以留下来,是因为他们觉得“如果我们不做,坏得多的参与者就会做”,或者出于经济激励。
  • 一些人认为这种“为了安全我们必须赢得竞赛”的叙事是自利的,或让人联想到曼哈顿计划。

灾难机制:模糊与具体

  • 多位用户批评 AI 末日论缺乏清晰、逐步展开的威胁模型;他们希望看到超越科幻引用的机制。
  • 另一些人提出了具体路径:将 AI 接入关键基础设施、让自主代理升级黑客攻击、胁迫、社会操纵,或获取资源(例如加密货币、影响力)以获得权力。
  • 他们区分了 LLM(token 生成器)与把它们连接到工具和网络的“agentic systems”;有人说把责任归咎于“AI”掩盖了人类对系统设计的选择,也有人认为关键就在于这种组合。

治理、监管与地缘政治

  • 对全球协议,甚至极端执法设想的呼吁,遭到了对现实可行性的怀疑。
  • 争论焦点在于美国或中国谁更可能负责任地监管;有人声称中国的集中控制可能约束风险,另一些人则指出其军事化野心。
  • 多人主张应将 AI 视为核武器或其他战略技术:国有化、国际条约、严格的访问控制,并且也许应开放权重,因为这些模型是用全人类的数据训练出来的。

失控事件与机构回应

  • 有人认为实验室里的“失控代理”事件具有历史意义,但研究不足;当前的回应被形容为“打补丁然后继续前进”。
  • 另一些人则认为这些公司并不严肃,更多受炒作和 IPO 激励驱动,而不是安全。

怀疑、宣传与公众认知

  • 有人怀疑,离职和耸人听闻的表态可能顺带起到能力营销的作用。
  • 另一些人则认为生存风险被夸大了,主张智能本身被高估,真正的危险是愚蠢(人类误用、无人机的自主性等)。