问 HN:为什么 OpenAI、Claude 和 Grok 会同时宕机?

包括 OpenAI 的 ChatGPT/Codex、Anthropic 的 Claude 和 xAI 的 Grok 在内的多个大型 AI 服务同时经历了重叠的故障,在全球范围内返回 404 和连接错误。评论者猜测原因从 Cloudflare 或云服务商问题,到用户和工具在各家服务间自动切换引发的连锁过载不等;后续报告又指向某个共享的 xAI 计算中心故障。这起事件提醒人们,如今的 AI 基础设施已经高度集中且彼此依赖,也说明准备本地或多供应商备用方案是有必要的。

故障症状与范围

  • 用户报告 ChatGPT / Codex 在 chatgpt.com/backend-api/codex/responses 返回 404,且常伴随 Cloudflare cf-ray ID,末尾带有机场代码。
  • 很多人指出这是全球性的:巴西、印度、欧洲、美国等地都有报告。
  • Claude 和 Grok 也出现类似不稳定(新会话失败、“at capacity” 提示、断连),而一些已有会话仍然可用。
  • 一些人通过 Downdetector 看到 Gemini 和各类云服务也有问题,不过也有人说这些服务对自己一直正常。
  • 服务随后逐渐恢复;一些用户表示 Codex/ChatGPT 和 Claude 正在按地区陆续恢复。

推测原因(线程中均未证实)

  • 共享基础设施问题:
    • Cloudflare(因为 cf-ray 以及同时出现的激增)、DNS/BGP,或某个“承重”的第三方依赖。
    • 主要云服务商:AWS、Azure、Google Cloud,或骨干/光纤提供商。
  • 连锁过载:
    • 当某个 LLM 失败时,用户和工具会自动切换到其他服务,可能把替代服务也“DDoS”了。
  • 特定厂商:
    • 与 OpenAI 的 Astra 发布时间 совп совп合。
    • SpaceX/xAI:后续帖子引用了一则 xAI 声明,称孟菲斯某计算中心发生故障,影响了 Grok 和“计算伙伴”,但这与所有故障的直接关联仍不清楚。
  • 有些用户怀疑是 Cloudflare 的 HTTP/3 / R2 事故;也有人提到 Cloudflare 领导层否认发生了任何服务中断。
  • 更具推测性的说法(国家行为体、失控 AI、像 “left-pad” 这样的供应链 bug)被当作玩笑或纯猜测。

状态页与遥测

  • OpenAI、Anthropic 和 xAI 的状态页最终都承认错误率升高和部分故障。
  • 用户分享了事件链接,并指出官方状态页往往滞后,且经常低估问题严重性。
  • Downdetector 显示多个 AI 和云服务都有激增,但评论者强调它基于用户报告,可能具有误导性。

用户反应与收获

  • 很多人表示自己在编程和工作中高度依赖 LLM;有人把这次故障视作一场“生产力损失的自然实验”。
  • 也有人强调本地/自托管模型(Qwen、Ollama、家用 GPU)是应对集中化故障的缓冲方案。
  • 总体共识是:确切根因不明;很可能是基础设施问题与跨服务连锁负载共同造成的。