问 HN:为什么 OpenAI、Claude 和 Grok 会同时宕机?
包括 OpenAI 的 ChatGPT/Codex、Anthropic 的 Claude 和 xAI 的 Grok 在内的多个大型 AI 服务同时经历了重叠的故障,在全球范围内返回 404 和连接错误。评论者猜测原因从 Cloudflare 或云服务商问题,到用户和工具在各家服务间自动切换引发的连锁过载不等;后续报告又指向某个共享的 xAI 计算中心故障。这起事件提醒人们,如今的 AI 基础设施已经高度集中且彼此依赖,也说明准备本地或多供应商备用方案是有必要的。
故障症状与范围
- 用户报告 ChatGPT / Codex 在
chatgpt.com/backend-api/codex/responses返回 404,且常伴随 Cloudflarecf-rayID,末尾带有机场代码。 - 很多人指出这是全球性的:巴西、印度、欧洲、美国等地都有报告。
- Claude 和 Grok 也出现类似不稳定(新会话失败、“at capacity” 提示、断连),而一些已有会话仍然可用。
- 一些人通过 Downdetector 看到 Gemini 和各类云服务也有问题,不过也有人说这些服务对自己一直正常。
- 服务随后逐渐恢复;一些用户表示 Codex/ChatGPT 和 Claude 正在按地区陆续恢复。
推测原因(线程中均未证实)
- 共享基础设施问题:
- Cloudflare(因为
cf-ray以及同时出现的激增)、DNS/BGP,或某个“承重”的第三方依赖。 - 主要云服务商:AWS、Azure、Google Cloud,或骨干/光纤提供商。
- Cloudflare(因为
- 连锁过载:
- 当某个 LLM 失败时,用户和工具会自动切换到其他服务,可能把替代服务也“DDoS”了。
- 特定厂商:
- 与 OpenAI 的 Astra 发布时间 совп совп合。
- SpaceX/xAI:后续帖子引用了一则 xAI 声明,称孟菲斯某计算中心发生故障,影响了 Grok 和“计算伙伴”,但这与所有故障的直接关联仍不清楚。
- 有些用户怀疑是 Cloudflare 的 HTTP/3 / R2 事故;也有人提到 Cloudflare 领导层否认发生了任何服务中断。
- 更具推测性的说法(国家行为体、失控 AI、像 “left-pad” 这样的供应链 bug)被当作玩笑或纯猜测。
状态页与遥测
- OpenAI、Anthropic 和 xAI 的状态页最终都承认错误率升高和部分故障。
- 用户分享了事件链接,并指出官方状态页往往滞后,且经常低估问题严重性。
- Downdetector 显示多个 AI 和云服务都有激增,但评论者强调它基于用户报告,可能具有误导性。
用户反应与收获
- 很多人表示自己在编程和工作中高度依赖 LLM;有人把这次故障视作一场“生产力损失的自然实验”。
- 也有人强调本地/自托管模型(Qwen、Ollama、家用 GPU)是应对集中化故障的缓冲方案。
- 总体共识是:确切根因不明;很可能是基础设施问题与跨服务连锁负载共同造成的。