Ask HN: OpenAI, Claude, और Grok एक साथ क्यों डाउन थे?

OpenAI के ChatGPT/Codex, Anthropic के Claude, और xAI के Grok सहित कई प्रमुख AI सेवाएँ एक साथ आउटेज से प्रभावित हुईं, जिससे दुनिया भर में 404s और connection errors आए। टिप्पणीकारों ने कारण के रूप में Cloudflare या cloud-provider समस्याओं से लेकर cascading overload तक के अनुमान लगाए, क्योंकि उपयोगकर्ता और tools एक provider से दूसरे पर auto failover कर रहे थे; बाद की रिपोर्टों में एक साझा xAI compute center में outage की ओर इशारा किया गया। यह घटना आज की AI infrastructure के अत्यधिक केंद्रीकृत और परस्पर-निर्भर होने की याद दिलाती है, और local या multi-provider fallbacks रखने के पक्ष में एक तर्क भी।

आउटेज के लक्षण और दायरा

  • उपयोगकर्ताओं ने रिपोर्ट किया कि ChatGPT / Codex chatgpt.com/backend-api/codex/responses पर 404s लौटा रहे थे, अक्सर Cloudflare cf-ray IDs के साथ जिनका अंत हवाई अड्डों के कोड्स से होता था।
  • कई लोगों ने बताया कि यह वैश्विक था: ब्राज़ील, भारत, यूरोप, अमेरिका, आदि से रिपोर्टें आईं।
  • Claude और Grok में भी इसी तरह की अस्थिरता दिखी (नई sessions विफल, “at capacity” संदेश, disconnects), जबकि कुछ मौजूदा sessions काम करते रहे।
  • कुछ लोगों को Gemini और विभिन्न cloud providers के साथ भी Downdetector पर समस्याएँ दिखीं, हालांकि दूसरों के अनुसार वे सेवाएँ उनके लिए ठीक चल रही थीं।
  • सेवाएँ धीरे-धीरे ठीक हुईं; कुछ उपयोगकर्ताओं ने नोट किया कि Codex/ChatGPT और Claude क्षेत्र-दर-क्षेत्र वापस आ रहे थे।

अनुमानित कारण (थ्रेड में सभी अपुष्ट)

  • साझा infra समस्याएँ:
    • Cloudflare ( cf-ray और एक साथ आए spikes के कारण), DNS/BGP, या कोई “load‑bearing” third-party dependency।
    • प्रमुख cloud providers: AWS, Azure, Google Cloud, या backbone/fiber providers।
  • Cascading overload:
    • जब एक LLM फेल होता है, तो उपयोगकर्ता और tools auto-failover करके दूसरों पर चले जाते हैं, जिससे संभवतः alternatives पर DDoS-जैसा दबाव पड़ता है।
  • Vendor-specific:
    • OpenAI के Astra release के साथ संयोग।
    • SpaceX/xAI: बाद की एक पोस्ट में xAI के एक बयान का हवाला दिया गया, जिसमें Memphis compute center में outage की बात थी, जिसका असर Grok और “compute partners” पर पड़ा, लेकिन यह स्पष्ट नहीं है कि यह सभी outages से सीधे कैसे जुड़ता है।
  • कुछ उपयोगकर्ताओं को Cloudflare HTTP/3 / R2 incident पर शक है; अन्य लोग Cloudflare नेतृत्व द्वारा किसी service disruption से इनकार की ओर इशारा करते हैं।
  • और अधिक speculative सुझाव (state actors, rogue AI, “left-pad” जैसे supply-chain bugs) को मज़ाक या अनुमान माना गया है।

Status pages और telemetry

  • OpenAI, Anthropic, और xAI की status pages ने अंततः elevated error rates और partial outages को स्वीकार किया।
  • उपयोगकर्ताओं ने incident links साझा किए और नोट किया कि official status pages अक्सर देर से अपडेट होते हैं और समस्याओं को कम दिखाते हैं।
  • Downdetector पर कई AI और cloud providers के लिए spikes दिखे, लेकिन टिप्पणीकारों ने जोर दिया कि यह user reports पर आधारित है और भ्रामक हो सकता है।

उपयोगकर्ताओं की प्रतिक्रियाएँ और निष्कर्ष

  • कई लोगों ने coding और काम के लिए LLMs पर अपनी निर्भरता व्यक्त की; कुछ ने इस outage को productivity loss का एक “natural experiment” कहा।
  • दूसरों ने local/self-hosted models (Qwen, Ollama, home GPUs) को centralized failures से बचाव के लिए एक hedge के रूप में महत्व दिया।
  • कुल मिलाकर सहमति: exact root cause स्पष्ट नहीं है; संभवतः infra issues और cross-provider load के cascading प्रभाव का मिश्रण है।