Ask HN: GitHub के कर्मचारी, क्या हो रहा है? क्यों?

GitHub की बढ़ती outages को कई कारकों के संगम से जोड़ा जा रहा है: legacy infrastructure से Microsoft Azure में एक कठिन migration, AI-generated coding activity का उछाल जिसने कथित तौर पर एक साल में commits को 14x बढ़ा दिया, और Actions तथा Copilot जैसी features से आने वाला भारी load। टिप्पणीकार बहस कर रहे हैं कि क्या Microsoft का स्वामित्व और Azure की reliability मूल समस्या है, या कोई भी बड़ा platform इतने तेज़ी से बढ़ते एक mature, complex system को scale करने में मुश्किल झेलेगा। कई लोगों को उम्मीद है कि GitHub भारी और free usage पर सख्त limits या नई pricing लागू करेगा, लेकिन चिंता है कि लगातार instability पहले ही उस trust को नुकसान पहुँचा रही है जो अब core developer infrastructure बन चुका है।

उच्च-स्तरीय निदान

  • दो प्रमुख व्याख्याएँ हावी हैं:
    • AI-चालित ट्रैफ़िक वृद्धि का भारी उछाल (commits, Actions, webhooks) एक परिपक्व प्लेटफ़ॉर्म पर दबाव डाल रहा है।
    • GitHub के legacy stack और अपने datacenters से Azure में कई वर्षों का कठिन migration, जिससे नए failure modes सामने आ रहे हैं।
  • कई लोगों का मानना है कि दोनों आपस में जुड़ रहे हैं: परिवर्तन की अवस्था में मौजूद architecture पर नए load patterns पड़ रहे हैं।

Microsoft का अधिग्रहण और Azure migration

  • ऐतिहासिक uptime graphs अधिग्रहण से पहले stability और उसके बाद अधिक incidents दिखाते हैं।
  • कुछ लोगों का तर्क है कि यह निम्न कारणों से है:
    • अधिक features (Actions, Copilot, Codespaces, security, packages) और failure के लिए बहुत बड़ा surface area।
    • Azure में ongoing migration, जिसमें आंशिक/दोहरी environments शामिल हैं, जिसे “painful” बताया गया है।
  • अन्य लोग इस correlation को Microsoft और/या Azure को मूल समस्या मानते हैं; समर्थक जवाब देते हैं कि Azure कई विशाल services को सफलतापूर्वक चलाता है।

AI-चालित वृद्धि और “slop”

  • GitHub leadership के हवाले से ~14× commit growth और तेज़ user growth का उल्लेख किया गया है, जिसका कारण AI coding और agents बताया गया है।
  • कई लोगों को विशाल मात्रा में कम-मूल्य या bot traffic का संदेह है:
    • हज़ारों छोटे commits वाले repos।
    • Bots द्वारा अपने-आप repos बनाना, apps install करना, और webhooks fire करना।
    • Scraping attacks और CI/Actions का अति-उपयोग।
  • इस बात पर बहस है कि क्या यह एक वैध बहाना है या planning failure, क्योंकि AI-चालित वृद्धि एक साल से अधिक समय से दिखाई दे रही है।

Scaling, architecture, और सीमाएँ

  • चर्चा में शामिल है:
    • GitHub एक shared-state system है (repos, PRs, issues), जबकि अधिकांशतः stateless LLM APIs होते हैं, जिससे scaling कठिन हो जाती है।
    • Rails बनाम “modern” stacks; कुछ लोग Ruby को दोष देते हैं, जबकि अन्य कहते हैं कि भाषा से अधिक architecture और design मायने रखते हैं।
    • आक्रामक limits और rate-limiting की कमी को मूल कारण माना गया; per-user या per-repo throttles और pricing की माँग की गई।
  • एक विस्तृत insider-style टिप्पणी इसे पहले कभी न देखे गए पैमाने की scaling घटना के रूप में प्रस्तुत करती है, न कि साधारण incompetence के रूप में।

व्यवसाय, संगठन, और उपयोगकर्ता प्रभाव

  • infra को एक cost center माना जा रहा है जो AI पहलों और अन्य प्राथमिकताओं से प्रतिस्पर्धा कर रहा है।
  • कई layoffs को विशेषज्ञता की हानि और धीमी recovery के लिए दोषी ठहराया गया है।
  • उपयोगकर्ता सुझाव देते हैं:
    • free unlimited private repos को समाप्त करना या कड़ा करना।
    • भारी/abusive users से शुल्क लेना या daily commits पर cap लगाना।
  • अन्य लोग चिंतित हैं कि अधिक शुल्क लेने से quality नहीं सुधरेगी और uptime खराब होने के बावजूद enterprise users switching costs के कारण फँसे रहेंगे।

हालिया incident postmortem (17 Aug, 2026)

  • thread में उद्धृत official report एक बड़े outage का कारण यह बताती है:
    • नए traffic peak ने load balancers को saturate कर दिया।
    • गलत-configured Istio sidecar autoscaling।
    • HAProxy flow exhaustion और retry storms, खासकर VS Code/Copilot token logic से।
  • आगे के कदमों में autoscaling policies, retry behavior, और client amplification को ठीक करना शामिल है, लेकिन प्रतिभागी इसे systemic reliability और operational gaps का प्रमाण मानते हैं।