क्या हम अपटाइम प्रतिशतों को बंद कर सकते हैं?
“चार नाइन” अपटाइम और चमकदार स्टेटस पेज जैसी सेवा-विश्वसनीयता मेट्रिक्स को अब अस्पष्ट और अक्सर भ्रामक कहा जा रहा है, खासकर जब वे बार-बार होने वाले, बिज़नेस-घंटों के आउटेज को छिपाते हैं जो वास्तविक काम रोक देते हैं। टिप्पणीकारों का तर्क है कि अपटाइम प्रतिशत यह नहीं दिखाते कि विफलताएँ कब और कैसे होती हैं, वे आपस में जुड़े सिस्टमों में कैसे फैलती हैं, या खोई हुई उत्पादकता और राजस्व के रूप में उनकी कीमत क्या होती है। कई लोग अधिक पारदर्शी, यूज़र-केंद्रित रिपोर्टिंग की मांग करते हैं—जैसे व्यवधान के वास्तविक घंटे, घटनाओं की आवृत्ति और समय, तथा मानकीकृत विश्वसनीयता सूचकांक—साथ ही यह भी इंगित करते हैं कि प्रदाताओं के पास आउटेज को कम दिखाने या घुमा देने के प्रोत्साहन होते हैं.
अपटाइम प्रतिशतों और “नाइन” पर बहस
- कई लोगों का कहना है कि “नाइन” मुख्यतः मार्केटिंग / कॉन्ट्रैक्चुअल टूल हैं, न कि यूज़र-इम्पैक्ट मेट्रिक्स।
- कई लोग तर्क देते हैं कि सामान्य लोग और एग्ज़िक्यूटिव्स वास्तव में यह नहीं समझते कि 99%, 99.9% और 99.99% कितने अलग हैं।
- कुछ का कहना है कि प्रतिशत अभी भी एक सरल प्रॉक्सी के रूप में उपयोगी हैं, खासकर स्वतंत्र सिस्टमों को जोड़ते समय (प्रायिकताओं का गुणन)।
- कुछ उद्योगों (ट्रेडिंग, इमरजेंसी सेवाएँ, टेलीकॉम, पावर) को वास्तव में 5–6 नाइन चाहिए; कई SaaS मामलों में 2–3 नाइन आर्थिक रूप से पर्याप्त हो सकते हैं।
विश्वसनीयता को प्रस्तुत करने के वैकल्पिक तरीके
- प्रतिशतों के बजाय समय के रूप में (जैसे, प्रति माह डाउनटाइम के घंटे) फ्रेम करने के लिए मज़बूत समर्थन; यह अधिक ठोस लगता है (“1% लगभग 3.5 दिन है”)।
- प्रतिवाद: “12 घंटे प्रभावित” अभी भी अस्पष्ट है — एक लंबा आउटेज बनाम कई छोटे आउटेज एक बिल्कुल अलग अनुभव हैं।
- कई लोग अधिक समृद्ध व्यू चाहते हैं: समय के साथ ग्राफ़, “विघ्नों के बीच औसत समय,” और यूज़र-केंद्रित मेट्रिक्स जैसे:
- क्षेत्र के अनुसार बिज़नेस-घंटों का अपटाइम।
- वास्तविक अनुरोध सफलता पर आधारित वेटेड अपटाइम।
- विंडोड यूज़र-अपटाइम और इलेक्ट्रिक-यूटिलिटी-स्टाइल इंडाइसेज़ (SAIDI/SAIFI/CAIDI)।
डाउनटाइम का समय और प्रभाव
- बार-बार यह बात रेखांकित की गई कि आउटेज कब होता है, यह कुल मिनटों से अधिक महत्वपूर्ण है।
- बिज़नेस-घंटों और पीक-लोड के आउटेज 3 बजे सुबह की मेंटेनेंस से कहीं अधिक नुकसानदेह हैं।
- कुछ लोग नोट करते हैं कि ग्लोबल सेवाओं में “खराब घंटे” हमेशा किसी न किसी को प्रभावित करते हैं, और आउटेज अक्सर उच्च लोड के साथ सहसंबद्ध होते हैं।
- कुछ वर्कफ़्लोज़ (जैसे लंबे CI रन) में, बहुत छोटे व्यवधान भी मानव समय के कई घंटे बर्बाद कर सकते हैं।
SLA, कॉन्ट्रैक्ट, और प्रोत्साहन
- 6 नाइन जैसे आक्रामक SLA पर चर्चा हुई, जो कुछ डोमेन में वास्तविक हैं और कुछ में हास्यास्पद।
- सेल्स अक्सर इंजीनियरिंग इनपुट के बिना ऊँचे नाइन वादा कर देती है; रिफंड आमतौर पर छोटे होते हैं और वास्तविक मुआवज़े से अधिक एग्ज़िट राइट्स के बारे में होते हैं।
- वेंडर कभी-कभी अंतर्निहित क्लाउड फेल्योर को बाहर रख देते हैं, जिससे गारंटी कमज़ोर हो जाती है।
स्टेटस पेज, भरोसा, और पारदर्शिता
- कई लोगों को लगता है कि आधिकारिक स्टेटस पेज समस्याओं को कम दिखाते हैं या उनके प्रभाव को हल्का करते हैं; थर्ड-पार्टी मॉनिटर अधिक ईमानदार माने जाते हैं।
- कुछ लोगों को संदेह है कि बड़े प्रदाताओं की प्रकाशित अपटाइम (जैसे हाल की GitHub/Microsoft समस्याएँ) देखी गई विश्वसनीयता से मेल नहीं खाती।
- स्टेटस पेज को सीधे बाहरी मॉनिटरिंग से जोड़ने और हर घटना, चाहे कितनी भी छोटी हो, स्वतः रिपोर्ट करने की माँग।
कितनी विश्वसनीयता “काफ़ी” है?
- एक दृष्टिकोण: अधिकांश संगठन उन मामूली नाइन के लिए ज़्यादा भुगतान करते हैं जो परिणामों में सार्थक सुधार नहीं लाते; बेहतर है कि पैसा कहीं और लगाया जाए।
- विरोधी दृष्टिकोण: छोटे, दुर्लभ आउटेज भी श्रृंखलाबद्ध परिचालन, अनुपालन, और प्रतिष्ठात्मक लागतें पैदा करते हैं; एंटरप्राइज़ेस चतुराई से अधिक विश्वसनीयता को महत्व देती हैं।