कोड-होस्टिंग दिग्गज GitHub ने एक ब्लॉग पोस्ट प्रकाशित किया है जिसमें बताया गया है कि इस सप्ताह की शुरुआत में सात घंटे और 47 मिनट तक चले आउटेज के दौरान क्या हुआ था। सोमवार, 17 अगस्त को जो रुकावट हुई, उसका पता अमेरिका में इसके एक डेटा सेंटर में रखे गए एक महत्वपूर्ण बुनियादी ढांचे के घटक से लगाया गया था।
माइक्रोसॉफ्ट के स्वामित्व वाले प्लेटफॉर्म ने कहा कि जब ट्रैफिक एक नए शिखर पर पहुंच गया तो घटक स्केल करने में विफल रहा, जिसके परिणामस्वरूप क्षमता का दबाव GitHub के सिस्टम में फैल गया, जिससे प्रमाणीकरण विफल हो गया और कई GitHub सेवाएं बाधित हो गईं।
आउटेज ने github.com, प्रमाणीकरण, GitHub क्रियाएँ, API, पुल अनुरोध, समस्याएँ और Copilot को बाधित कर दिया, जिससे संभवतः दुनिया भर के हजारों डेवलपर्स और संगठन प्रभावित हुए।
जहाँ अधिकांश GitHub सेवाएँ उस दिन पहले ही ठीक हो गईं, वहीं कुछ Copilot सेवाओं को अधिक समय लगा। अपने पुनर्प्राप्ति प्रयासों के हिस्से के रूप में, GitHub ने कहा कि उसने कई समन्वित कार्रवाइयां शुरू कीं जैसे टीम ट्रैफ़िक को फिर से रूट करना, प्रभावित बुनियादी ढांचे को अलग करना और चरणों में सेवाओं को बहाल करना।
प्लेटफ़ॉर्म ने आउटेज के मूल कारण के रूप में कोड या कॉन्फ़िगरेशन परिवर्तनों को भी खारिज कर दिया। GitHub ने कहा, दोनों घटनाएं अपने मूल में क्षमता विफलताएं थीं।
"मांग क्षमता से अधिक होने से पहले हम महत्वपूर्ण घटकों को स्केल करने में विफल रहे। अप्रैल के बाद से, मासिक प्रतिबद्धताएं 1.4 बिलियन से बढ़कर 2.9 बिलियन हो गई हैं। यह वृद्धि हमारे सिस्टम पर दबाव को स्पष्ट करती है, लेकिन यह इन रुकावटों को माफ नहीं करती है।"
अकेले अगस्त महीने में GitHub को दो बड़ी आउटेज घटनाओं का सामना करना पड़ा है। 6 अगस्त को, एक कॉन्फ़िगरेशन परिवर्तन ने अनजाने में GitHub पेज परिनियोजन को संसाधित करने वाली सेवा की क्षमता को कम कर दिया। इसके परिणामस्वरूप उपयोगकर्ताओं को कोपायलट क्लाउड एजेंट का उपयोग करके कार्य शुरू करने में देरी का अनुभव हुआ और वे इन कार्यों की स्थिति नहीं देख पाए।
6 अगस्त और 17 अगस्त की घटनाओं के जवाब में, GitHub ने कहा कि वह पुनः प्रयास तूफान और कैस्केडिंग लोड को रोकने के लिए सेवा-से-सेवा इंटरैक्शन में लगातार पुनः प्रयास सीमाएं, पुनः प्रयास बजट और परिवर्तनीय टाइमआउट लागू कर रहा है। इसके अतिरिक्त, यह उन घटकों की पहचान करने के लिए निम्न-प्राथमिकता वाले CPU और मेमोरी अलर्ट की भी समीक्षा कर रहा है जो अचानक ट्रैफ़िक स्पाइक के दौरान विफल हो सकते हैं।
हालाँकि ये तात्कालिक समाधान हैं, GitHub ने इसी तरह की रुकावटों को रोकने के लिए अपनी दीर्घकालिक योजना की भी रूपरेखा तैयार की है। कंपनी ने निम्नलिखित तीन प्रमुख प्राथमिकताएँ रेखांकित कीं:
-क्षमता जोड़ना -कार्यकुशलता में सुधार - वास्तु संबंधी बाधाओं को दूर करना
इसके अलावा, GitHub ने कहा कि उसने Microsoft Azure में अपने माइग्रेशन को तेज करते हुए 3 मिलियन से अधिक CPU कोर, 120 पेटाबाइट हाई-स्पीड स्टोरेज और महत्वपूर्ण नेटवर्क क्षमता जोड़ी है।
वर्तमान में, Azure GitHub के प्लेटफ़ॉर्म लोड का लगभग 58 प्रतिशत और सभी Git संचालन का आधा हिस्सा प्रदान करता है, जो मई 2026 में प्लेटफ़ॉर्म लोड का 12 प्रतिशत था। "हमारा अगला मील का पत्थर एक आर्किटेक्चर है जो पाठकों की संख्या के साथ रैखिक रूप से पढ़ने की क्षमता को मापता है, असीमित रीड ऑपरेशन को सक्षम करता है। हम इसे धीरे-धीरे शुरू करेंगे, सबसे बड़े मोनोरेपो के साथ शुरुआत करते हुए,'' कंपनी ने कहा।
"इसके अलावा, हम महत्वपूर्ण प्रणालियों को भी अलग कर रहे हैं और उनके बीच साझा निर्भरता को हटा रहे हैं। यह कार्य आउटेज की संभावना को कम करने और आउटेज होने पर उसके प्रभाव को सीमित करने के लिए डिज़ाइन किया गया है।
Comments ()
Be the first to share your perspective on this story!