साइट रिलायबिलिटी इंजीनियर इंटरव्यू सवाल

आपकी आधी सर्विस एक साथ टाइम आउट होने लगती हैं और डिप्लॉय कुछ हुआ ही नहीं। आप वह इंसिडेंट कैसे चलाएंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

इंसिडेंट घोषित करें, एक incident commander तय करें, और जांच को संवाद से अलग रखें। फिर साझा डिपेंडेंसी खोजें: authentication, DNS, कोई डेटाबेस, कोई सर्टिफिकेट, service mesh का control plane, या कोई क्लाउड zone। देखें कि डिप्लॉय के बाहर क्या बदला, यानी config push, feature flag, DNS रिकॉर्ड, एक्सपायर होते सर्टिफिकेट, और प्रोवाइडर का status। निदान से पहले राहत दें, यानी लोड गिराएं, failover करें, या शक वाला flag बंद करें, फिर यूजर को दिखने वाले SLI से जांचें।

इंटरव्यूअर यह क्यों पूछते हैं

एक साथ और चौड़ी नाकामी साझा डिपेंडेंसी की पहचान है, और इंटरव्यूअर देखना चाहते हैं कि आपकी सहज प्रवृत्ति दस सर्विस एक साथ डिबग करने की है या साझा कारण ढूंढने की। वे incident command भी परख रहे हैं: भूमिकाओं का बंटवारा, व्यवस्थित संवाद, और पूरी तरह समझने से पहले राहत देने का अनुशासन।

अपना जवाब कैसे स्ट्रक्चर करें

  • पहले इंसिडेंट का ढांचा खड़ा करें: commander, संवाद, नोट लिखने वाला।
  • पैटर्न से सोचें: एक साथ और चौड़ा यानी साझा डिपेंडेंसी।
  • गिनाएं कि डिप्लॉय के अलावा क्या बदला।
  • root cause से पहले जो पलटा जा सकने वाला लीवर है उससे राहत दें।
  • यूजर को दिखने वाले संकेतों से रिकवरी पक्की करें, फिर पोस्टमॉर्टम तय करें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

बिना डिप्लॉय के चौड़ी और एक साथ आई खराबी लगभग कभी दस अलग अलग बग नहीं होती, वह उन सबके नीचे बैठी एक ही चीज होती है। तो मैं फौरन इंसिडेंट का ढांचा खड़ा करता हूं, एक commander और एक संवाद संभालने वाला, फिर साझा परतों की लिस्ट पर लगता हूं: auth सर्विस, DNS, मुख्य डेटाबेस, mesh का control plane, सर्टिफिकेट, और क्लाउड प्रोवाइडर की सेहत। साथ ही मैं पूछता हूं कि कोड के अलावा क्या बदला, क्योंकि config push और feature flag ऐसे बदलाव हैं जिन्हें लोग गिनना भूल जाते हैं। हमारे साथ ठीक यही पैटर्न एक बार आया था और निकला कि एक अंदरूनी certificate authority का नवीनीकरण ऐसा था कि एक intermediate चुपचाप एक्सपायर हो गया, तो हर mutual TLS handshake एक ही मिनट में फेल होने लगा। पहचान यह थी कि नाकामियां एप्लिकेशन स्तर की नहीं, कनेक्शन स्तर की थीं। वह जांच चलते हुए मैं राहत का एक लीवर तैयार रखना चाहता हूं, आम तौर पर गैरजरूरी ट्रैफिक गिराना या दूसरे region पर failover, क्योंकि सोचते वक्त पूरी तरह टूटे रहने से मुझे खराब हालत में पर स्थिर रहना बेहतर लगता है। फिर सिर्फ हरे pod नहीं, असली यूजर मेट्रिक्स से जांच करता हूं।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • DNS की दिक्कत और नेटवर्क की दिक्कत में आप जल्दी से फर्क कैसे करेंगे?
  • अनजान खराबी के दौरान दूसरे region पर failover को लेकर आपकी नीति क्या है?
  • जवाब देने वालों का ध्यान भटकाए बिना आप हितधारकों को कैसे जानकारी देते रहेंगे?

साइट रिलायबिलिटी इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं