उन लक्षणों पर alert करें जो ग्राहक को दिखेंगे और जिन पर कोई इंसान अभी कुछ कर सकता है, आमतौर पर आपके service objective से जुड़े: बढ़ी हुई error rate, target तोड़ती latency, बिना रुके बढ़ती queue, फेल हुआ backup। बाकी सब log और dashboard पर रखें, CPU जैसे अलग अलग resource metric समेत, जो जांच के लिए काम के हैं पर trigger के तौर पर कमजोर। अगर किसी alert का जवाब यह है कि acknowledge करके दोबारा सो जाओ, तो वह एक ticket होना चाहिए।
इंटरव्यूअर यह क्यों पूछते हैं
alert का डिजाइन ऑपरेशनल परिपक्वता के सबसे साफ संकेतों में से है। इंटरव्यूअर लक्षण आधारित alerting चाहता है, किसी को जगाने के लिए एक साफ कसौटी, और यह समझ कि बहुत ज्यादा alert बहुत कम से बुरे हैं क्योंकि वे लोगों को pager नजरअंदाज करना सिखा देते हैं। ऐसी चीजें गिनाना जिन पर alert होना ही चाहिए भले वे यूजर को दिखें नहीं, जैसे certificate की expiry और फेल हुए backup, व्यावहारिक चौड़ाई दिखाता है।
अपना जवाब कैसे स्ट्रक्चर करें
- कसौटी बताएं: यूजर को दिखे, अर्जेंट हो, और कुछ किया जा सके।
- उदाहरण दें कि क्या इस कसौटी पर खरा उतरता है और क्या नहीं।
- समझाएं कि वजह आधारित resource alert शोर क्यों पैदा करते हैं।
- अपवाद कवर करें और बताएं कि alert की क्वालिटी आप कैसे परखते हैं।
उदाहरण जवाब
मेरी कसौटी तीन चीजें हैं: ग्राहक प्रभावित है या होने वाला है, यह अर्जेंट है, और अभी कोई इंसान कुछ कर सकता है। इनमें से कोई भी झूठी हो, तो वह ticket या dashboard है। तो objective से ऊपर error rate, target तोड़ती latency, बिना रुके बढ़ती queue, checkout का फेल होना, ये सब page करते हैं। अस्सी प्रतिशत CPU नहीं करता, क्योंकि वह पूरी तरह ठीक हालत भी हो सकती है और वह मुझे यह कुछ नहीं बताता कि कोई भुगत रहा है या नहीं; उसकी जगह dashboard पर है, तब के लिए जब मैं जांच कर रहा होऊं। लक्षणों के बजाय वजहों पर alert करना ही वह तरीका है जिससे एक ही incident के चालीस alert आते हैं और टीम channel mute कर देती है। कुछ अपवाद मैं हमेशा रखता हूं: certificate की expiry, क्योंकि वह तब तक छिपी रहती है जब तक तबाही न बन जाए, backup की नाकामी, और सख्त quota की सीमा पास आना, क्योंकि तीनों तब तक चुप रहते हैं जब तक आपका पूरा हफ्ता बर्बाद न कर दें। और मैं alert नियमित रूप से देखता हूं, कि क्या बजा और उस पर किसी ने असल में किया क्या। जो बार बार बजता है और कभी किसी काम तक नहीं ले जाता वह हटा दिया जाता है या नीचे कर दिया जाता है, क्योंकि शोर मचाता pager बिना pager से बुरा है।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- जिस asynchronous pipeline में यूजर के सामने वाली latency ही नहीं है, उस पर आप alert कैसे करेंगे?
- जो alert लगातार बजता रहता है, उसके लिए आपकी प्रक्रिया क्या है?
- एक ही incident से चालीस अलग page बनने से आप कैसे बचते हैं?
क्लाउड इंजीनियर के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें