page को acknowledge करें, यूज़र पर असर पक्का करें, और साफ owner तथा एक communication channel के साथ incident घोषित करें। फिर diagnose करने से पहले खून बहना रोकें: देखें कि हाल में क्या बदला और अगर टाइमलाइन बैठती है तो संदिग्ध को rollback या बंद कर दें। channel में कामों की चलती हुई टाइमलाइन रखें, stakeholders को तय अंतराल पर बताते रहें, और root cause analysis तभी शुरू करें जब असर काबू में हो।
इंटरव्यूअर यह क्यों पूछते हैं
यह जितना तकनीकी कौशल का सवाल है उतना ही मिज़ाज और प्रोसेस का। इंटरव्यूअर देखना चाहता है कि आप mitigation को diagnosis से अलग रखते हैं, भूमिकाएं तय करते हैं बजाय इसके कि सब समानांतर डिबग करते रहें, और आप बताते रहते हैं। जो उम्मीदवार असर पक्का किए बिना और हाल के deploys देखे बिना सीधे log analysis में कूदते हैं वे outage लंबे कर देते हैं, और यह सवाल उस आदत को जल्दी उजागर कर देता है।
अपना जवाब कैसे स्ट्रक्चर करें
- acknowledge करें, यूज़र पर असली असर पक्का करें, और owner के साथ घोषित करें।
- diagnosis से पहले mitigation को तरजीह दें और वजह बताएं।
- सबसे ज़्यादा फल देने वाली परिकल्पना के तौर पर हाल के बदलाव पहले देखें।
- communication की लय और टाइमलाइन रखना कवर करें।
उदाहरण जवाब
पहले मैं page acknowledge करता हूं ताकि कोई और वही काम दोहराए नहीं, फिर देखता हूं कि यूज़र सच में प्रभावित हैं या नहीं, क्योंकि alert बजना और ग्राहक को तकलीफ होना हमेशा एक बात नहीं होती। अगर असली है तो मैं incident घोषित करता हूं, incident commander खुद बनता हूं या साफ शब्दों में किसी और को सौंपता हूं, और एक channel खोलता हूं ताकि टाइमलाइन के लिए एक ही जगह हो। फिर diagnosis से पहले mitigation। सबसे ज़्यादा फल देने वाला अकेला सवाल यह है कि क्या बदला, तो मैं पिछले कुछ घंटों के deploys, feature flags और इंफ्रास्ट्रक्चर बदलाव देखता हूं, और अगर कुछ भी असर की शुरुआत से मेल खाता है तो उसे rollback कर देता हूं या flag बंद कर देता हूं। लोगों को तकलीफ देना रोकने के लिए मुझे bug समझने की ज़रूरत नहीं। इस बीच मैं तय लय पर अपडेट डालता रहता हूं, करीब हर पंद्रह या बीस मिनट पर, तब भी जब अपडेट यही हो कि हम अब भी देख रहे हैं, क्योंकि चुप्पी लोगों को अलग अलग आकर पूछने पर मजबूर करती है। मैं साथ के साथ timestamps के साथ कामों के नोट लिखता जाता हूं, कुछ postmortem के लिए और कुछ इसलिए कि जो बाद में जुड़े वह बिना टोके पकड़ सके।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- अगर हाल में कुछ बदला ही न हो और वजह साफ न हो तो?
- कब escalate करना है या किसी को जगाना है, यह कैसे तय करते हैं?
- incident के बीच कोई एग्ज़ीक्यूटिव अपडेट मांगे तो कैसे संभालते हैं?
DevOps इंजीनियर के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें