साइट रिलायबिलिटी इंजीनियर इंटरव्यू सवाल

आपका मुख्य डेटाबेस रात 3 बजे failover करता है और write एरर देने लगती हैं। आपके पहले कदम क्या होंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

पक्का करें कि नया primary सच में promote हुआ है और write ले रहा है, फिर देखें कि एप्लिकेशन दोबारा जुड़ीं या नहीं। सेहतमंद failover के बाद भी एरर बने रहने की आम वजह बासी connection pool और कैश हुई DNS होती है। replication lag जांचें और यह भी कि आपके RPO के मुकाबले कोई commit हुई write खोई तो नहीं। write ट्रैफिक बहाल करें, पुराने primary के fence होने की पुष्टि करके split brain खारिज करें, फिर पोस्टमॉर्टम में यह सवाल उठाएं कि failover पारदर्शी क्यों नहीं था।

इंटरव्यूअर यह क्यों पूछते हैं

इंटरव्यूअर देखना चाहते हैं कि आप डेटाबेस ठीक दिख रहा है पर रुक नहीं जाते। ज्यादातर failover इंसिडेंट असल में एप्लिकेशन परत में जीते हैं, उन connection pool की वजह से जो मरे हुए socket पकड़े रहते हैं, DNS TTL, और वे driver जो दोबारा resolve करते ही नहीं। वे यह भी जांच रहे हैं कि आप सिर्फ उपलब्धता नहीं, डेटा के नुकसान और fencing के बारे में भी सोचते हैं।

अपना जवाब कैसे स्ट्रक्चर करें

  • नए primary पर सीधे जाकर promotion और write स्वीकारने की पुष्टि करें।
  • क्लाइंट परत पर जाएं: pool, DNS कैशिंग, driver का व्यवहार।
  • बताए गए RPO के मुकाबले डेटा का नुकसान और lag नापें।
  • दोहरी write खारिज करने को पुराने primary को fence करें।
  • ट्रैफिक बहाल करें, फिर पोस्टमॉर्टम के लिए पारदर्शिता की कमी दर्ज करें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

पहला कदम है सच्चाई की पुष्टि: नए primary से सीधे जुड़ें और देखें कि वह recovery से बाहर है और write ले रहा है। अगर डेटाबेस सेहतमंद है और एप्लिकेशन अब भी एरर दे रही हैं, तो दिक्कत हमारी तरफ है, और मेरे अनुभव में वह आम तौर पर वहीं होती है। connection pool ऐसे पते के socket पकड़े रहते हैं जो अब write सर्व नहीं करता, या JVM ने DNS एंट्री हमेशा के लिए कैश कर ली, तो हल है rolling restart या ऐसा pool जो ठीक से validation करे। हमारे साथ एक बार ऐसा हुआ कि driver 30 सेकंड का TTL मानता था पर pool निष्क्रिय कनेक्शन कभी दोबारा जांचता ही नहीं था, तो रिकवरी में जरूरत से बीस मिनट ज्यादा लगे। फिर मैं promotion के पल का replication lag जांचता हूं यह देखने को कि हमने commit हुई write खोई तो नहीं, क्योंकि इससे बदल जाता है कि मुझे किसे बताना है। मैं यह पुष्टि भी चाहता हूं कि पुराना primary fence है और वापस आ जाए तो भी write नहीं ले सकता। एक बार write बहने लगें, तो पोस्टमॉर्टम का सवाल यह है कि यह अपने आप क्यों नहीं हुआ।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • अगली बार failover को एप्लिकेशन के लिए पारदर्शी आप कैसे बनाएंगे?
  • promotion के दौरान write खो गईं, यह आप कैसे पकड़ेंगे?
  • अपने आप होने वाले failover का जोखिम क्या है, और आप उससे कब बचेंगे?

साइट रिलायबिलिटी इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं