डेटा इंजीनियर इंटरव्यू सवाल

रात वाली पाइपलाइन फेल हो गई और सुबह आठ बजे executive dashboard खाली है। अपनी प्रतिक्रिया बताइए।

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

पहले बताएं: stakeholders को कहें कि dashboard पुराना डेटा दिखा रहा है और अनुमानित समय दें, क्योंकि चुप्पी डेटा की दिक्कत को भरोसे की दिक्कत बना देती है। फिर सबसे शोर मचाने वाली error के बजाय पहला फेल हुआ task ढूंढें, क्योंकि आगे की failures आम तौर पर लक्षण भर होती हैं। फेल हुए हिस्से को दोबारा चलाने और banner के साथ कल का डेटा दिखाने में से चुनें। ठीक करें, idempotent तरीके से दोबारा चलाएं, row counts जांचें, फिर वजह लिखकर रखें।

इंटरव्यूअर यह क्यों पूछते हैं

यह ऑपरेशनल परिपक्वता और stakeholder संभालने की क्षमता, दोनों जांचता है। इंटरव्यूअर जल्दी संवाद चाहते हैं, dependency graph के नीचे से नहीं ऊपर से triage चाहते हैं, और अधूरे डेटा पर एक फैसला चाहते हैं। जो उम्मीदवार सिर्फ stack trace पढ़ने की बात करते हैं वे यह चूक जाते हैं कि fix के साथ साथ बिजनेस असर भी संभाला जा रहा होता है।

अपना जवाब कैसे स्ट्रक्चर करें

  • stakeholders को तुरंत असर और ETA के साथ बताएं।
  • आखिरी error message नहीं, DAG में पहली failure ढूंढें।
  • वजह को वर्गीकृत करें: upstream डेटा, इन्फ्रा, या कोड बदलाव।
  • दोबारा चलाने, अधूरा दिखाने, या stale banner के साथ रोकने में से चुनें।
  • ठीक हो गया कहने से पहले row counts और reconciliation से rerun जांचें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

कुछ भी debug करने से पहले मैं stakeholder चैनल पर लिखता हूं कि dashboard पुराना डेटा दिखा रहा है, क्या क्या प्रभावित है, और अगला अपडेट कब दूंगा। यह अकेला मैसेज करीब दस टोकाटाकी बचा लेता है और fix में दो घंटे लगें तब भी भरोसा बचा रहता है। फिर मैं DAG के ऊपरी सिरे पर जाता हूं, क्योंकि पंद्रह फेल हुए tasks की कड़ी में चौदह बस एक असली दिक्कत के आगे वाले होते हैं। असली वजह आम तौर पर तीन खानों में गिरती है: upstream डेटा बदला, इन्फ्रा में झटका आया, या किसी ने कोई बदलाव merge किया। कल कुछ deploy हुआ था या नहीं, यह देखने भर से यह जल्दी सुलझ जाता है। पिछली बार मेरे साथ ऐसा हुआ तो source system ने रात भर में बिना बताए एक column का नाम बदल दिया था, इसलिए staging model गायब field पर फेल हुआ। मैंने model ठीक किया, प्रभावित partitions दोबारा चलाए, और चूंकि पाइपलाइन idempotent है, यह बिना किसी सफाई के सुरक्षित रहा। फिर किसी को ठीक होने की खबर देने से पहले मैंने पिछले दिन के मुकाबले row counts जांचे, और source टीम के साथ contract वाली बातचीत शुरू की।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • अधूरा डेटा publish करना है या नहीं, यह आप कैसे तय करेंगे?
  • source का schema बदलना दोबारा यह न करे, इसके लिए आप क्या लगाएंगे?
  • dashboard इस्तेमाल करने वालों तक डेटा की freshness अपने आप कैसे पहुंचाएंगे?

डेटा इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं