डेटा एनालिस्ट इंटरव्यू सवाल

तीन महीने पहले चलाई गई एनालिसिस दोबारा बनाई जा सके, यह आप कैसे पक्का करते हैं?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

कोड को किसी local notebook या तात्कालिक query tab के बजाय version control में रखें, तारीखों को hard code करने के बजाय parameter बनाएं, और दर्ज करें कि नंबर किन source table से और किस snapshot या run की तारीख से आए। परिभाषाएं और कोई भी मैनुअल छूट वहीं साथ में लिखें। अगर अंदर की table बदलती रहती हैं, तो कोड के साथ aggregate किया गया output भी सुरक्षित रखें ताकि प्रकाशित आंकड़े जांचे जा सकें।

इंटरव्यूअर यह क्यों पूछते हैं

दोहराने लायक होना ही उस एनालिस्ट को अलग करता है जिसके काम पर भरोसा करके आगे बढ़ा जा सके, उस एनालिस्ट से जिसके नंबर सवाल उठते ही चुपचाप हवा हो जाते हैं। इंटरव्यूअर version control, parameter वाले input, और यह साफ समझ चाहते हैं कि source डेटा बदलता है, तो महीनों बाद वही query दोबारा चलाने पर जायज तौर पर अलग नंबर आ सकते हैं जब तक आपने उस वक्त की स्थिति पकड़ी न हो।

अपना जवाब कैसे स्ट्रक्चर करें

  • query या notebook को laptop पर नहीं, version control में रखें।
  • तारीखें और filter hard code करने के बजाय parameter बनाएं।
  • source table, चलाने की तारीख और कोई भी मैनुअल छूट दर्ज करें।
  • output का aggregate सुरक्षित रखें, क्योंकि स्रोत समय के साथ बदलते हैं।
  • परिभाषाएं वहां लिखें जहां अगला व्यक्ति उन्हें पाएगा।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मुख्य बात यह है कि कोड मेरी मशीन के अलावा कहीं और रहे, तो किसी बिना नाम वाले notebook या ऐसे query tab के बजाय जिसे मैं शुक्रवार तक बंद कर दूंगा, एक repository में। तारीखें parameter बनती हैं, क्योंकि किसी date range को hard code करने का मतलब है कि अगला व्यक्ति उसे चुपचाप किसी और अवधि पर दोबारा चलाएगा और बिना किसी चेतावनी के अलग जवाब पाएगा। मैं दर्ज करता हूं कि मैंने कौन सी table इस्तेमाल कीं और कब चलाया, और सबसे अहम कोई भी मैनुअल फैसला, तो अगर मैंने test account या कोई एक अजीब हफ्ता बाहर किया है, तो वह मेरी याददाश्त में रहने के बजाय फाइल में लिखा होता है। बारीक समस्या यह है कि source table बदलती रहती हैं। कोई मार्च में मेरी query दोबारा चलाता है और उसे अलग नंबर मिलते हैं, इसलिए नहीं कि मैं गलत था बल्कि इसलिए कि कोई type 1 dimension ऊपर से लिख दी गई या देर से डेटा आ गया। इसलिए जो कुछ भी प्रकाशित होता है उसके लिए मैं कोड के बगल में aggregate किया हुआ output सुरक्षित रख लेता हूं। इस तरह जब कोई छह महीने बाद किसी आंकड़े पर सवाल करे, तो मैं दिखा सकता हूं कि उस वक्त डेटा कैसा था और तब से क्या बदला।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • जो source table रोज ऊपर से लिख दी जाती है, उसे आप कैसे संभालेंगे?
  • किसी एनालिसिस के README में आप क्या शामिल करेंगे?
  • notebook को रिव्यू लायक तरीके से version control में आप कैसे रखते हैं?

डेटा एनालिस्ट के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं