filter करने, join करने और aggregate करने के लिए SQL में ही रहें, क्योंकि काम डेटा के पास ही होता है और उसे हिलाए बिना बढ़ता है। Python तब जाएं जब आपको सांख्यिकीय modeling, दोहराव या simulation, जटिल string या text processing, किसी बाहरी API को call, या दोबारा बनाने लायक chart चाहिए। एक काम का नियम: पहले SQL में aggregate करके छोटा कीजिए, फिर उस छोटे नतीजे को उन कामों के लिए Python में लाइए जिनमें SQL कमजोर है।
इंटरव्यूअर यह क्यों पूछते हैं
इंटरव्यूअर यहां किसी भाषा का पक्षधर नहीं, एक व्यावहारिक इंसान चाहते हैं। सबसे मजबूत जवाब दिखाते हैं कि लाखों कच्ची पंक्तियां local memory में खींचना एक आम और पूरी तरह टाली जा सकने वाली गलती है, और कि version control में रखे model के भीतर बैठा SQL अक्सर उस notebook से कहीं ज्यादा संभालने लायक होता है जो सिर्फ एक ही आदमी के laptop पर सही चलता है।
अपना जवाब कैसे स्ट्रक्चर करें
- SQL का अपना मैदान बताएं: पैमाने पर set वाले काम।
- वे ठोस काम गिनाएं जो Python में जाना जायज ठहराते हैं।
- पहले aggregate, फिर export वाला नियम बताएं।
- संभालने लायक होना और इसे दोबारा कौन चलाएगा, इसका जिक्र करें।
- मानें कि टीम की परंपरा भी मायने रखती है।
उदाहरण जवाब
मेरा डिफॉल्ट है कि जो भी filter, join या aggregate है वह SQL में हो, क्योंकि गणना वहीं होती है जहां डेटा रहता है और मैं किसी group by के लिए gigabyte तार पर नहीं हिला रहा जिसे warehouse सेकंडों में कर देता। मैं Python तब जाता हूं जब काम ऐसा हो जिसमें SQL सचमुच कमजोर है: कोई model fit करना, simulation चलाना, गंदे text की parsing, किसी बाहरी API तक पहुंचना, या ऐसे chart बनाना जिन्हें मैं हूबहू दोबारा बना सकूं। मैं जो नियम मानता हूं वह है पहले aggregate करके छोटा करना। summarized नतीजा खींचिए, शायद पचास हजार पंक्तियां, कच्ची दो करोड़ नहीं, जो मैंने लोगों को करते और फिर हैरान होते देखा है कि उनका kernel क्यों मर गया। दूसरा कारक है संभालने लायक होना। अगर यह एनालिसिस हर महीने कोई और दोबारा चलाने वाला है, तो test के साथ version control में रखे model का SQL उस notebook से बेहतर है जो एक ही व्यक्ति के environment पर निर्भर है। अगर यह एक बार की खोजबीन है, तो notebook बिल्कुल ठीक है और लिखने में तेज भी।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- किसी एक बार के notebook को किसी और के लिए दोहराने लायक आप कैसे बनाएंगे?
- आप pandas कब इस्तेमाल करेंगे और warehouse में कब करेंगे?
- जो एनालिसिस आपके laptop की memory से बड़ी हो जाए, उसे आप कैसे संभालते हैं?
डेटा एनालिस्ट के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें