ETL डेटा को load करने से पहले transform करता है, आम तौर पर अलग compute cluster पर। ELT पहले raw डेटा warehouse में load करता है, फिर वहीं SQL से उसे transform करता है। यह बदलाव इसलिए आया क्योंकि cloud warehouses ने storage सस्ता और compute elastic बना दिया, इसलिए raw डेटा रखकर उसी जगह transform करना iterate करने में तेज है, audit करने में आसान है, और source systems से दोबारा extract किए बिना पूरा इतिहास फिर से process करने देता है।
इंटरव्यूअर यह क्यों पूछते हैं
यह जांचता है कि आप सिर्फ टूल के नाम रटते हैं या modern data stack के पीछे की economics समझते हैं। इंटरव्यूअर चाहते हैं कि आप बताएं ELT raw डेटा बचाकर रखता है इसलिए transformations दोबारा दोहराए जा सकते हैं, और यह भी कि वह हर हाल में बेहतर नहीं है: भारी unstructured processing, सख्त privacy जरूरतें, या महंगी per query billing, ये सब आपको load से पहले transform करने की तरफ वापस धकेल सकते हैं।
अपना जवाब कैसे स्ट्रक्चर करें
- दोनों को इस आधार पर परिभाषित करें कि transform कहां चलता है।
- ELT की तरफ खिसकाने वाली economics समझाएं।
- replay और auditability के लिए raw डेटा रखने पर जोर दें।
- वे मामले बताएं जहां ETL अब भी जीतता है।
- इसे warehouse में अपनी layers की बनावट से जोड़ें।
उदाहरण जवाब
फर्क सिर्फ इतना है कि transform कहां होता है। ETL रास्ते में transform करता है, इसलिए warehouse में जो उतरता है वह पहले से modeled होता है। ELT raw उतारता है और warehouse के अंदर SQL से model करता है। ELT के हावी होने की वजह यह है कि storage सस्ता हो गया और warehouse compute elastic, इसलिए raw payload फेंक देने की अब कोई अच्छी वजह नहीं बची। यह बात लोगों की उम्मीद से ज्यादा मायने रखती है। जब हमें अपने revenue logic में बग मिला, तो हमने अठारह महीने के marts raw से करीब चालीस मिनट में दोबारा बना लिए, बिना source APIs पर लौटे, जिनमें से कुछ सिर्फ नब्बे दिन का डेटा रखते हैं। इससे transformation logic किसी proprietary टूल की जगह SQL के रूप में version control में भी रहता है। फिर भी, बड़ी binary files decode करने जैसे कामों के लिए, या जब मुझे personal data को warehouse छूने से पहले ही drop या tokenize करना हो, तब मैं load से पहले ही transform करूंगा, क्योंकि sensitive डेटा एक बार अंदर आ गया तो उसे un load नहीं किया जा सकता।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- ELT पाइपलाइन में personal data को आप कहां mask करेंगे?
- raw, staging और mart layers को आप कैसे ढांचा देते हैं?
- per query billing आपका जवाब कब बदल देगी?
डेटा इंजीनियर के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें