पहले यह पता लगाएं कि values missing क्यों हैं, क्योंकि fix उसी mechanism से तय होता है। missing completely at random हो तो सादा imputation चल जाता है; missing at random हो तो देखे गए variables पर आधारित imputation चाहिए; missing not at random का मतलब है कि missing होना खुद एक signal है और उसे एक feature बन जाना चाहिए। split से पहले कभी impute न करें, और जब भी pattern में जानकारी हो, एक was missing indicator जोड़ें।
इंटरव्यूअर यह क्यों पूछते हैं
कमजोर उम्मीदवार सीधे mean imputation पर कूद जाते हैं। इंटरव्यूअर देख रहा है कि आप पहले वजह की जांच करते हैं या नहीं, क्योंकि असली सिस्टम में missing होना आम तौर पर एक टूटी हुई पाइपलाइन, कोई ऐच्छिक form field, या ऐसा field होता है जो सिर्फ एक customer segment के लिए मौजूद है, और इन सबका मतलब अलग अलग कदम है। वे यह भी सुनना चाहते हैं कि imputation सिर्फ training डेटा पर fit होता है, क्योंकि सब कुछ पर fit करना leak करता है।
अपना जवाब कैसे स्ट्रक्चर करें
- यह तय करने से पहले कि खाली जगह कैसे भरनी है, पूछें कि डेटा missing क्यों है।
- तीनों mechanisms को तीन अलग जवाबों से जोड़ें।
- बताएं कि missing flag अक्सर अपने आप में एक मजबूत feature होता है।
- यह बताएं कि imputation training fold के अंदर fit होता है।
उदाहरण जवाब
पहली चीज जो मैं करता हूं वह statistical नहीं है, वह उस इंसान से बातचीत है जिसके पास उस field की जिम्मेदारी है। missing होने का आम तौर पर कोई खास मतलब होता है। मैंने जिस credit dataset पर काम किया, उसमें करीब पांचवें हिस्से rows में income खाली था, और पता चला कि वे एक fast track application flow से आए थे जो वह पूछता ही नहीं था। यह बिल्कुल भी random नहीं है, और उन applicants की default दर अलग थी, तो खाली होने की यह बात model के सबसे मजबूत predictors में से एक निकली। मैंने एक is missing flag जोड़ा और उसने अपनी जगह कमाई। मशीनी तौर पर, अगर वह सचमुच random noise है और column ज्यादातर भरा हुआ है, तो median imputation और एक flag ठीक है। अगर वह दूसरे देखे गए variables पर निर्भर है, तो मैं iterative या model आधारित imputation इस्तेमाल करता हूं। अगर किसी column का करीब आधे से ज्यादा हिस्सा missing है तो मैं उसे आम तौर पर हटा देता हूं, क्योंकि उस मोड़ पर मैं ज्यादातर अपनी ही धारणाएं impute कर रहा होता हूं। और मैं जो भी इस्तेमाल करूं वह सिर्फ training split पर fit होता है और फिर validation पर लागू किया जाता है, क्योंकि पूरे dataset पर median निकालना चुपचाप leak कर देता है।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- gradient boosted trees missing values को अपने आप कैसे संभालते हैं?
- split से पहले impute करने पर क्या गड़बड़ होती है?
- जो feature सिर्फ नए customers के लिए missing है, उसे आप कैसे संभालेंगे?
डेटा साइंटिस्ट के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें