डेटा साइंटिस्ट इंटरव्यू सवाल

किसी model में data leakage आप कैसे पकड़ते हैं?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

जब भी performance हैरान करने वाली हद तक अच्छी हो, leakage का शक करें। मुख्य जांचें: ऐसे features खोजें जिनकी importance नामुमकिन हद तक ऊंची है, पक्का करें कि हर feature prediction के समय जाना जा सकता था, जांचें कि preprocessing training fold के अंदर fit हुई, और देखें कि कोई entity train और test दोनों में तो नहीं है। offline से production तक तेज गिरावट अक्सर leakage का खुद को उजागर करना ही होती है।

इंटरव्यूअर यह क्यों पूछते हैं

leakage वह नाकामी है जो सारी मानक जांचें पार कर जाती है, क्योंकि उससे model शानदार दिखता है, इसलिए इंटरव्यूअर जानना चाहते हैं कि आपका शक बुरी नहीं, अच्छी खबर से जागता है। वे timestamp वाला अनुशासन सुनते हैं (क्या यह prediction के समय जाना जा सकता था), preprocessing के लिए fold की सफाई, और दोहराई गई entities के लिए grouping, क्योंकि यह आम तौर पर इन्हीं तीन रास्तों से घुसती है।

अपना जवाब कैसे स्ट्रक्चर करें

  • बताएं कि उम्मीद से ज्यादा अच्छी performance ही पहला अलार्म है।
  • हर feature पर prediction के समय जाना जा सकता था वाला test लगाएं।
  • जांचें कि preprocessing और resampling fold के अंदर हुई।
  • देखें कि split के आर पार कोई entity दोहराई तो नहीं गई।
  • अपना पकड़ा हुआ एक ठोस leak बताएं।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मेरा ट्रिगर अच्छी खबर है। अगर किसी ऐसी समस्या पर model 0.97 AUC पर छलांग लगा देता है जिसे बिजनेस मुश्किल मानता है, तो मैं जब तक उल्टा साबित न हो जाए यही मानता हूं कि मैंने कुछ leak किया है। हर feature पर मैं जो मुख्य test चलाता हूं वह timestamp का सवाल है: जिस पल हम production में इस record को score करते हैं, क्या यह value मौजूद होती, और क्या उसकी यही value होती? हैरान करने वाली संख्या में features नाकाम होते हैं। सबसे खराब वाला जो मैंने पकड़ा वह account status नाम का feature था। वह मासूम दिखता था, पर operations टीम customer के churn करने के बाद उसे closed कर देती थी, और training snapshot में prediction की तारीख वाली value के बजाय मौजूदा value थी, तो model सीधे जवाब पढ़ रहा था। उसे हटाने से AUC करीब 0.94 से 0.79 पर आ गया, और असली नंबर वही था। इसके अलावा मैं जांचता हूं कि scalers, encoders और कोई भी resampling fold के अंदर fit हुए, कि कोई customer ID train और test दोनों में नहीं फैली, और कि target encodings fold से बाहर निकाले गए। और मैं feature importance को आखिर में रिपोर्ट करने की चीज मानने के बजाय शुरू में ही देखता हूं, क्योंकि जब एक ही feature ज्यादातर model उठा रहा हो तो वह आम तौर पर खोज नहीं, leak होती है।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • target encoding leak कैसे करती है, और आप इसे सुरक्षित तरीके से कैसे करते हैं?
  • leakage और किसी मजबूत feature के जायज signal में क्या फर्क है?
  • किसी और के बनाए model का leakage के लिए audit आप कैसे करेंगे?

डेटा साइंटिस्ट के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं