डेटा साइंटिस्ट इंटरव्यू सवाल

आपके पास एक fraud dataset है जिसमें 0.3 प्रतिशत rows positive हैं। इस imbalance को आप कैसे संभालेंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

सबसे पहले metric बदलें, क्योंकि 0.3 प्रतिशत पर accuracy बेकार है: precision recall AUC इस्तेमाल करें, या किसी तय alert budget पर recall। फिर resampling से पहले class weights आजमाएं, क्योंकि weighting ज्यादा सरल है और नकली rows नहीं गढ़ता। अगर resample करना ही हो तो सिर्फ training fold के अंदर करें। आखिर में probabilities को दोबारा calibrate करें, क्योंकि weighting और oversampling दोनों predicted scores बिगाड़ देते हैं।

इंटरव्यूअर यह क्यों पूछते हैं

imbalance वही जगह है जहां उम्मीदवार बिना यह पूछे कि इससे फायदा होगा भी या नहीं, आदतन SMOTE उठा लेते हैं। इंटरव्यूअर क्रम देखना चाहता है: पहले metric, फिर सादा weighting, फिर जरूरत पड़ने पर ही resampling, और हमेशा fold के अंदर। calibration का जिक्र मजबूत संकेत है, क्योंकि जो resampled model एक प्रतिशत बार होने वाली चीज पर 0.9 निकालता है, वह downstream की किसी भी expected value गणना को तोड़ देता है।

अपना जवाब कैसे स्ट्रक्चर करें

  • डेटा को छूने से पहले evaluation metric ठीक करें।
  • synthetic oversampling से पहले class weights उठाएं।
  • इस पर जोर दें कि कोई भी resampling सिर्फ training fold के अंदर होती है।
  • बाद में probabilities को दोबारा calibrate करने का जिक्र करें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

पहली चीज जो मैं बदलता हूं वह है स्कोरबोर्ड, क्योंकि जो model हर बार कहे कि fraud नहीं है वह 99.7 प्रतिशत सही होता है और पूरी तरह बेकार भी। मैं precision recall AUC इस्तेमाल करता हूं और, उससे ज्यादा काम की चीज, उस alert volume पर recall जिसे टीम सचमुच review कर सकती है। फिर मैं loss में class weights के साथ सादा शुरू करता हूं, जिसकी कोई कीमत नहीं लगती और अक्सर ज्यादातर फायदा वहीं मिल जाता है। SMOTE या undersampling पर मैं तभी जाता हूं जब weighting अटक जाए, और सच कहूं तो tabular fraud डेटा पर synthetic minority samples मुझे फीके लगे हैं, क्योंकि interpolate किए गए points feature space के उन इलाकों में बैठते हैं जो हैं ही नहीं। दो बातों पर मैं सख्त हूं। resampling training fold के अंदर होती है, split से पहले कभी नहीं, वरना validation set में training rows की लगभग नकलें आ जाती हैं और स्कोर कहानी बन जाता है। और इसमें से कुछ भी करने के बाद predicted probabilities calibrated नहीं रहतीं, तो अगर downstream कोई उस स्कोर को किसी रकम से गुणा कर रहा है, मैं एक साफ holdout पर calibration step fit करता हूं। मेरे पिछले fraud model पर इससे expected loss का अनुमान model के बदलाव से भी ज्यादा खिसका।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • class weighting probability calibration को क्यों तोड़ देती है?
  • आप calibrate कैसे करेंगे, और किस डेटा पर?
  • किस मोड़ पर आप तय करेंगे कि positive class इतनी दुर्लभ है कि उसे model करना ही ठीक नहीं?

डेटा साइंटिस्ट के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं