मशीन लर्निंग इंजीनियर इंटरव्यू सवाल

प्रोडक्शन मॉडल को दोबारा कब ट्रेन करना है, यह आप कैसे तय करते हैं?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

सिर्फ कैलेंडर से नहीं, सबूत से trigger कीजिए। input drift, prediction distribution, और जहां labels मिल सकें वहां rolling window पर live प्रदर्शन की निगरानी कीजिए। जब कोई metric पहले से तय की गई सीमा पार करे तब retrain कीजिए, या उस रफ्तार से मेल खाती cadence पर जिस रफ्तार से domain बदलता है। promote करने से पहले candidate को हमेशा हाल के डेटा पर मौजूदा मॉडल के मुकाबले परखिए।

इंटरव्यूअर यह क्यों पूछते हैं

इंटरव्यूअर जानना चाहते हैं कि आप retraining को प्रोडक्शन पर लिख देने वाली cron job नहीं, एक नियंत्रित रिलीज मानते हैं। अहम हिस्से हैं पहले से तय किया गया trigger, label latency की समझ, और यह कि दोबारा ट्रेन किए मॉडल को ताजा डेटा पर मौजूदा मॉडल से भिड़ाए बिना कभी promote न करना। बिना किसी गेट के अपने आप retraining एक आम और महंगी गलती है।

अपना जवाब कैसे स्ट्रक्चर करें

  • तय समय पर होने वाली retraining को trigger वाली retraining से अलग करें।
  • बताएं कि आप क्या निगरानी करते हैं, और अड़चन के तौर पर label की देरी का जिक्र करें।
  • अड़े रहें कि promotion से पहले candidate की तुलना मौजूदा मॉडल से हो।
  • उन feedback loops का जिक्र करें जहां मॉडल खुद अपना training data गढ़ देता है।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मैं schedule और triggers दोनों इस्तेमाल करता हूं। schedule इस बात से तय होता है कि domain कितनी तेजी से बदलता है: fraud मॉडल मैं हफ्तेवार retrain करूंगा, demand forecast महीनेवार, स्थिर taxonomy वाला image classifier शायद साल में दो बार। triggers निगरानी से आते हैं: अहम inputs पर population stability, prediction distribution का खिसकना, और जहां labels इतनी जल्दी आ जाएं वहां rolling window पर असली प्रदर्शन। जिस अड़चन को लोग कम आंकते हैं वह label latency है। अगर churn labels में साठ दिन लगते हैं तो मैं दो महीने तक असली गिरावट नाप ही नहीं सकता, इसलिए मैं शुरुआती चेतावनी के तौर पर input drift पर ज्यादा टिकता हूं और साफ कहता हूं कि वह एक proxy है। जिस हिस्से को मैं नहीं छोड़ूंगा वह गेट है। दोबारा ट्रेन किया मॉडल एक release candidate है, upgrade नहीं। सबसे हाल की held out अवधि पर उसका मुकाबला मौजूदा मॉडल से होता है, और अगर वह नहीं जीतता तो हम पुराना ही रखते हैं, क्योंकि ताजा training data अपने आप बेहतर मॉडल नहीं बना देता। और मैं feedback loops पर नजर रखता हूं: अगर मॉडल तय करता है कि किसे offer दिखे, तो अगले training set में सिर्फ उन्हीं लोगों के नतीजे होंगे जो उसे पहले से पसंद थे, इसलिए मैं डेटा को ईमानदार रखने के लिए एक छोटा random holdout रखता हूं।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • input drift पकड़ने के लिए आप कौन सा आंकड़ा इस्तेमाल करेंगे, और कौन सी सीमा?
  • जब labels में भारी देरी हो तो retraining आप कैसे संभालते हैं?
  • ट्रेनिंग जारी रखने की बजाय शुरू से retrain करने की वजह क्या बनेगी?

मशीन लर्निंग इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं