मशीन लर्निंग इंजीनियर इंटरव्यू सवाल

प्रोडक्शन में किसी मॉडल के लिए आप क्या निगरानी करते हैं, और असल में किस चीज पर किसी को पेज जाता है?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

तीन परतों की निगरानी कीजिए: सर्विस की सेहत (latency, error rate, throughput), डेटा की सेहत (input distributions, null और unknown category दरें, feature freshness), और मॉडल की सेहत (prediction distribution, और labels आने पर प्रदर्शन)। सर्विस की नाकामियों और input pipeline के टूटने पर पेज कीजिए, क्योंकि उन पर तुरंत कुछ किया जा सकता है। धीरे धीरे होने वाले drift को रात तीन बजे के पेजर पर नहीं, dashboard और समीक्षा पर भेजिए।

इंटरव्यूअर यह क्यों पूछते हैं

इंटरव्यूअर देखना चाहते हैं कि आप उन signals को अलग करते हैं जिन्हें अभी इंसान चाहिए, उनसे जिन्हें अगले हफ्ते फैसला चाहिए। धीमे drift पर अलर्ट करना लोगों को ऐसी चीज के लिए जगाता है जो वे रात तीन बजे ठीक कर ही नहीं सकते, और टीम को अलर्ट नजरअंदाज करना सिखा देता है। feature freshness और unknown category rate का नाम लेना मजबूत संकेत है, क्योंकि बासी या टूटी feature pipeline प्रोडक्शन की सबसे आम असली घटना है।

अपना जवाब कैसे स्ट्रक्चर करें

  • निगरानी को सर्विस, डेटा और मॉडल की परतों में बांटें।
  • बताएं कि कौन सी परत पेज के लायक है और कौन सी नहीं।
  • feature freshness और unknown category rate का खास तौर पर नाम लें।
  • label की देरी और labels आने से पहले आप क्या निगरानी करते हैं, यह बताएं।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मैं इसे तीन परतों में सोचता हूं। सर्विस स्तर पर वही आम चीजें हैं, p99 latency, error rate, throughput, और उस पर पेज जाता है, क्योंकि errors लौटाता मॉडल किसी भी और outage जैसा ही है। असली ML घटनाएं डेटा स्तर पर रहती हैं: input feature distributions, null दरें, unknown category दरें, और feature freshness, यानी online store में सबसे नई वैल्यू कितनी पुरानी है। freshness की मुझे सबसे ज्यादा परवाह है, क्योंकि टूटी हुई ऊपरी job कोई error नहीं फेंकती, वह बस कल की वैल्यू serve करती रहती है और मॉडल आत्मविश्वास से बकवास लौटाता रहता है। उस पर पेज जाता है। मॉडल स्तर पर prediction distribution है और labels आने पर असली प्रदर्शन। prediction distribution का तेजी से खिसकना अलर्ट के लायक है; धीरे धीरे खिसकना dashboard की चीज है और बातचीत की, पेज की नहीं, क्योंकि धीमे drift के लिए किसी को जगाने का मतलब है कि महीने भर में अलर्ट कोई पढ़ेगा ही नहीं। इन सबकी शक्ल label की देरी तय करती है। अगर ground truth में हफ्ते लगते हैं तो मैं accuracy को लगभग real time में नाप ही नहीं सकता, इसलिए मैं input और output distributions पर proxy की तरह टिकता हूं और साफ कहता हूं कि वे proxy हैं।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • high cardinality वाले categorical feature पर drift आप कैसे पकड़ेंगे?
  • prediction distribution के खिसकाव के लिए वाजिब अलर्ट सीमा क्या है?
  • जिस मॉडल के labels इंसानी समीक्षा से आते हैं, उसकी निगरानी आप कैसे करते हैं?

मशीन लर्निंग इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं