पहले उसे चुपचाप चलाइए: मौजूदा मॉडल के साथ shadow mode में चलाइए, जहां वह live traffic को score करे लेकिन उसके output पर कोई कार्रवाई न हो, और score distributions, latency तथा feature availability की तुलना कीजिए। अगर वह ठीक दिखे तो छोटे प्रतिशत वाले canary पर जाइए और बिजनेस metric पर online experiment चलाइए, साथ में guardrails। पुराना वर्जन load किया हुआ रखिए ताकि rollback एक config बदलाव हो, दोबारा deploy नहीं।
इंटरव्यूअर यह क्यों पूछते हैं
offline सुधार भरोसे के साथ online सुधार में नहीं बदलता, और इंटरव्यूअर सुनना चाहते हैं कि आप यह जानते हैं। shadow deployment वही खास तरीका है जिसे वे सुनना चाहते हैं, और उसके बाद offline metrics पर भरोसा करने की बजाय असली online टेस्ट। यह बताना कि rollback तुरंत होना चाहिए, और guardrail metrics उतने ही मायने रखते हैं जितना असली target metric, ऑपरेशनल परिपक्वता दिखाता है।
अपना जवाब कैसे स्ट्रक्चर करें
- shadow mode से शुरू करें और बताएं कि उस दौरान आप क्या तुलना करते हैं।
- असली online experiment के साथ छोटे canary पर जाएं।
- target metric के साथ साथ guardrail metrics का नाम लें।
- rollback को config पलटना बनाएं और उसका trigger पहले से तय करें।
उदाहरण जवाब
offline बेहतर होने का मतलब online बेहतर होना नहीं है, इसलिए मैं किसी validation आंकड़े के दम पर सीधे promote नहीं करता। पहला कदम shadow mode है: नया मॉडल उन्हीं live requests को score करता है, हम उसका output log करते हैं, और उस पर कोई कार्रवाई नहीं होती। इससे वे उबाऊ लेकिन जानलेवा चीजें पकड़ी जाती हैं, जैसे feature availability का फर्क, latency में गिरावट, अनपेक्षित nulls, और मुझे एक ही traffic पर दोनों score distributions की तुलना करने का मौका मिलता है। अगर नए मॉडल के scores खिसके हुए हैं तो ranking quality सुधरने पर भी नीचे की thresholds हिलानी पड़ेंगी, और यह प्रोडक्शन से कहीं बेहतर है कि shadow में पता चले। फिर कुछ प्रतिशत पर canary, बिजनेस metric पर ढंग के online experiment के साथ, AUC पर नहीं। उसके साथ मैं guardrails पहले से तय करता हूं: p99 latency, error rate, और कोई ऐसी चीज जो मॉडल के आत्मविश्वास से गलत होने को पकड़ ले जिसे मुख्य metric चूक जाता, जैसे flag rate में बड़ा खिसकाव। rollback एक config बदलाव होना चाहिए जिसमें पुराना वर्जन load रहे, ताकि वह सेकंडों में हो जाए, और मैं launch से पहले वे आंकड़े लिख देता हूं जो उसे trigger करेंगे, क्योंकि metric गिरते वक्त यह तय करना कि वह काफी बुरा है या नहीं, राय बनाने का बहुत खराब वक्त होता है।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- shadow और live score distributions के बीच आप क्या तुलना करेंगे?
- canary कितनी देर चलाएंगे, और वह किस चीज से तय होता है?
- जिस मॉडल में बिजनेस metric हिलने में हफ्ते लगते हैं, उसे आप कैसे संभालते हैं?
मशीन लर्निंग इंजीनियर के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें