प्रति request लागत नापिए और देखिए वह कहां जमा है, क्योंकि traffic आम तौर पर टेढ़ा होता है। फिर मोटे तौर पर इस क्रम में लगाइए: दोहराई गई या लगभग एक जैसी requests का caching, cascading ताकि सस्ता मॉडल आसान बहुमत संभाले और सिर्फ संदेह वाले मामले ऊपर भेजे, quantization और compiled runtime, सही आकार का hardware ढंग की batching के साथ, और आखिर में वह काम काटना जिसे नीचे कोई इस्तेमाल ही नहीं करता।
इंटरव्यूअर यह क्यों पूछते हैं
लागत अब पहले दर्जे की अड़चन है, और इंटरव्यूअर जानना चाहते हैं कि आप छोटे मॉडल के अलावा किसी और चीज से भी उस पर हमला कर सकते हैं। cascading और caching सबसे ज्यादा असर वाले कदम हैं और वही हैं जो कैंडिडेट सबसे ज्यादा चूकते हैं। नाप से शुरू करना, और यह सवाल उठाने की हिम्मत रखना कि हर prediction इस्तेमाल भी होती है या नहीं, दिखाता है कि आप अकेले मॉडल की नहीं, पूरे सिस्टम की सोचते हैं।
अपना जवाब कैसे स्ट्रक्चर करें
- प्रति request लागत और वह कहां जमा है, वहां से शुरू करें।
- सबसे सस्ती जीत के तौर पर caching और deduplication रखें।
- cascade समझाएं: पहले सस्ता मॉडल, संदेह पर ऊपर भेजना।
- फिर hardware, batching और quantization।
- पूछें कि हर prediction सचमुच इस्तेमाल भी होती है या नहीं।
उदाहरण जवाब
मैं प्रति request लागत निकालकर उसे टुकड़ों में बांटने से शुरू करता हूं, क्योंकि traffic लगभग हमेशा टेढ़ा होता है और requests का एक छोटा वर्ग ही बजट खा जाता है। फिर सबसे सस्ती जीत आम तौर पर caching होती है। एक सिस्टम पर requests का ठीकठाक हिस्सा मिनटों के भीतर बिल्कुल दोहराव था, और normalize किए हुए input पर key बनाई एक छोटी उम्र वाली cache ने एक दिन के काम में load का बड़ा हिस्सा हटा दिया। अगला है cascading। हर चीज पर एक छोटा सस्ता मॉडल चलाइए और महंगे तक तभी जाइए जब सस्ते मॉडल को संदेह हो। अगर छोटा मॉडल आत्मविश्वास से सत्तर प्रतिशत traffic संभाल लेता है, तो आपने उस हिस्से की ज्यादातर लागत काट दी और मुश्किल मामलों पर accuracy बचा ली, और escalation की सीमा quality बजट के मुकाबले tunable है। उसके बाद इंजीनियरिंग आती है: quantization, compiled runtime, dynamic batching ताकि accelerator खाली न बैठे, और यह जांचना कि कहीं हम मॉडल के लिए जरूरत से बड़े hardware पर तो नहीं हैं। आखिरी सवाल असहज वाला है, कि हर prediction इस्तेमाल भी होती है या नहीं। एक बार मुझे ऐसी pipeline मिली जो रोज रात पूरे यूजर बेस को score करती थी जबकि सामने वाली जगह पर कभी सिर्फ ऊपर के कुछ हजार ही दिखते थे, और कम entities को score करना अकेली सबसे बड़ी बचत निकली।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- cascade में escalation की सीमा आप कैसे तय करेंगे?
- पचास प्रतिशत लागत कटौती के लिए quality में कितनी गिरावट स्वीकार करेंगे?
- जब कई मॉडल एक ही cluster साझा करें तो प्रति request लागत आप कैसे बांटते हैं?
मशीन लर्निंग इंजीनियर के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें