मशीन लर्निंग इंजीनियर इंटरव्यू सवाल

inference की लागत प्रोडक्ट की कमाई से ज्यादा हो गई है। quality बर्बाद किए बिना उसे कैसे घटाएंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

प्रति request लागत नापिए और देखिए वह कहां जमा है, क्योंकि traffic आम तौर पर टेढ़ा होता है। फिर मोटे तौर पर इस क्रम में लगाइए: दोहराई गई या लगभग एक जैसी requests का caching, cascading ताकि सस्ता मॉडल आसान बहुमत संभाले और सिर्फ संदेह वाले मामले ऊपर भेजे, quantization और compiled runtime, सही आकार का hardware ढंग की batching के साथ, और आखिर में वह काम काटना जिसे नीचे कोई इस्तेमाल ही नहीं करता।

इंटरव्यूअर यह क्यों पूछते हैं

लागत अब पहले दर्जे की अड़चन है, और इंटरव्यूअर जानना चाहते हैं कि आप छोटे मॉडल के अलावा किसी और चीज से भी उस पर हमला कर सकते हैं। cascading और caching सबसे ज्यादा असर वाले कदम हैं और वही हैं जो कैंडिडेट सबसे ज्यादा चूकते हैं। नाप से शुरू करना, और यह सवाल उठाने की हिम्मत रखना कि हर prediction इस्तेमाल भी होती है या नहीं, दिखाता है कि आप अकेले मॉडल की नहीं, पूरे सिस्टम की सोचते हैं।

अपना जवाब कैसे स्ट्रक्चर करें

  • प्रति request लागत और वह कहां जमा है, वहां से शुरू करें।
  • सबसे सस्ती जीत के तौर पर caching और deduplication रखें।
  • cascade समझाएं: पहले सस्ता मॉडल, संदेह पर ऊपर भेजना।
  • फिर hardware, batching और quantization।
  • पूछें कि हर prediction सचमुच इस्तेमाल भी होती है या नहीं।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मैं प्रति request लागत निकालकर उसे टुकड़ों में बांटने से शुरू करता हूं, क्योंकि traffic लगभग हमेशा टेढ़ा होता है और requests का एक छोटा वर्ग ही बजट खा जाता है। फिर सबसे सस्ती जीत आम तौर पर caching होती है। एक सिस्टम पर requests का ठीकठाक हिस्सा मिनटों के भीतर बिल्कुल दोहराव था, और normalize किए हुए input पर key बनाई एक छोटी उम्र वाली cache ने एक दिन के काम में load का बड़ा हिस्सा हटा दिया। अगला है cascading। हर चीज पर एक छोटा सस्ता मॉडल चलाइए और महंगे तक तभी जाइए जब सस्ते मॉडल को संदेह हो। अगर छोटा मॉडल आत्मविश्वास से सत्तर प्रतिशत traffic संभाल लेता है, तो आपने उस हिस्से की ज्यादातर लागत काट दी और मुश्किल मामलों पर accuracy बचा ली, और escalation की सीमा quality बजट के मुकाबले tunable है। उसके बाद इंजीनियरिंग आती है: quantization, compiled runtime, dynamic batching ताकि accelerator खाली न बैठे, और यह जांचना कि कहीं हम मॉडल के लिए जरूरत से बड़े hardware पर तो नहीं हैं। आखिरी सवाल असहज वाला है, कि हर prediction इस्तेमाल भी होती है या नहीं। एक बार मुझे ऐसी pipeline मिली जो रोज रात पूरे यूजर बेस को score करती थी जबकि सामने वाली जगह पर कभी सिर्फ ऊपर के कुछ हजार ही दिखते थे, और कम entities को score करना अकेली सबसे बड़ी बचत निकली।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • cascade में escalation की सीमा आप कैसे तय करेंगे?
  • पचास प्रतिशत लागत कटौती के लिए quality में कितनी गिरावट स्वीकार करेंगे?
  • जब कई मॉडल एक ही cluster साझा करें तो प्रति request लागत आप कैसे बांटते हैं?

मशीन लर्निंग इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं