मशीन लर्निंग इंजीनियर इंटरव्यू सवाल

feature store ऐसी कौन सी समस्या हल करता है जो एक अच्छी data pipeline से हल नहीं होती?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

वह training और serving की एकरूपता हल करता है। एक ही feature को ट्रेनिंग के लिए batch history से और serving के लिए ताजा डेटा से कम latency पर निकालना पड़ता है, और जब ये दो अलग implementations होते हैं तो वे खिसक जाते हैं। feature store feature को एक बार परिभाषित करता है, उसे ट्रेनिंग डेटा के लिए offline store में और millisecond lookups के लिए online store में materialize करता है, और point in time सही joins देता है।

इंटरव्यूअर यह क्यों पूछते हैं

इंटरव्यूअर यह देखने के लिए पूछते हैं कि आपने training serving skew सिर्फ पढ़ा है या भुगता है। key value cache तो कोई भी बता देगा; उन्हें जो जवाब चाहिए वह point in time correctness और एकल परिभाषा को असली कीमत बताता है। यह कहने की हिम्मत रखना कि एक मॉडल वाली टीम के लिए feature store जरूरत से ज्यादा है, भी अच्छा लगता है, क्योंकि वह इंफ्रास्ट्रक्चर की लागत पर समझदारी दिखाता है।

अपना जवाब कैसे स्ट्रक्चर करें

  • मुख्य समस्या के तौर पर training serving skew का नाम लें।
  • ट्रेनिंग डेटा के लिए point in time join की जरूरत समझाएं।
  • online store की latency वाली भूमिका बताएं।
  • ईमानदारी से बताएं कि feature store कब इस झंझट लायक नहीं है।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

समस्या यह है कि एक ही feature की दो जिंदगियां होती हैं। ट्रेनिंग के लिए मुझे किसी पुराने timestamp पर उसकी वैल्यू चाहिए, ऐसे join के साथ जिसमें उसके बाद हुई कोई बात गलती से न घुसे। serving के लिए मुझे वह अभी चाहिए, दस millisecond से कम में, entity के हिसाब से। अगर ये दो codebases हैं, और शुरुआत हमेशा दो codebases से ही होती है, तो वे खिसक जाते हैं। कोई training job में window तीस दिन से अट्ठाईस कर देता है, serving वाले रास्ते को कोई छूता नहीं, और अब मॉडल उन features पर score कर रहा है जिन पर वह कभी ट्रेन ही नहीं हुआ। यह खिसकाव चुपचाप होता है, और यही इसे महंगा बनाता है। feature store आपको एक परिभाषा देता है जो ट्रेनिंग के लिए offline table में और serving के लिए online key value store में materialize होती है, साथ में point in time joins ताकि पुरानी query भविष्य को लीक न कर सके। कहा जाए तो दो मॉडल वाली टीम के लिए मैं इसे खड़ा नहीं करूंगा। खर्च असली है, और ज्यादातर फायदा आपको एक साझा transformation library और cache में लिखने वाली एक scheduled job से मिल जाता है। managed feature store की तरफ मैं तब जाऊंगा जब कई टीमें features साझा करने लगें, क्योंकि तभी दोहरी परिभाषाएं बढ़ने लगती हैं।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • point in time सही join आप खुद कैसे लागू करेंगे?
  • online और offline store के बीच आपको कौन सी consistency गारंटियां चाहिए?
  • जिस feature पर मॉडल निर्भर हैं, उसकी परिभाषा बदल जाए तो आप क्या करते हैं?

मशीन लर्निंग इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं