मशीन लर्निंग इंजीनियर इंटरव्यू सवाल

transformers batch normalization की जगह layer normalization क्यों इस्तेमाल करते हैं?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

batch norm हर feature को batch भर में normalize करता है, इसलिए उसके statistics batch की बनावट और sequence padding पर निर्भर होते हैं, और inference पर वह अलग बर्ताव करता है जहां वह running averages इस्तेमाल करता है। layer norm एक ही token के features भर में normalize करता है, batch और sequence length से स्वतंत्र, जो उसे बदलती लंबाई वाले sequences, छोटे batches और autoregressive decoding के लिए स्थिर बनाता है।

इंटरव्यूअर यह क्यों पूछते हैं

यह उन लोगों को अलग करता है जो जानते हैं कि कौन सी layer इस्तेमाल करनी है, उन लोगों से जो जानते हैं कि क्यों। इंटरव्यूअर टटोल रहा होता है कि आप समझते हैं या नहीं कि हर normalization किस axis पर काम करता है और उसके व्यावहारिक नतीजे क्या हैं: inference पर batch निर्भरता, padding और छोटे batches की दिक्कत, और train तथा test का फर्क। pre norm बनाम post norm placement और RMSNorm का जिक्र तगड़ा बोनस है।

अपना जवाब कैसे स्ट्रक्चर करें

  • बताएं कि दोनों में से हर एक किस axis पर normalize करता है।
  • समझाएं कि बदलती लंबाई वाले sequences के लिए batch statistics क्यों टूट जाते हैं।
  • batch norm में train और inference के फर्क का जिक्र करें।
  • pre norm placement और आजकल के डिफॉल्ट RMSNorm का जिक्र करें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

वे अलग अलग axes पर normalize करते हैं। batch norm एक feature लेता है और उसे batch के सारे examples भर में normalize करता है। layer norm एक example, या एक token, लेता है और उसके features भर में normalize करता है। यही फर्क बाकी सब तय कर देता है। text में sequences की लंबाई बदलती रहती है और padding होती है, इसलिए batch statistics pad tokens से गंदे हो जाते हैं और इस बात से खिसकते हैं कि साथ में batch क्या हो गया। batch norm train और inference का बेमेल भी ढोता है, जहां आप batch statistics पर ट्रेन करते हैं और running averages पर serve करते हैं, और autoregressive decoding में आप अक्सर एक बार में एक token बना रहे होते हैं, batch size एक के साथ, जहां batch statistics का कोई मतलब ही नहीं। layer norm में batch निर्भरता है ही नहीं, इसलिए training और inference एक जैसे हैं और batch size मायने नहीं रखता। placement की बात करें तो आजकल के transformers norm को sublayer के बाद नहीं, पहले रखते हैं, क्योंकि pre norm residual रास्ता साफ रखता है और नाजुक warmup schedule के बिना deep stacks ट्रेन करने देता है। ज्यादातर मौजूदा मॉडल RMSNorm पर भी चले गए हैं, जो mean centering छोड़कर सिर्फ rescale करता है, क्योंकि वह सस्ता है और लगभग उतना ही अच्छा काम करता है।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • batch size एक के साथ batch norm इस्तेमाल करें तो क्या टूटता है?
  • pre norm, post norm के मुकाबले ज्यादा स्थिरता से ट्रेन क्यों होता है?
  • RMSNorm क्या छोड़ देता है, और वह ठीक क्यों निकलता है?

मशीन लर्निंग इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं