मशीन लर्निंग इंजीनियर इंटरव्यू सवाल

बिना कुछ बनाए, बोलकर समझाइए कि transformer में self attention कैसे काम करता है।

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

हर token को एक query, एक key और एक value vector में project किया जाता है। हर query का हर key के साथ dot product लेकर score निकालते हैं, head dimension के square root से scale करते हैं, softmax से उन scores को weights में बदलते हैं, और values का weighted sum ले लेते हैं। हर token के पास आखिर में उन दूसरे tokens से मिला हुआ representation होता है जिन्हें उसने प्रासंगिक पाया। कई heads यही काम अलग अलग projections के साथ समानांतर में करते हैं।

इंटरव्यूअर यह क्यों पूछते हैं

आजकल जो कुछ ship हो रहा है उसके नीचे लगभग हर जगह transformers हैं, इसलिए इंटरव्यूअर attention को focus जैसा बताने वाली उपमा नहीं, mechanical व्याख्या चाहते हैं। scaling factor और softmax वे ब्योरे हैं जो लोग भूल जाते हैं, और sequence length में quadratic लागत वह follow up है जिसकी तरफ वे ले जा रहे होते हैं, क्योंकि व्यवहार में वही context length और serving cost को बांधती है।

अपना जवाब कैसे स्ट्रक्चर करें

  • query, key और value projections एक वाक्य में बताएं।
  • dot product, scaling, softmax, weighted sum को क्रम से चलाएं।
  • बताएं कि कई heads क्या जोड़ते हैं।
  • sequence length में quadratic लागत बताएं और यह भी कि वह क्यों मायने रखती है।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

हर token embedding तीन सीखे हुए matrices से गुणा होकर एक query, एक key और एक value बनाता है। query वह है जो यह token ढूंढ रहा है, key वह है जो वह विज्ञापित करता है, और value वह है जो चुने जाने पर वह आगे भेजता है। हर query का हर key के साथ dot product लेते हैं, जिससे हर जोड़ी positions के लिए एक compatibility score मिलता है। head dimension के square root से भाग दीजिए, वरना dot products dimensionality के साथ बढ़ते जाते हैं और softmax को ऐसे इलाके में धकेल देते हैं जहां वह असल में hard argmax बन जाता है और gradients गायब हो जाते हैं। row भर में softmax उन scores को ऐसे weights में बदलता है जिनका जोड़ एक होता है, फिर आप value vectors का weighted sum लेते हैं। तो हर token अपने साथ उन tokens का मिश्रण लेकर लौटता है जिनकी उसे परवाह थी। कई heads यही पूरा operation अलग projections के साथ समानांतर में चलाते हैं, इसलिए एक head syntax पकड़ सकता है जबकि दूसरा coreference, और outputs concatenate होकर project हो जाते हैं। जो लागत बताने लायक है वह यह है कि score matrix sequence length का वर्ग है, और ठीक इसीलिए long context serving महंगी है और flash attention तथा KV caching इतना मायने रखते हैं।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • autoregressive decoding के दौरान KV cache क्या स्टोर करता है, और क्यों?
  • causal masking computation को कैसे बदलता है?
  • sub quadratic attention variants किस चीज की कुर्बानी देते हैं?

मशीन लर्निंग इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं