L1 (lasso) loss में coefficients के absolute values का जोड़ जोड़ता है और कुछ coefficients को ठीक शून्य पर ले आता है, इसलिए यह feature selection भी कर देता है। L2 (ridge) coefficients के वर्गों का जोड़ जोड़ता है, सबको शून्य की तरफ सिकोड़ता है पर किसी को खत्म नहीं करता, जिससे correlated predictors ज्यादा शालीनता से संभल जाते हैं। L1 तब चुनें जब आपको sparse, समझाने लायक model चाहिए; L2 तब जब predictors आपस में correlated हों और आपको स्थिरता चाहिए।
इंटरव्यूअर यह क्यों पूछते हैं
lasso बनाम ridge तो कोई भी दोहरा सकता है। इंटरव्यूअर वह ज्यामितीय या व्यावहारिक वजह चाहता है कि L1 ठीक शून्य क्यों देता है, और वह यह भी सुनना चाहता है कि आप पहले features को scale करते हैं, क्योंकि बिना scale किए डेटा पर दोनों penalties बेमानी हैं। elastic net को एक व्यावहारिक डिफॉल्ट के तौर पर बताना और यह समझाना कि penalty की strength आप cross validation से कैसे चुनते हैं, एक practitioner को किताबी लाइन दोहराने वाले से अलग कर देता है।
अपना जवाब कैसे स्ट्रक्चर करें
- हर एक का penalty term सीधी भाषा में बताएं।
- समझाएं कि L1 ठीक शून्य पर क्यों पहुंचता है और L2 क्यों नहीं।
- यह जिक्र करें कि किसी भी penalty का मतलब बनने से पहले features का scaled होना जरूरी है।
- बताएं कि strength आप कैसे चुनते हैं, और बीच के रास्ते के तौर पर elastic net का नाम लें।
उदाहरण जवाब
L2 coefficients का वर्ग लेता है और सबको धीरे धीरे शून्य की तरफ सिकोड़ता है। L1 absolute values इस्तेमाल करता है, और चूंकि उस penalty का शून्य पर एक कोना होता है, optimum अक्सर ठीक शून्य पर बैठ जाता है, इसीलिए lasso feature selection का दोहरा काम करता है। जो व्यावहारिक नियम मैं इस्तेमाल करता हूं वह correlation के बारे में है। अगर मेरे पास आपस में बहुत correlated predictors का एक समूह है, तो lasso उनमें से एक को लगभग मनमाने ढंग से चुन लेता है और बाकी को शून्य कर देता है, जो देखने में साफ सुथरा लगता है पर अस्थिर होता है: किसी bootstrap sample पर दोबारा fit करिए और वह कोई दूसरा चुन लेगा। ridge सबको रखता है और weight बांट देता है, जो आम तौर पर ज्यादा ईमानदार है। अगर किसी स्टेकहोल्डर को drivers की एक छोटी लिस्ट चाहिए तो मैं lasso लेता हूं और अस्थिरता स्वीकार करता हूं, पर मैं यह बोलकर कहता हूं कि जो बचे हैं वे एक correlated समूह के प्रतिनिधि हैं, अकेली मायने रखने वाली चीजें नहीं। असल काम में मैं आम तौर पर elastic net उठाता हूं ताकि थोड़ी sparsity मिले पर मनमाना चुनाव न हो, और strength मैं cross validation से tune करता हूं। और मैं हमेशा पहले standardize करता हूं, वरना penalty बस उस feature को सजा देती रहती है जो संयोग से छोटी units में मापा गया हो।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- ज्यामिति के हिसाब से L1 penalty ठीक शून्य क्यों पैदा करती है?
- penalty अनंत की तरफ जाए तो ridge के coefficients का क्या होता है?
- जब साथ में class imbalance भी हो तो penalty strength आप कैसे tune करेंगे?
डेटा साइंटिस्ट के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें