bias वह error है जो तब आती है जब model असली signal पकड़ने के लिए बहुत सरल हो; variance वह error है जो तब आती है जब model इतना flexible हो कि वह training sample के noise को भी fit कर ले। कुल expected error = bias का वर्ग + variance + irreducible noise। असल काम में यह एक gap की तरह दिखता है: training और validation दोनों की error ऊंची है तो bias, training error कम पर validation उससे कहीं खराब है तो variance।
इंटरव्यूअर यह क्यों पूछते हैं
यह उन लोगों को अलग कर देता है जिन्होंने परिभाषा रट ली है, उन लोगों से जो इसे debug करने के लिए इस्तेमाल करते हैं। इंटरव्यूअर जानना चाहता है कि यह पहचानने के बाद कि आप किस तरफ हैं, आप अगला कदम क्या उठाते हैं, क्योंकि दोनों के fix उलटे हैं: bias के लिए ज्यादा capacity और बेहतर features, variance के लिए ज्यादा डेटा और regularization। वे यह भी देख रहे हैं कि आप एक ही नंबर को घूरने के बजाय training error की तुलना validation error से करते हैं या नहीं।
अपना जवाब कैसे स्ट्रक्चर करें
- दोनों शब्दों की एक एक लाइन में परिभाषा दें।
- बताएं कि training बनाम validation का gap कैसे बताता है कि कौन सा हावी है।
- हर तरफ के उलटे fix गिनाएं।
- tree depth जैसा एक ठोस tuning उदाहरण दें।
उदाहरण जवाब
bias वह error है जो इसलिए मिलती है क्योंकि आपका model असली रिश्ता दिखा ही नहीं सकता, और variance वह error है जो इसलिए मिलती है क्योंकि model उस sample के noise के पीछे भाग रहा है जिस पर उसे train किया गया। इसे काम की चीज यह बनाता है कि यह एक नारा नहीं, एक debugging टूल है। मैं training error को validation error के बगल में रखकर देखता हूं। अगर दोनों खराब हैं तो मेरे पास bias की समस्या है, तो मैं capacity, ज्यादा समृद्ध features या interactions जोड़ता हूं। अगर training error लगभग शून्य है और validation कहीं ज्यादा खराब, तो वह variance है, इसलिए मैं मजबूत regularization, कम features, या मुमकिन हो तो ज्यादा डेटा के साथ पीछे हटता हूं। सबसे साफ उदाहरण मुझे transaction डेटा पर एक gradient boosted model में मिला। depth दस पर वह training पर लगभग परफेक्ट स्कोर कर रहा था और holdout पर कहीं खराब। depth चार पर लाकर एक leaf penalty जोड़ने से gap का ज्यादातर हिस्सा बंद हो गया और holdout AUC सचमुच ऊपर चला गया। दूसरी बात जो मैं देखता रहता हूं, वह यह कि ज्यादा डेटा variance में बहुत मदद करता है और bias में लगभग कुछ नहीं, इसलिए अगर learning curve सपाट हो चुकी है तो और rows खरीदना पैसे की बर्बादी है।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- learning curve देखकर आप कैसे बताएंगे कि ज्यादा डेटा मदद करेगा या नहीं?
- bagging का bias और variance पर क्या असर होता है, और boosting का क्या?
- क्या किसी model में एक साथ ऊंची bias और ऊंची variance दोनों हो सकती हैं?
डेटा साइंटिस्ट के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें