random forest bootstrapped samples पर random feature subsets के साथ कई गहरे trees समानांतर में train करता है, फिर औसत लेता है, जिससे मुख्य रूप से variance घटती है। gradient boosting उथले trees एक के बाद एक train करता है, हर tree अब तक के ensemble की residual errors पर fit होता है, जिससे मुख्य रूप से bias घटती है। tabular डेटा पर accuracy में आम तौर पर boosting जीतता है पर उसे सावधानी से tune करना पड़ता है; forests बिना ज्यादा छेड़छाड़ के कहीं ज्यादा माफ करने वाले होते हैं।
इंटरव्यूअर यह क्यों पूछते हैं
यह वह मानक चेकपॉइंट है जिससे पता चलता है कि आप ensembles को library calls की तरह नहीं, मशीनी तौर पर समझते हैं या नहीं। असली फर्क है समानांतर और variance घटाने वाला बनाम क्रमिक और bias घटाने वाला, और साथ में उसका नतीजा: trees बढ़ाने पर forests शायद ही कभी overfit करते हैं, boosting बिल्कुल कर सकता है। इंटरव्यूअर अक्सर आगे learning rate और early stopping में घुसते हैं, तो यह समझाने को तैयार रहें कि कम learning rate के साथ ज्यादा rounds उलटे से बेहतर क्यों है।
अपना जवाब कैसे स्ट्रक्चर करें
- समानांतर bagging की तुलना क्रमिक residual fitting से करें।
- बताएं कि हर एक error के किस हिस्से पर हमला करता है।
- यह बताएं कि forest में ज्यादा trees सुरक्षित हैं और boosting में नहीं।
- अपना व्यावहारिक डिफॉल्ट और मायने रखने वाले tuning knobs बताएं।
उदाहरण जवाब
forest बहुत सारे गहरे trees स्वतंत्र रूप से उगाता है, हर एक किसी bootstrap sample पर और हर split पर features के किसी random subset को देखते हुए, फिर उनका औसत ले लेता है। trees अलग अलग overfit और आपस में decorrelated होते हैं, इसलिए औसत लेना variance मार देता है। boosting उलटी शक्ल का है: उथले trees, एक एक करके बने, हर नया tree उन errors पर fit जो ensemble अब भी कर रहा है, तो वह bias को छीलता जाता है। जो नतीजा लोग चूक जाते हैं वह यह है कि trees बढ़ाने पर क्या होता है। forest में ज्यादा trees सचमुच कभी नुकसान नहीं करते, बस converge हो जाते हैं। boosting में ज्यादा trees आखिर में overfit कर देते हैं, इसीलिए learning rate और early stopping इतने मायने रखते हैं। tabular डेटा पर मेरा डिफॉल्ट अब भी gradient boosting है, आम तौर पर LightGBM या XGBoost, कम learning rate और validation set पर early stopping के साथ, क्योंकि structured समस्याओं पर उस जोड़ी ने मेरे आजमाए हुए बाकी सब को हराया है। forest पर मैं तब जाता हूं जब मुझे दस मिनट में लगभग बिना tuning के एक ठोस baseline चाहिए, या जब मुझे अलग validation split काटे बिना out of bag अनुमान चाहिए।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- कम learning rate के साथ ज्यादा rounds आम तौर पर बेहतर generalize क्यों करते हैं?
- gradient boosting में subsample parameter क्या करता है?
- एक सादा linear model इन दोनों को कब भी हरा सकता है?
डेटा साइंटिस्ट के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें