डेटा साइंटिस्ट इंटरव्यू सवाल

आपके दो predictors का correlation 0.95 है। क्या इससे फर्क पड़ता है, और आप इसका क्या करेंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

यह आपके मकसद पर निर्भर है। शुद्ध prediction के लिए collinearity accuracy को शायद ही नुकसान पहुंचाती है; model बस जुड़वां variables के बीच weight बांट देता है। inference के लिए यह गंभीर है: coefficients अस्थिर हो जाते हैं और उनकी standard errors फूल जाती हैं, इसलिए samples के बीच चिह्न तक पलट सकते हैं और आप नहीं कह सकते कि नतीजे को कौन सा variable चला रहा है। variance inflation factors देखें, फिर एक को हटा दें, दोनों को मिला दें, या ridge इस्तेमाल करें।

इंटरव्यूअर यह क्यों पूछते हैं

सही जवाब किसी fix से नहीं, एक सवाल से शुरू होता है, और इंटरव्यूअर ठीक वही सुनना चाहते हैं। जो उम्मीदवार तुरंत कहते हैं कि एक को हटा दो, वे दिखा रहे हैं कि उनके पास एक ही नुस्खा है। यह कहना कि collinearity prediction से ज्यादा inference की समस्या है, और यह जानना कि यहां tree ensembles linear models से अलग बर्ताव करते हैं, दिखाता है कि आप समझते हैं coefficients का असल मतलब क्या है, बजाय इसके कि उन्हें importance scores मान लें।

अपना जवाब कैसे स्ट्रक्चर करें

  • पहले पूछें कि model prediction के लिए है या समझाने के लिए।
  • बताएं कि collinearity coefficient की स्थिरता और standard errors के साथ क्या करती है।
  • VIF या condition number जैसे किसी diagnostic का नाम लें।
  • विकल्प दें (हटाना, मिलाना, regularize करना) और बताएं कौन सा कब फिट बैठता है।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मेरा पहला सवाल यह है कि model किस काम के लिए है। अगर हम leads को score कर रहे हैं और coefficients कोई पढ़ता ही नहीं, तो 0.95 का correlation ज्यादातर बेकसूर है। fit ठीक है, predictions ठीक हैं, weight बस दोनों variables के बीच किसी मनमाने तरीके से बंट जाता है। काटता यह वहां है जहां कोई coefficients के आधार पर कदम उठाने वाला हो। तब यह असली समस्या है, क्योंकि वह बंटवारा अस्थिर होता है: थोड़े अलग sample पर दोबारा fit करिए और एक coefficient positive की तरफ झूल जाता है जबकि दूसरा negative की तरफ, और standard errors इतनी चौड़ी होती हैं कि दोनों में से कोई significant नहीं लगता, जबकि जोड़ी साफ तौर पर मायने रखती है। मैं VIF देखता हूं, और करीब दस से ऊपर कुछ भी हो तो मैं उसे शक की नजर से लेता हूं। fix जोड़ी पर निर्भर है। अगर वे एक ही चीज दो बार मापी गई हैं, जैसे revenue और local currency में revenue, तो मैं एक हटा देता हूं। अगर वे सचमुच किसी चीज के दो पहलू हैं, तो मैं उन्हें एक ratio या एक component में मिला देता हूं। अगर मुझे दोनों चाहिए और सिर्फ prediction quality की परवाह है, तो ridge इसे साफ ढंग से संभाल लेता है, क्योंकि वह weight मनमाने तरीके से नहीं, स्थिर तरीके से बांटता है।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • random forest दो लगभग एक जैसे features को कैसे संभालता है?
  • 15 का VIF संख्या के लिहाज से असल में क्या बताता है?
  • क्या principal components इसे हल कर देंगे, और इसमें आप क्या गंवाते हैं?

डेटा साइंटिस्ट के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं