डेटा साइंटिस्ट इंटरव्यू सवाल

median session length जैसे किसी metric पर, जिसका कोई साफ closed form नहीं है, आप confidence interval कैसे लगाएंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

उसे bootstrap करें। अपने डेटा को replacement के साथ मूल आकार तक resample करें, हर resample पर median निकालें, यह कुछ हजार बार दोहराएं, फिर उस distribution के 2.5वें और 97.5वें percentile को 95 प्रतिशत interval मान लें। इसमें distribution के बारे में कोई धारणा नहीं चाहिए और यह medians, ratios और दूसरे टेढ़े statistics पर काम करता है, बशर्ते जिन observations को आप resample कर रहे हैं वे स्वतंत्र हों।

इंटरव्यूअर यह क्यों पूछते हैं

यह जांचता है कि जब statistic का कोई formula ही न हो तब आप रटे हुए formulas से आगे जा सकते हैं या नहीं। इंटरव्यूअर सुन रहा है कि आप उसी आकार पर replacement के साथ resample करते हैं, iterations की गिनती समझदार रखते हैं, और स्वतंत्रता वाली धारणा के प्रति सजग हैं, क्योंकि जब एक ही यूजर सैकड़ों sessions देता है तब rows को bootstrap करना ऐसे intervals देता है जो काम के लिहाज से कहीं ज्यादा संकरे होते हैं।

अपना जवाब कैसे स्ट्रक्चर करें

  • resampling के चक्र को दो लाइनों में ठोस तरीके से बताएं।
  • बताएं कि percentile के फैलाव से interval कैसे निकल आता है।
  • जिस धारणा की इसे सचमुच जरूरत है उसका नाम लें: स्वतंत्र observations।
  • rows के grouped होने पर clustered या block bootstrapping का जिक्र करें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मैं bootstrap करता हूं। observations को replacement के साथ मूल sample आकार तक sample करता हूं, उस resample पर median निकालता हूं, उसे रख लेता हूं, और यह कुछ हजार बार दोहराता हूं। उन medians का फैलाव एक अनुभवजन्य sampling distribution है, और मैं 2.5वें और 97.5वें percentile को interval मान लेता हूं। इसे लागू करना आसान है और यह उन statistics पर काम करता है जिनका कोई सुंदर formula नहीं होता, जो कि दिलचस्प statistics में से ज्यादातर हैं: medians, 90वां percentile, दो metrics का ratio, समूहों के बीच medians का फर्क। जो धारणा सचमुच काटती है वह है स्वतंत्रता। अगर मैं session length को bootstrap कर रहा हूं और एक भारी यूजर के चार सौ sessions हैं, तो अलग अलग sessions को resample करना उन्हें चार सौ स्वतंत्र तथ्य मान लेता है और interval कहीं ज्यादा संकरा निकल आता है। तो मैं sessions नहीं, यूजर resample करता हूं, और उस यूजर के सारे sessions उसके साथ ले जाता हूं। time series पर भी वही बात, जहां मैं autocorrelation बचाए रखने के लिए लगातार टुकड़ों का block bootstrap करता हूं। resampling की इकाई गलत चुनिए और आपको एक आत्मविश्वासी, कसा हुआ, पूरी तरह गलत interval मिल जाएगा।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • आप कितने bootstrap iterations चलाते हैं, और यह कैसे तय करते हैं?
  • bootstrap पूरी तरह कब नाकाम हो जाता है?
  • percentile और bias corrected interval में क्या फर्क है?

डेटा साइंटिस्ट के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं