डेटा साइंटिस्ट इंटरव्यू सवाल

आपने एक experiment चलाया पर नतीजों को बीस तरह से काटा और दो segments significant निकले। आप टीम से क्या कहेंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

उन्हें नतीजे नहीं, परिकल्पनाएं मानिए। alpha 0.05 पर बीस slices जांचने से, कुछ असली न होने पर भी, कम से कम एक false positive की संभावना करीब 64 प्रतिशत होती है, तो दो hits लगभग वही हैं जो शुद्ध noise पैदा करता है। Benjamini Hochberg जैसा कोई correction लगाएं, या उससे बेहतर, जिन segments की आपको परवाह है उन्हें पहले से दर्ज करें और किसी भी चौंकाने वाली चीज को नए test में पक्का करें।

इंटरव्यूअर यह क्यों पूछते हैं

यह statistics के भेस में अनुशासन का सवाल है। इंटरव्यूअर देखना चाहते हैं कि आप एक लुभावने नतीजे का विरोध करते हैं, क्योंकि कुछ significant निकलने तक काटते रहना ही वह तरीका है जिससे बुरे launch जायज ठहराए जाते हैं। false positives की अपेक्षित संख्या बताना, Bonferroni को false discovery rate control से अलग करना, और पुष्टि के लिए दोबारा test सुझाना, ये सब बताते हैं कि आप पहले इससे जल चुके हैं।

अपना जवाब कैसे स्ट्रक्चर करें

  • बताएं कि बीस tests से कितने false positives की उम्मीद है, संख्या में।
  • दोनों hits को नतीजों के बजाय परिकल्पनाओं के तौर पर रखें।
  • एक correction का नाम लें और बताएं कि यहां FDR control Bonferroni से बेहतर क्यों है।
  • किसी के कदम उठाने से पहले नए test में पुष्टि करने का सुझाव दें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

मैं उनसे कहूंगा कि हमें दो सुराग मिले हैं, दो नतीजे नहीं। 0.05 पर बीस स्वतंत्र tests के साथ, सच्ची null के तहत कम से कम एक false positive की संभावना करीब 64 प्रतिशत है, और अपेक्षित गिनती एक है। तो दो पूरी तरह उसी दायरे में है जो noise पैदा करता है। फिर मैं Bonferroni के बजाय Benjamini Hochberg लगाऊंगा, क्योंकि बीस tests पर Bonferroni बेरहमी से conservative है और noise के साथ शायद किसी असली असर को भी मार देगा; जब आप छान रहे हों तब false discovery rate control ही सही टूल है। आम तौर पर एक या दोनों बाहर हो जाते हैं। अगर कुछ बच जाता है तो भी मैं उसे परिकल्पना मानता हूं और यह कहता भी हूं: ईमानदार अगला कदम है उसी segment पर लक्षित एक पुष्टि करने वाला test, जिसमें segment देखने से पहले घोषित हो। मैंने इसे उल्टा जाते भी देखा है, जहां एक टीम ने कटे हुए नतीजे के आधार पर एक segment को ship कर दिया और बड़े पैमाने पर असर गायब हो गया, और कीमत सिर्फ बेकार गया फीचर नहीं थी, कीमत यह थी कि उसके बाद एक तिमाही तक experiment platform पर किसी ने भरोसा नहीं किया।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • Benjamini Hochberg असल में कदम दर कदम कैसे काम करता है?
  • conservative होने के बावजूद Bonferroni कब सही चुनाव होता है?
  • इस हालत से बचने के लिए आप experiment पहले से कैसे design करेंगे?

डेटा साइंटिस्ट के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं