पहले churn और prediction horizon की परिभाषा तय करें, क्योंकि label ही बाकी सब कुछ तय करता है। cutoff से पहले के बर्ताव से एक point in time feature set बनाएं, समय के हिसाब से split करें, regularized logistic या gradient boosted baseline से शुरू करें, और retention की जितनी capacity मौजूद है उस पर precision से evaluate करें। फिर model के साथ साथ intervention भी design करें, क्योंकि जिस score पर कोई कदम नहीं उठाता उसकी कोई कीमत नहीं।
इंटरव्यूअर यह क्यों पूछते हैं
खुले सिरे वाले design सवाल algorithms के बारे में नहीं, क्रम और समझ के बारे में होते हैं। इंटरव्यूअर modeling से पहले label की परिभाषा और horizon सुनना चाहते हैं, features के लिए point in time सही होना, समय के हिसाब से split, और यह योजना कि score इस्तेमाल कैसे होगा। जो उम्मीदवार model के चुनाव से शुरू करते हैं वे आम तौर पर वही हिस्से छोड़ देते हैं जो तय करते हैं कि प्रोजेक्ट कामयाब होगा या चुपचाप मर जाएगा।
अपना जवाब कैसे स्ट्रक्चर करें
- किसी और चीज से पहले label और prediction horizon पक्का करें।
- point in time feature निर्माण और observation cutoff बताएं।
- समय के हिसाब से split करें और पहले एक सादा baseline बताएं।
- बिजनेस जितना बड़ा intervention चला सकता है उसी के हिसाब से evaluate करें।
- आखिर में बताएं कि score कदम में कैसे बदलता है।
उदाहरण जवाब
मैं label से शुरू करता हूं, क्योंकि churn साफ नहीं होता। किसी मासिक subscription के लिए वह अगली billing तारीख पर renew न होना हो सकता है; किसी usage प्रोडक्ट के लिए तीस दिन तक कोई गतिविधि न होना। मैं horizon भी तय करता हूं: क्या हम अगले तीस दिन में churn की भविष्यवाणी कर रहे हैं या अगली तिमाही में? ये अलग interventions वाले अलग models हैं। फिर मैं किसी cutoff तारीख के हिसाब से features बनाता हूं, सिर्फ उससे पहले के बर्ताव से, जैसे engagement का रुझान, support tickets, payment failures, seat count में बदलाव, tenure। point in time सही होना वह हिस्सा है जिसमें मैं सबसे ज्यादा सावधान रहता हूं। मैं समय के हिसाब से split करता हूं, पहले वाले cohorts पर train और बाद वालों पर validate। baseline regularized logistic regression है ताकि मेरे पास कुछ समझाने लायक हो, फिर gradient boosting ताकि पता चले कितनी गुंजाइश बची है। evaluation के लिए मैं retention टीम से पूछता हूं कि वे हफ्ते में कितने customers से संपर्क कर सकते हैं और कुल AUC के बजाय उसी ऊपरी हिस्से में precision बताता हूं। और मैं उनके साथ मिलकर intervention design करने पर अड़ता हूं, हो सके तो holdout के साथ, क्योंकि वरना छह महीने बाद कोई नहीं बता पाएगा कि model ने एक भी customer बचाया या नहीं।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- retention campaign सचमुच काम कर गया या नहीं, यह आप कैसे मापेंगे?
- अगर intervention खुद ही बदल दे कि कौन churn करता है, और इससे आपका training डेटा टूट जाए तो?
- आप कितनी बार retrain करेंगे, और उसे क्या चीज ट्रिगर करेगी?
डेटा साइंटिस्ट के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें