कुछ भी generate करने से पहले तय करें कि इस काम के लिए अच्छा का मतलब क्या है, फिर असली inputs का एक तय evaluation set बनाएं जिसके outputs rubric से scored हों। अपने आप चलने वाली जांचें (source के मुकाबले factual consistency, format की वैधता, refusal और latency दरें) को नमूने पर इंसानी review के साथ मिलाएं। किसी flag के पीछे ship करें, downstream यूजर बर्ताव मापें, और eval set को model version बदलने के लिए regression suite की तरह बनाए रखें।
इंटरव्यूअर यह क्यों पूछते हैं
LLM फीचर अब आम हैं, और नाकामी का तरीका यह है कि कुछ प्रभावशाली demos के बाद लोग बस माहौल देखकर ship कर देते हैं। इंटरव्यूअर वही कड़ाई चाहते हैं जो आप किसी भी model पर लगाते: एक held out set, एक तय rubric, अपने आप चलने वाली और इंसानी evaluation, और एक downstream बिजनेस metric। provider और version बदलने के लिए regression suite का जिक्र दिखाता है कि आप समझते हैं ये सिस्टम आपके नीचे से खिसकते रहते हैं।
अपना जवाब कैसे स्ट्रक्चर करें
- कोई भी output देखने से पहले quality की rubric तय करें।
- असली यूजर inputs से एक तय evaluation set बनाएं।
- अपने आप चलने वाली जांचों को नमूने पर इंसानी grading से मिलाएं।
- इसे किसी flag के पीछे एक downstream बर्ताव metric से जोड़ें।
- provider और version बदलने के लिए regression suite बनाए रखें।
उदाहरण जवाब
यहां जाल यह है कि पहले दस outputs हमेशा शानदार लगते हैं और सब ship करना चाहते हैं। तो कुछ भी generate करने से पहले मैं लिख लेता हूं कि अच्छा का मतलब क्या है: source दस्तावेज के प्रति ईमानदार, मुख्य बिंदुओं को समेटने वाला, सही लंबाई का, बिना गढ़े हुए तथ्यों के। फिर मैं कुछ सौ असली inputs निकालता हूं, सुंदर वाले नहीं बल्कि मुश्किल मामलों की तरफ झुके हुए, और उसे evaluation set के तौर पर जमा देता हूं। अपने आप चलने वाली तरफ मैं source के मुकाबले factual consistency, format की वैधता और refusal rate जांचता हूं, और rubric scores के लिए model as judge इस्तेमाल करता हूं, पर तभी जब उसे किसी हिस्से पर इंसानी grades से calibrate कर लूं, क्योंकि बिना जमीन वाला judge ज्यादातर अपने ही साथ सहमत रहता है। हर चक्र में एक नमूने को इंसान फिर भी grade करता है। फिर मैं इसे किसी flag के पीछे traffic के एक हिस्से पर ship करता हूं और देखता हूं कि यूजर असल में करते क्या हैं: क्या वे summary को edit करते हैं, क्या वे फिर भी पूरा दस्तावेज खोलते हैं। वही downstream बर्ताव असली metric है। और मैं eval set को regression suite की तरह रखता हूं, क्योंकि जब provider आपके नीचे model अपडेट करता है तो बर्ताव खिसक जाता है, और यह आप support tickets से नहीं, अपने ही tests से जानना चाहेंगे।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- model as judge इंसानी graders से सहमत है, यह आप कैसे साबित करेंगे?
- launch के बाद किस चीज पर आप फीचर वापस खींच लेंगे?
- इस पर टिकने से पहले हर request की लागत का अनुमान आप कैसे लगाएंगे?
डेटा साइंटिस्ट के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें