काटने से पहले नापें। query history को user, tool और warehouse के हिसाब से निकालें ताकि पता चले खर्च असल में कहां है, क्योंकि आम तौर पर वह कुछ गिनी चुनी queries या बहुत ज्यादा refresh होता कोई dashboard होता है। फिर सबसे ऊपर वाली चीजों पर हमला करें: partition filters जोड़ें, बार बार दोहराए जाने वाले भारी joins को materialize करें, dashboard की refresh दर घटाएं, compute को सही आकार दें और auto suspend लगाएं, और scratch tables पर expiry सेट करें।
इंटरव्यूअर यह क्यों पूछते हैं
आजकल data engineering की नौकरी का बड़ा हिस्सा लागत का काम है, और इंटरव्यूअर सबूत चाहते हैं कि आप इसे थोक नियमों के बजाय डेटा से पकड़ते हैं। वे खास मुजरिम सुनना चाहते हैं (आक्रामक refresh वाले dashboards, चौड़ी tables पर SELECT star, बिना partition वाले scans, खाली बैठे warehouses) और वे guardrails भी जो दिक्कत को लौटने से रोकें।
अपना जवाब कैसे स्ट्रक्चर करें
- query history से शुरू करें और खर्च को user, tool और job से जोड़ें।
- query कितनी धीमी लगती है उससे नहीं, कुल लागत से क्रम लगाएं।
- सबसे बड़े मुजरिमों को pruning, materialization और scheduling से ठीक करें।
- compute को सही आकार दें और auto suspend लागू करें।
- guardrails लगाएं ताकि बचत टिकी रहे।
उदाहरण जवाब
पहले मैं डेटा निकालता हूं, क्योंकि हर किसी के पास एक थ्योरी होती है और थ्योरी आम तौर पर गलत होती है। हर बड़ा warehouse query history देता है जिसमें bytes scanned या credits consumed होते हैं, इसलिए मैं पिछले महीने का डेटा user, service account और warehouse के हिसाब से जोड़ता हूं और कुल लागत से sort करता हूं। जो pattern मुझे बार बार मिलता है वह यह है कि गिनी चुनी चीजें ही हावी होती हैं। पिछली बार 40% खर्च एक BI dashboard का था जो raw event table पर हर पंद्रह मिनट में refresh हो रहा था, करीब छह लोगों के लिए, जिनमें से कोई भी उसे दिन में एक बार से ज्यादा नहीं देखता था। उसे घंटे में एक बार refresh होने वाली pre aggregated table पर ले जाने भर से बिल एक तिहाई से ज्यादा गिर गया। उसके बाद वही जानी पहचानी सूची है: partition filter छोड़ देने वाली queries, बहुत चौड़ी tables पर SELECT star, जल्दबाजी में XL आकार दिए गए warehouses, और auto suspend न होने से रात भर खाली चलते रहना। फिर guardrails, यानी query timeouts, per user byte limits, और एक cost dashboard जो टीम सचमुच हर हफ्ते देखती हो।
जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।
देखें यह कैसे काम करता हैफॉलो-अप सवाल जिनकी उम्मीद रखें
- लागत को अलग अलग टीमों के खाते में आप कैसे डालेंगे?
- materialized view कब गलत हल होता है?
- सफाई के बाद लागत को दोबारा चढ़ने से आप कैसे रोकते हैं?
डेटा इंजीनियर के और सवाल
आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।
मेरे सवाल प्रेडिक्ट करें