डेटा इंजीनियर इंटरव्यू सवाल

कोई user अपना डेटा मिटाने का अनुरोध करता है। data lake और warehouse, दोनों में आप इसे कैसे पूरा करेंगे?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

मिटाने से पहले यह जानना जरूरी है कि personal data रहता कहां है, इसलिए classification और lineage से शुरू करें। ऐसा डिजाइन बेहतर है जो दिक्कत ही न आने दे: ingestion पर pseudonymize करें और identifier की mapping एक सीमित पहुंच वाले store में रखें, ताकि वह mapping मिटाते ही बाकी सब पहचान से कट जाए। जहां raw डेटा मिटाना ही पड़े, वहां row स्तर के deletes देने वाला table format इस्तेमाल करें और अनुरोध को पूरा होने तक ट्रैक करें, backups समेत।

इंटरव्यूअर यह क्यों पूछते हैं

deletion अनुरोध यह उजागर कर देते हैं कि आर्किटेक्चर governance को ध्यान में रखकर बना था या बाद में ठोका गया। इंटरव्यूअर crypto shredding या tokenization वाला विचार चाहते हैं, क्योंकि पूरी lake में अपरिवर्तनीय Parquet दोबारा लिखना सचमुच महंगा है। वे मुश्किल हिस्सों पर ईमानदारी भी चाहते हैं: backups, snapshots, आगे भेजे गए extracts, और वे तीसरे पक्ष के टूल जिनके पास कॉपी पड़ी है।

अपना जवाब कैसे स्ट्रक्चर करें

  • classification और lineage से शुरू करें: जो मिल नहीं रहा उसे मिटा नहीं सकते।
  • ingestion पर pseudonymization को तरजीह दें ताकि deletion एक ही जगह का काम रहे।
  • जहां असली deletion चाहिए, वहां आधुनिक table formats में row स्तर के deletes समझाएं।
  • backups, snapshots और आगे गई कॉपियों की बात साफ करें।
  • अनुरोध को पूरा होने के सबूत के साथ ट्रैक करें।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

ईमानदार पहला जवाब यह है कि जिसे आपने catalogue ही नहीं किया उसे मिटा नहीं सकते, इसलिए यह पूरी तरह इस पर टिका है कि classification और lineage पहले से मौजूद हों। जो डिजाइन मैं आगे बढ़ाता हूं वह है ingestion पर pseudonymization: सीमा पर ही असली identifier की जगह surrogate token आ जाता है और mapping एक सीमित पहुंच वाले store में रहती है। फिर deletion अनुरोध ज्यादातर उस store में एक row मिटाना भर रह जाता है, जिसके बाद आगे की हर चीज किसी व्यक्ति से जुड़ी नहीं रहती। यह सालों की Parquet दोबारा लिखने से कहीं सस्ता है। जहां सचमुच deletion चाहिए, वहां Iceberg या Delta जैसा table format पूरे partitions हाथ से दोबारा लिखे बिना row स्तर के deletes देता है। लोग जो हिस्से भूलते हैं वे असहज वाले हैं: snapshots और time travel का इतिहास, अपनी अलग retention वाले backups, किसी के ईमेल किए हुए CSV extracts, और कोई भी तीसरे पक्ष का analytics टूल जिसके पास कॉपी है। मैं snapshots की retention window तय करूंगा ताकि deletions उसके भीतर स्थायी हो जाएं, उसे दस्तावेज में लिखूंगा, और हर अनुरोध तथा उसके पूरा होने का audit लायक रिकॉर्ड रखूंगा।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • crypto shredding क्या है और वह कब वैध deletion रणनीति है?
  • time travel snapshots deletion की गारंटियों को कैसे उलझा देते हैं?
  • बिना दस्तावेज वाली मौजूदा lake में personal data आप कैसे ढूंढेंगे?

डेटा इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं