डेटा इंजीनियर इंटरव्यू सवाल

Iceberg और Delta Lake जैसे table formats वह कौन सी दिक्कत हल करते हैं जो object storage पर पड़ी सादी Parquet नहीं करती?

इंटरव्यूअर असल में क्या परख रहा है, अपना जवाब कैसे स्ट्रक्चर करें, और एक बोला हुआ उदाहरण जिसे आप अपना सकते हैं।

छोटा जवाब

किसी bucket में पड़ी सादी Parquet files आपको transactions नहीं देतीं, इसलिए कोई reader आधी लिखी directory देख सकता है और फेल हुई job अधूरा डेटा छोड़ जाती है। table formats एक metadata layer जोड़ते हैं जिसमें atomic commits और snapshot isolation होती है, इसलिए writes एक साथ दिखते हैं। वे schema evolution, row स्तर के updates और deletes, पिछले snapshots तक time travel, और directory listing के बजाय statistics से file pruning भी लाते हैं।

इंटरव्यूअर यह क्यों पूछते हैं

lakehouse formats अब ज्यादातर नए प्लेटफॉर्म पर डिफॉल्ट हैं, और इंटरव्यूअर जानना चाहते हैं कि आप सिर्फ उनकी लोकप्रियता जानते हैं या यह भी कि वे क्या ठीक करते हैं। मजबूत जवाब सबसे पहले atomicity और snapshot isolation का नाम लेते हैं, बताते हैं कि Iceberg की hidden partitioning नाजुक partition path परंपरा को हटा देती है, और compaction को चलती रहने वाली maintenance के रूप में गिनते हैं।

अपना जवाब कैसे स्ट्रक्चर करें

  • raw Parquet directories का ठोस दर्द बताएं।
  • metadata layer और atomic snapshot commits समझाएं।
  • जो क्षमताएं खुलती हैं वे गिनाएं: updates, deletes, time travel, evolution।
  • hidden partitioning बनाम directory परंपराओं का जिक्र करें।
  • maintenance की कीमत जोड़ें: compaction और snapshot expiry।

उदाहरण जवाब

बोला हुआ उदाहरण, पहले व्यक्ति में

सादी Parquet में table असल में सिर्फ एक directory परंपरा है, इसलिए atomicity है ही नहीं। अगर job बीच में मर जाए तो readers को अधूरा डेटा दिखता है, और पूरे partitions हाथ से दोबारा लिखे बिना एक row अपडेट या delete करने का कोई रास्ता नहीं है। table formats इसे metadata layer से ठीक करते हैं। एक commit नए snapshot का pointer atomically बदल देता है, इसलिए readers या तो पुरानी स्थिति देखते हैं या नई, कभी मिली जुली नहीं, और time travel लगभग मुफ्त मिल जाता है क्योंकि पुराने snapshots मौजूद रहते हैं। यही आखिरी बात हमें एक बार बचा गई, जब एक खराब transform ने mart के ऊपर लिख दिया और हमने backups से restore करने के बजाय पिछले snapshot पर query करके रिकवर कर लिया। Iceberg में मुझे खास तौर पर hidden partitioning पसंद है, जिसमें table खुद partition transform ट्रैक करती है, इसलिए timestamp पर filter करने वाले analyst को layout जाने बिना pruning मिल जाती है। कीमत maintenance है: आपको small files की तय compaction और snapshot expiry चाहिए, वरना metadata बेतहाशा बढ़ता जाता है।

जल्दी ही यह इंटरव्यू देने जा रहे हैं? GhostPilot आपकी लाइव कॉल सुनता है, सवाल पूछे जाते ही उसे पकड़ लेता है, और रियल-टाइम में एक स्ट्रक्चर्ड जवाब आपकी स्क्रीन पर डाल देता है। अगले मॉक में इसे आजमाएं, या ले लें एक $29 Session Pass, कोई सब्सक्रिप्शन नहीं, असली इंटरव्यू के लिए।

देखें यह कैसे काम करता है

फॉलो-अप सवाल जिनकी उम्मीद रखें

  • updates के लिए copy on write और merge on read में क्या फर्क है?
  • अगर आप पुराने snapshots कभी expire न करें तो क्या टूटता है?
  • मौजूदा Parquet table को आप Iceberg पर कैसे migrate करेंगे?

डेटा इंजीनियर के और सवाल

आपका इंटरव्यूअर इसका अपना वर्ज़न पूछेगा। फ्री Question Predictor में अपना असली जॉब डिस्क्रिप्शन पेस्ट कीजिए और वो 20 सवाल पाइए जो उस रोल में सबसे ज्यादा पूछे जाने की संभावना है, साथ में यह भी कि हर सवाल असल में क्या टटोल रहा है।

मेरे सवाल प्रेडिक्ट करें

मुश्किल सवाल पूछे जाने से पहले उनकी रिहर्सल कीजिए

एक लाइव कोपायलट के साथ प्रैक्टिस कीजिए, फिर तैयार होकर अंदर जाइए। $29 Session Pass आपको इंटरव्यू पार करा देता है, न कोई सब्सक्रिप्शन, न कोई लॉक-इन।

GhostPilot पाएं