Interviewfrage für Data Engineer

Wie verfolgst du Data Lineage, und warum ist das operativ wichtig?

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Lineage bildet ab, welche Quellen welche Tabellen, Modelle und Dashboards speisen. Erfass sie automatisch durch Parsen von SQL und Orchestrator-Abhängigkeiten statt sie von Hand zu pflegen, denn manuelle Lineage verrottet innerhalb von Wochen. Sie ist wichtig, weil sie die drei dringenden Fragen beantwortet: was bricht, wenn diese Quelle ausfällt, wen informiere ich bei einem fehlerhaften Load, und kann ich diese Spalte sicher löschen oder ändern.

Warum Interviewer das fragen

Diese Frage prüft, ob du über das Bauen von Pipelines hinaus daran denkst, eine Plattform zu betreiben, von der andere abhängen. Interviewer wollen automatische Erfassung, Lineage auf Spaltenebene wo verfügbar, und konkrete Nutzung: Impact-Analyse vor einer Änderung, Blast Radius im Incident und Löschungen aus Compliance-Gründen. Antworten, die eine Wiki-Seite beschreiben, verraten fehlende Erfahrung im Maßstab.

So baust du deine Antwort auf

  • Definier Lineage und den Detailgrad, der sich lohnt.
  • Besteh auf automatischer Erfassung aus SQL und Orchestrierungs-Metadaten.
  • Nenn die drei operativen Fragen, die sie beantwortet.
  • Verbind sie mit Change Management und Deprecation.
  • Erwähn Ownership-Metadaten neben der Lineage.

Beispielantwort

Gesprochenes Beispiel, erste Person

Lineage ist der Abhängigkeitsgraph deiner Daten, idealerweise bis auf Spaltenebene, und die einzige Variante, die sich lohnt, ist die automatisch erzeugte. Alles handgepflegte ist binnen eines Monats falsch. In der Praxis bekamen wir das meiste gratis aus dem dbt-Manifest für die Transformationsschicht plus den Metadaten des BI-Tools für Dashboards, gespeist in einen Katalog. Der Wert zeigt sich in drei Momenten. Wenn eine Quelle zu spät ist, sehe ich sofort, welche Dashboards veraltet sein werden, und schreibe deren Ownern, bevor sie mir schreiben. Wenn jemand eine Spalte löschen will, dauert die Impact-Analyse dreißig Sekunden statt eines Greps und eines Stoßgebets. Und bei Löschanfragen finde ich jede Tabelle, die eine bestimmte Kennung enthält. Was ich ergänzen würde: Lineage ohne Ownership ist nur halb nützlich. Zu jedem Datensatz gehört ein benanntes verantwortliches Team, sonst weißt du genau, was kaputt ist, und hast trotzdem niemanden, dem du es sagen kannst.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Wie würdest du Lineage für eine Pipeline erfassen, die in Python geschrieben ist und nicht in SQL?
  • Was ist der Unterschied zwischen Lineage auf Tabellen- und auf Spaltenebene?
  • Wie verhinderst du, dass ein Datenkatalog veraltet?

Weitere Fragen für Data Engineer

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen