Interviewfrage für Data Engineer

Wie funktionieren inkrementelle Modelle in dbt, und wann nimmst du eins statt eines kompletten Neubaus?

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Ein inkrementelles Modell baut die Tabelle einmal auf und verarbeitet bei späteren Läufen nur neue oder geänderte Zeilen und merged sie hinein, über einen is_incremental-Block, der die Quelle filtert. Nimm eins, wenn ein kompletter Neubau zu langsam oder zu teuer ist, typischerweise bei großen Event-Tabellen. Halt einen Unique Key vor, damit späte Updates gemerged statt dupliziert werden, und halt Full Refresh möglich, damit du nach Logikänderungen neu bauen kannst.

Warum Interviewer das fragen

Interviewer prüfen, ob du mit Augenmaß optimierst. Inkrementelle Modelle führen State ein, können also von dem abweichen, was ein kompletter Neubau erzeugen würde, und wer standardmäßig danach greift, produziert stille Korrektheitsfehler. Gute Antworten erwähnen das Lookback-Fenster für verspätete Daten und die Disziplin, regelmäßig komplett neu zu bauen, um das zu prüfen.

So baust du deine Antwort auf

  • Erklär die Mechanik von inkrementellem Filter und Merge.
  • Nenn die Schwelle, ab der sich inkrementell trotz Komplexität lohnt.
  • Behandle den Unique Key und was ohne ihn passiert.
  • Ergänz ein Lookback-Fenster für verspätete Updates.
  • Besteh auf regelmäßigem Full Refresh als Korrektheitsprüfung.

Beispielantwort

Gesprochenes Beispiel, erste Person

Beim ersten Lauf wird die ganze Tabelle gebaut. Danach fügt der is_incremental-Block einen Filter hinzu, sodass du nur jüngere Quellzeilen scannst, und dbt merged sie über einen Unique Key in die bestehende Tabelle. Ich greife erst danach, wenn ein kompletter Neubau wirklich schmerzhaft geworden ist, denn inkrementelle Modelle tragen State, und State driftet. Zwei Gewohnheiten halten sie ehrlich. Erstens ein Lookback-Fenster statt eines strikten größer als max(Timestamp), denn Quellen aktualisieren Zeilen rückwirkend. Wir haben in einem Orders-Modell drei Tage genommen, nachdem wir gemerkt hatten, dass Rückerstattungen bis zu 48 Stunden später eintrafen und komplett übersehen wurden. Zweitens ein geplanter Full Refresh, bei uns wöchentlich, der sowohl Drift aufdeckt als auch beweist, dass sich das Modell überhaupt noch neu bauen lässt. Der Fehler, den ich gesehen habe: ein inkrementelles Modell ohne Unique Key mit Append-Strategie, das bei jedem Retry still doppelt gezählt hat, und niemand hat es gemerkt, bis eine Monatszahl der Finanzabteilung widersprach.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Was ist der Unterschied zwischen Append- und Merge-Strategie?
  • Wie würdest du die Logik eines inkrementellen Modells in Produktion sicher ändern?
  • Wie behandelst du Deletes in einem inkrementellen Modell?

Weitere Fragen für Data Engineer

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen