ETL transformiert die Daten vor dem Laden, meist auf einem separaten Compute-Cluster. ELT lädt Rohdaten zuerst ins Warehouse und transformiert sie dort mit SQL. Der Wechsel kam, weil Cloud-Warehouses Storage billig und Compute elastisch gemacht haben. Rohdaten zu behalten und an Ort und Stelle zu transformieren, ist schneller zu iterieren, leichter zu auditieren und erlaubt dir, Historie neu zu verarbeiten, ohne die Quellsysteme erneut anzuzapfen.
Warum Interviewer das fragen
Das prüft, ob du die Ökonomie hinter modernen Data Stacks verstehst und nicht nur die Toolnamen kennst. Interviewer wollen hören, dass ELT die Rohdaten bewahrt und Transformationen dadurch reproduzierbar werden, und dass es nicht pauschal besser ist: schwere unstrukturierte Verarbeitung, strenge Datenschutzanforderungen oder teure Abrechnung pro Query können dich zurück zum Transformieren vor dem Laden drängen.
So baust du deine Antwort auf
- Definier beides darüber, wo die Transformation läuft.
- Erklär die Ökonomie, die den Wechsel zu ELT ausgelöst hat.
- Betone, dass Rohdaten für Replay und Nachvollziehbarkeit bleiben.
- Nenn die Fälle, in denen ETL weiterhin gewinnt.
- Verbind es damit, wie du Layer im Warehouse aufbaust.
Beispielantwort
Der Unterschied ist nur, wo die Transformation passiert. ETL transformiert unterwegs, also landet im Warehouse bereits modellierte Daten. ELT landet roh und modelliert innerhalb des Warehouse mit SQL. Der Grund, warum sich ELT durchgesetzt hat: Storage wurde billig und Warehouse-Compute elastisch, also gibt es keinen guten Grund mehr, das rohe Payload wegzuwerfen. Das zählt mehr, als die meisten denken. Als wir einen Bug in unserer Umsatzlogik gefunden haben, haben wir achtzehn Monate Marts in ungefähr vierzig Minuten aus den Rohdaten neu gebaut, ohne zurück zu den Quell-APIs zu müssen, von denen manche nur neunzig Tage vorhalten. Außerdem bleibt die Transformationslogik als SQL in der Versionskontrolle statt in einem proprietären Tool. Trotzdem würde ich vor dem Laden transformieren, wenn es etwa um das Dekodieren großer Binärdateien geht oder wenn ich personenbezogene Daten entfernen oder tokenisieren muss, bevor sie überhaupt das Warehouse berühren, denn sensible Daten lassen sich nicht mehr entladen, sobald sie drin sind.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wo würdest du personenbezogene Daten in einer ELT-Pipeline maskieren?
- Wie strukturierst du Raw-, Staging- und Mart-Layer?
- Wann würde eine Abrechnung pro Query deine Antwort ändern?
Weitere Fragen für Data Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen