Lass die Entscheidung davon abhängen, wie schnell die Daten eine Entscheidung verändern. Wenn niemand vor dem nächsten Morgen auf die Daten reagiert, ist Batch billiger, leichter zu durchdenken und deutlich einfacher nachzuladen. Streaming wählst du, wenn Latenz Teil des Produkts ist, etwa bei Fraud Scoring, Live-Beständen oder Alerting. Streaming kostet dich Exactly-once-Handling, verspätete Daten, State Management und Dauerbereitschaft.
Warum Interviewer das fragen
Interviewer wollen wissen, ob du Architekturen aus Gründen wählst und nicht aus Mode, denn eine Streaming-Pipeline, die niemand gebraucht hat, ist eine dauerhafte Betriebssteuer. Sie hören auf die operativen Kosten von Streaming (State, Watermarks, Replay, Schemaänderungen an einem laufenden Job) und darauf, dass ein Micro-Batch alle fünfzehn Minuten die meisten sogenannten Echtzeit-Anforderungen abdeckt.
So baust du deine Antwort auf
- Setz den Anker bei der Entscheidungslatenz, die das Business wirklich braucht.
- Nenn den Standard: Batch, außer Latenz ist Teil des Produkts.
- Benenn die echten Kosten, die Streaming jenseits des Happy Path mitbringt.
- Bring Micro-Batch als Mittelweg ins Spiel.
- Gib je ein Beispiel aus deiner eigenen Arbeit.
Beispielantwort
Ich frage zuerst, wer darauf reagiert und wie schnell. Wenn die Antwort lautet, dass eine Analystin um 9 Uhr ein Dashboard öffnet, dann ist ein nächtlicher oder stündlicher Batch-Job die richtige Wahl, weil er billiger ist, sich trivial wiederholen lässt und ich letzten Dienstag ohne großes Nachdenken neu rechnen kann. Streaming nehme ich, wenn Latenz wirklich Teil des Produkts ist. In einem Payments-Team haben wir Transaktions-Events in ein Fraud-Modell gestreamt, weil eine Entscheidung neunzig Minuten später überhaupt keinen Wert mehr hat. Was ich immer explizit mache, sind die Kosten von Streaming. Du erbst State Stores, Watermarks und eine Policy für verspätete Daten, und die Tatsache, dass eine Schemaänderung an einem laufenden Job eher eine Migration als ein Deploy ist. Sehr oft meint ein Stakeholder mit Echtzeit einfach nicht morgen, und ein Micro-Batch alle fünfzehn Minuten auf dem Warehouse liefert genau das zu einem Bruchteil der Betriebslast.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie würdest du eine bestehende Batch-Pipeline auf Streaming migrieren?
- Was löst eine Lambda-Architektur, und was kostet sie?
- Wie machst du einen Backfill einer Streaming-Pipeline nach einem Bug?
Weitere Fragen für Data Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen