Interviewfrage für DevOps Engineer

Ein Deploy ging vor einer Stunde raus und die Fehlerraten steigen seitdem. Was machst du?

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Erst zurückrollen, dann untersuchen, es sei denn, der Deploy enthielt eine Datenbankmigration, die den Rollback unsicher macht. Bestätige, dass die Zeitachse zum Deploy passt, prüf, ob sich die Fehler auf die Instanzen der neuen Version konzentrieren, und geh dann auf das vorherige Artefakt zurück oder schieb den Traffic zurück. Sobald sich die Fehlerrate erholt hat, halte den fehlerhaften Build in einer Staging-Umgebung verfügbar, damit du diagnostizieren kannst, ohne dass Nutzer dafür zahlen.

Warum Interviewer das fragen

Der Interviewer prüft deinen Standardinstinkt unter Druck. Starke Kandidaten mitigieren sofort und behandeln Neugier als Luxus für später. Er will außerdem den wichtigen Vorbehalt zu Migrationen hören, denn ein naiver Rollback kann schlimmer sein als der Ausfall. Nachfragen bohren meist danach, wie du das früher gefangen hättest, und da kommen Progressive Delivery und automatischer Rollback ins Spiel.

So baust du deine Antwort auf

  • Nenne den Default: erst zurückrollen, dann diagnostizieren.
  • Gib den einen Vorbehalt, der das ändert: eine nicht umkehrbare Migration.
  • Beschreib, wie du bestätigst, dass der Deploy wirklich die Ursache ist.
  • Schließ damit ab, was es früher gefangen hätte.

Beispielantwort

Gesprochenes Beispiel, erste Person

Default ist zurückrollen. Eine Stunde steigender Fehler ist kein Rätsel, das man live löst, es ist eine Blutung, die man stoppt, und das vorherige Artefakt ist als gut bekannt. Bevor ich abdrücke, mache ich zwei schnelle Checks. Erstens: Beginnt die Fehlerkurve tatsächlich zur Deploy-Zeit oder stieg sie schon davor, denn wenn sie früher begann, ist der Deploy ein Zufall und der Rollback verbrennt zehn Minuten. Zweitens: Enthielt das Release eine Schemamigration, denn dann muss ich wissen, ob der alte Code noch gegen das neue Schema funktioniert. Haben wir Expand and Contract sauber gemacht, tut er das und der Rollback ist sicher. Hat jemand eine Spalte gedroppt, ist der Rollback jetzt die gefährliche Option und ich gehe stattdessen auf einen Forward Fix oder ein Feature Flag. Sobald sich die Fehler erholen, lasse ich den schlechten Build in Staging deployt, damit wir ohne Kunden reproduzieren können. Danach würde ich darauf drängen, warum ein Canary das nicht gefangen hat, denn eine Stunde Impact heißt, der Rollout hat die Fehlerrate nicht gegen eine Baseline beobachtet.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Wie gehst du damit um, wenn das Release eine nicht umkehrbare Migration enthielt?
  • Welches automatisierte Signal hätte das in den ersten zehn Minuten fangen sollen?
  • Wie machst du einen Rollback, wenn mehrere Services zusammen deployt wurden?

Weitere Fragen für DevOps Engineer

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen