Interviewfrage für Site Reliability Engineer

Die p99-Latenz deiner Haupt-API verdreifacht sich zwanzig Minuten nach einem Deploy. Erklär mir, was du tust.

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Stabilisier, bevor du untersuchst: Wenn das Timing mit dem Deploy korreliert, roll erst zurück oder stopp das Rollout. Vergleich dann alte und neue Version auf denselben Dashboards, prüf Fehlerrate und Saturation neben der Latenz und stell fest, ob der Ausschlag gleichmäßig ist oder auf einen Endpoint, einen Shard oder eine Zone beschränkt. Traces zeigen, welcher Hop gewachsen ist. Die Ursachenanalyse kommt, wenn die User in Sicherheit sind.

Warum Interviewer das fragen

Das ist die zentrale SRE-Simulation, und Interviewer interessiert deine Reihenfolge weit mehr als deine Hypothese. Sie wollen Mitigation vor Diagnose, Belege von oben nach unten gesammelt und explizite Prüfungen der Annahme, dass der Deploy die Ursache ist. Kommunikation und Incident-Rollen zu verschweigen ist eine häufige Lücke.

So baust du deine Antwort auf

  • Mitigier zuerst: Rollback oder Rollout pausieren, dann den Incident ausrufen.
  • Bestätig die Auswirkung gegen das SLO, damit die Schwere auf Zahlen fußt.
  • Grenz den Blast Radius ein: welcher Endpoint, welche Version, welcher Shard, welche Zone.
  • Nutz Traces, um den gewachsenen Hop zu finden, und korrelier mit dem Diff.
  • Prüf die Erholung am nutzerseitigen SLI, bevor du abschließt.

Beispielantwort

Gesprochenes Beispiel, erste Person

Als Erstes stoppe ich die Blutung. Wenn vor zwanzig Minuten ein Deploy rausging und sich die Latenz verdreifacht hat, ist das ein Rollback, bis das Gegenteil bewiesen ist, und ich liege gerne falsch über die Kausalität, solange es den Usern gut geht. Parallel rufe ich einen Incident aus, damit jemand die Kommunikation besitzt, denn die schlimmsten Incidents, in denen ich war, waren die, in denen dieselben drei Leute in fünf Kanälen gleichzeitig debuggt und Fragen beantwortet haben. Dann prüfe ich, ob es gleichmäßig ist. Ist es jeder Endpoint oder einer? Alle Pods oder nur das neue ReplicaSet? Eine Availability Zone? Das schrumpft den Suchraum meist sofort. Von dort ziehe ich einen Exemplar-Trace für einen langsamen Request und schaue, wo die Zeit tatsächlich hingegangen ist. Wir hatten so einen Fall, bei dem der neue Build einen harmlos wirkenden Logging-Aufruf in eine Schleife gesetzt hat, der pro Iteration ein DNS-Lookup machte, der Span-Baum hat das in Sekunden offensichtlich gemacht. Nach dem Rollback bestätige ich, dass p99 wieder unter dem SLO liegt, bevor ich irgendetwas schließe.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Was, wenn ein Rollback wegen einer Schemamigration nicht möglich ist?
  • Wie unterscheidest du einen deploy-induzierten Ausschlag von einer organischen Traffic-Änderung?
  • Was würdest du prüfen, wenn nur eine Availability Zone betroffen wäre?

Weitere Fragen für Site Reliability Engineer

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen