Interviewfrage für Site Reliability Engineer

Marketing sagt dir, eine Kampagne bringt nächsten Dienstag den zehnfachen Traffic. Was machst du?

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Lastteste gegen den echten Engpass statt gegen die Web-Ebene. Leite die Kapazität pro Komponente aus dem aktuellen Traffic und dem Puffer ab und schau dir dann an, was nicht horizontal skaliert: Schreibdurchsatz der Datenbank, Verbindungslimits, Rate Limits von Drittanbietern und Cloud-Quotas. Skalier vorab, statt darauf zu vertrauen, dass Autoscaling rechtzeitig reagiert, erhöh Quotas im Voraus, bereite einen Plan zum Abwerfen und Degradieren vor und besetz die Rufbereitschaft für das Zeitfenster.

Warum Interviewer das fragen

Kapazitätsarbeit zeigt, ob du in Systemen denkst oder in Servern. Interviewer wollen hören, dass du die begrenzte Ressource findest, dass du weißt, dass Autoscaling eine Reaktionszeit und eine Quota-Obergrenze hat, und dass du graceful degradation einplanst. Zu erwähnen, dass du die Zahl und die Form der Marketing-Prognose hinterfragst (ein Spike, kein Plateau), ist ein starkes Signal.

So baust du deine Antwort auf

  • Klär die Form des Traffics: Spitzenrate, Dauer und Mix.
  • Modellier den Puffer pro Komponente aus der aktuellen Auslastung.
  • Lastteste, um den echten Engpass zu finden, meist zustandsbehaftet.
  • Skalier vorab und erhöh Quotas und Limits vor dem Zeitfenster.
  • Bereite den Degradationsplan vor und besetz das Event.

Beispielantwort

Gesprochenes Beispiel, erste Person

Zuerst würde ich festnageln, was zehnfach heißt, denn zehnfach über einen Tag ist ein anderes Problem als zehnfach in den ersten vier Minuten eines E-Mail-Versands, und bei Kampagnen ist es fast immer Letzteres. Dann modelliere ich jede Ebene aus dem aktuellen Verbrauch: Wenn wir heute bei Spitze auf 30% CPU laufen, ist die zustandslose Ebene einfach, aber interessant sind die Teile, die nicht durch mehr Pods skalieren. Bei uns waren das der Schreibdurchsatz von Postgres und ein Zahlungsanbieter mit einem Rate Limit, an das wir nie herangekommen waren, wofür es einen Anruf und eine Woche Vorlauf brauchte. Ich würde einen Lasttest fahren, der den echten Pfad trifft und nicht einen synthetischen Health Check, und ich würde vorab skalieren statt mich auf den Autoscaler zu verlassen, denn ein Cold Start von neunzig Sekunden ist in einem Spike eine Ewigkeit. Zuletzt ein schriftlicher Degradationsplan: was wir zuerst abschalten, wer den Schalter umlegen darf, und ein gemeinsamer Kanal mit Marketing, damit der Versand pausiert werden kann.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Was würdest du zuerst abschalten, wenn du während des Spikes degradieren müsstest?
  • Wie würdest du lasttesten, ohne Produktionsnutzer zu beeinträchtigen?
  • Welche Cloud-Quotas würdest du vor so einem Event prüfen?

Weitere Fragen für Site Reliability Engineer

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen