Autoscaling braucht Minuten, also erst Last abwerfen und dann skalieren. Wirf Last ab, wenn der Engpass etwas ist, dem du nicht schnell Kapazität hinzufügen kannst, etwa eine Datenbank, eine lizenzierte Dependency oder ein Service mit langsamen Cold Starts, oder wenn Queues schneller wachsen, als du sie je leeren könntest. Verwirf zuerst die billigste, unwichtigste Arbeit, gib 429 mit Retry-After zurück und schütz die Requests, die Umsatz oder Sicherheit tragen.
Warum Interviewer das fragen
Der Interviewer testet, ob du Zeitkonstanten verstehst. Kandidaten, die nur hochskalieren sagen, haben die Lücke zwischen dem Auslösen des Alerts und der neuen Kapazität im Traffic nie gespürt. Gute Antworten decken die Priorisierung von Traffic-Klassen ab, die Gefahr, eine zustandslose Ebene in einen zustandsbehafteten Engpass hineinzuskalieren, und graceful degradation als entworfenes Verhalten statt als Unfall.
So baust du deine Antwort auf
- Stell die Zeit zum Abwerfen (sofort) der Zeit zum Skalieren (Minuten) gegenüber.
- Identifizier zuerst den Engpass, denn die falsche Ebene zu skalieren macht es schlimmer.
- Definier Traffic-Klassen und welche zuerst fallen.
- Nenn den Mechanismus: 429 mit Retry-After, Queue-Limits, Degraded Mode.
Beispielantwort
Abwerfen ist sofort, Skalieren nicht, bei echter Überlast werfe ich also zuerst ab und lasse Kapazität nachziehen. Die größere Frage ist, was der Engpass tatsächlich ist. Mehr zustandslose Pods hinzuzufügen, wenn die Begrenzung Datenbankverbindungen sind, ist wirklich schädlich, denn jeder neue Pod öffnet einen Pool und beschleunigt den Zusammenbruch. Genau das hatten wir bei einem Flash Sale, bis wir einen Connection Proxy davorgesetzt und die Gesamtzahl der Verbindungen gedeckelt haben. Fürs Abwerfen mag ich explizite Traffic-Klassen. Checkout- und Zahlungsaufrufe sind Klasse eins und fallen nie, eingeloggtes Browsen ist Klasse zwei, und anonymes Crawling plus nicht essenzielle Empfehlungsaufrufe sind Klasse drei und fallen zuerst. Wir haben das am Edge mit einem Concurrency Limiter durchgesetzt und 429 mit einem Retry-After-Header zurückgegeben, damit sich brave Clients zurückziehen, statt weiter zu hämmern. Kombinier das mit einem Degraded Mode, der gecachte Listen ausliefert, und du bleibst für den Traffic online, der zählt.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie würdest du adaptive Concurrency Limits am Edge umsetzen?
- Welches Signal würdest du nutzen, um zu entscheiden, wann das Abwerfen beginnt?
- Wie verhinderst du, dass Autoscaling einen Datenbank-Engpass verschlimmert?
Weitere Fragen für Site Reliability Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen