Blue Green betreibt zwei komplette Umgebungen und schaltet den Traffic auf einen Schlag um, das Rollback ist also sofort, aber jeder User trifft im selben Moment auf die neue Version. Canary schickt einen kleinen Anteil echten Traffics auf die neue Version und erhöht ihn, während du die SLIs beobachtest, der Blast Radius ist also klein, aber das Rollout langsamer. Nimm Blue Green für schnelle, schemaneutrale Umschaltungen, nimm Canary für riskante Logikänderungen im großen Maßstab.
Warum Interviewer das fragen
Interviewer wollen wissen, ob du über Blast Radius und Rollback nachdenken kannst statt Definitionen aufzusagen. Die besten Antworten bringen die schweren Teile zur Sprache, die beide Strategien teilen: Schemaänderungen in der Datenbank, Session- und Cache-State, langlebige Verbindungen und die Notwendigkeit automatisierter Analyse, damit die Canary-Entscheidung nicht ein einzelner Engineer ist, der auf einen Graphen schielt.
So baust du deine Antwort auf
- Definier beides über die Traffic-Bewegung, nicht über Tooling.
- Vergleich sie bei Blast Radius, Rollback-Geschwindigkeit und Kosten.
- Sprich das gemeinsame harte Problem an: Datenbank- und Schemakompatibilität.
- Besteh auf automatisierter Canary-Analyse gegen die SLIs.
- Gib je eine konkrete Situation, in der du das eine oder andere wählst.
Beispielantwort
Blue Green sind zwei komplette Stacks mit einem Schalter davor. Du deployst auf den untätigen, verifizierst, kippst den Router, und wenn es schiefgeht, kippst du in Sekunden zurück. Canary ist progressiv: 1% des Traffics, dann 5, dann 25, mit Blick auf Fehlerrate und Latenz bei jedem Schritt und einem automatischen Rollback, wenn die neue Version schlechter aussieht als die Baseline. Ich tendiere zu Canary, wenn das Risiko in subtilen Verhaltensänderungen liegt, denn Blue Green sagt dir erst etwas über den Bruch, wenn schon alle drauf sind. Blue Green ist super für Umschaltungen auf Infrastrukturebene, bei denen der Code unverändert bleibt. Was beides dominiert, ist die Datenbank. Wir haben bei jeder Schemaänderung Expand and Contract gefahren, die neue Spalte geht also zuerst live, beide Versionen können lesen und schreiben, und erst wenn die alte Version komplett ausgemustert ist, wird etwas gelöscht. Ohne das steht dein sofortiges Rollback gar nicht wirklich zur Verfügung, und das ist eine hässliche Erkenntnis mitten im Incident.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie gehst du mit einer Schemamigration um, die sich nicht abwärtskompatibel machen lässt?
- Welche Metriken würden einen Canary automatisch abbrechen?
- Wie verkomplizieren Sticky Sessions oder offene WebSockets eine Umschaltung?
Weitere Fragen für Site Reliability Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen