Erst dunkel ausliefern: lass sie im Shadow Mode neben dem aktuellen Modell laufen, live Traffic scoren, ohne auf den Output zu reagieren, und vergleiche Score-Verteilungen, Latenz und Feature-Verfügbarkeit. Sieht das vernünftig aus, geh auf einen Canary mit kleinem Prozentsatz und ein Online-Experiment auf der Geschäftsmetrik, dazu Guardrails. Halt die alte Version geladen, damit Rollback eine Konfigänderung ist und kein Redeploy.
Warum Interviewer das fragen
Offline-Verbesserung überträgt sich nicht zuverlässig auf online, und Interviewer wollen hören, dass du das weißt. Shadow Deployment ist die konkrete Praxis, auf die sie hören, gefolgt von einem echten Online-Test statt Vertrauen in Offline-Metriken. Zu erwähnen, dass Rollback sofort gehen muss und dass Guardrail-Metriken genauso wichtig sind wie die Zielmetrik, zeigt operative Reife.
So baust du deine Antwort auf
- Starte mit Shadow Mode und was du dabei vergleichst.
- Geh auf einen kleinen Canary mit einem echten Online-Experiment.
- Nenn Guardrail-Metriken neben der Zielmetrik.
- Mach Rollback zu einem Konfig-Umschalter und definier den Auslöser vorab.
Beispielantwort
Offline besser heißt nicht online besser, ich promote also nie direkt auf Basis einer Validation-Zahl. Erster Schritt ist Shadow Mode: das neue Modell scort dieselben Live-Requests, wir loggen seinen Output, und nichts reagiert darauf. Das fängt die langweiligen, aber tödlichen Dinge ab, Unterschiede in der Feature-Verfügbarkeit, Latenzregressionen, unerwartete Nulls, und ich kann die beiden Score-Verteilungen auf identischem Traffic vergleichen. Wenn die Scores des neuen Modells verschoben sind, müssen Schwellen downstream nachgezogen werden, selbst wenn sich die Ranking-Qualität verbessert hat, und das lernt man viel besser im Shadow als in Produktion. Dann ein Canary bei ein paar Prozent mit einem ordentlichen Online-Experiment auf der Geschäftsmetrik, nicht auf AUC. Daneben definiere ich vorab Guardrails: p99-Latenz, Fehlerrate und etwas, das ein selbstbewusst falsches Modell abfängt, was die Primärmetrik übersehen würde, etwa eine große Verschiebung der Flag-Rate. Rollback muss eine Konfigänderung sein, bei der die alte Version noch geladen ist, das dauert dann Sekunden, und ich schreibe die auslösenden Zahlen vor dem Launch auf, denn mitten im Absturz zu entscheiden, ob eine Metrik schlimm genug ist, ist ein miserabler Zeitpunkt für Meinungsbildung.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Was würdest du zwischen den Score-Verteilungen von Shadow und Live vergleichen?
- Wie lange würdest du den Canary laufen lassen, und wovon hängt das ab?
- Wie gehst du mit einem Modell um, bei dem sich die Geschäftsmetrik erst nach Wochen bewegt?
Weitere Fragen für Machine Learning Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen