Monitore drei Ebenen: Service-Gesundheit (Latenz, Fehlerrate, Durchsatz), Datengesundheit (Input-Verteilungen, Null- und Unknown-Category-Raten, Feature-Frische) und Modellgesundheit (Vorhersageverteilung und, sobald Labels da sind, Performance). Alarmier auf Service-Ausfälle und kaputte Input-Pipelines, weil die sofort handhabbar sind. Langsame Drift gehört auf ein Dashboard und in ein Review, nicht um 3 Uhr nachts auf den Pager.
Warum Interviewer das fragen
Interviewer wollen sehen, dass du Signale, die jetzt einen Menschen brauchen, von Signalen unterscheidest, die nächste Woche eine Entscheidung brauchen. Auf allmähliche Drift zu alarmieren weckt Leute für etwas, das sie um 3 Uhr nachts nicht beheben können, und erzieht das Team dazu, Alarme zu ignorieren. Feature-Frische und Unknown-Category-Rate zu nennen ist ein starkes Zeichen, denn eine veraltete oder kaputte Feature-Pipeline ist der häufigste echte Produktionsvorfall.
So baust du deine Antwort auf
- Teil das Monitoring in Service-, Daten- und Modellebene.
- Sag, welche Ebene einen Pager rechtfertigt und welche nicht.
- Nenn Feature-Frische und Unknown-Category-Rate konkret.
- Erwähn Label-Verzögerung und wie du monitorst, bevor Labels ankommen.
Beispielantwort
Ich denke in drei Ebenen. Service-Ebene ist das Übliche, p99-Latenz, Fehlerrate, Durchsatz, und das alarmiert, denn ein Modell, das Fehler zurückgibt, ist ein Ausfall wie jeder andere. Auf der Datenebene leben die echten ML-Vorfälle: Input-Feature-Verteilungen, Null-Raten, Unknown-Category-Raten und Feature-Frische, also wie alt der neueste Wert im Online Store ist. Frische ist das, was mich am meisten kümmert, denn ein kaputter Upstream-Job wirft keinen Fehler, er liefert einfach die Werte von gestern und das Modell gibt weiter selbstbewussten Unsinn zurück. Das alarmiert. Modellebene ist die Vorhersageverteilung und, sobald Labels da sind, die tatsächliche Performance. Eine scharf verschobene Vorhersageverteilung ist einen Alarm wert; langsame Drift ist ein Dashboard-Punkt und ein Gespräch, kein Pager, denn wenn du jemanden für allmähliche Drift weckst, liest innerhalb eines Monats niemand mehr die Alarme. Was das alles prägt, ist Label-Verzögerung. Wenn Ground Truth Wochen braucht, kann ich Genauigkeit nicht nahezu in Echtzeit monitoren, ich stütze mich also auf Input- und Output-Verteilungen als Proxys und sage klar, dass es Proxys sind.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie würdest du Drift auf einem kategorialen Feature mit hoher Kardinalität erkennen?
- Was ist eine sinnvolle Alarmschwelle für eine Verschiebung der Vorhersageverteilung?
- Wie monitorst du ein Modell, dessen Labels aus manueller Prüfung kommen?
Weitere Fragen für Machine Learning Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen