Finde zuerst heraus, warum die Werte fehlen, denn der Mechanismus bestimmt den Fix. Missing Completely at Random verträgt einfache Imputation, Missing at Random braucht Imputation bedingt auf beobachtete Variablen, Missing Not at Random heißt, dass das Fehlen selbst Signal ist und ein Feature werden sollte. Nie vor dem Split imputieren, und immer ein war-fehlend-Flag ergänzen, wenn das Muster Information trägt.
Warum Interviewer das fragen
Schwache Kandidaten springen direkt zur Mittelwert-Imputation. Der Interviewer prüft, ob du zuerst die Ursache untersuchst, denn in echten Systemen bedeutet Fehlen meist eine kaputte Pipeline, ein optionales Formularfeld oder ein Feld, das nur für ein Kundensegment existiert, und jedes davon impliziert eine andere Reaktion. Er will außerdem hören, dass Imputation nur auf Trainingsdaten gefittet wird, weil ein Fit auf allem leakt.
So baust du deine Antwort auf
- Frag, warum die Daten fehlen, bevor du entscheidest, wie du füllst.
- Ordne den drei Mechanismen drei unterschiedliche Reaktionen zu.
- Sag, dass das Missing-Flag oft für sich genommen ein starkes Feature ist.
- Merk an, dass Imputation innerhalb des Trainings-Folds gefittet wird.
Beispielantwort
Das Erste, was ich mache, ist nicht statistisch, sondern ein Gespräch mit dem, dem das Feld gehört. Fehlend heißt meist etwas Bestimmtes. In einem Kreditdatensatz, an dem ich gearbeitet habe, war Einkommen bei etwa einem Fünftel der Zeilen leer, und die kamen aus einem Fast-Track-Antragsflow, der nie danach gefragt hat. Das ist überhaupt nicht zufällig, und diese Antragsteller sind mit einer anderen Rate ausgefallen, also war die Tatsache des Leerfelds einer der stärksten Prädiktoren im Modell. Ich habe ein Is-Missing-Flag ergänzt und es hat sich seinen Platz verdient. Mechanisch: Wenn es wirklich zufälliges Rauschen ist und die Spalte weitgehend vollständig, reicht Median-Imputation plus Flag. Hängt es von anderen beobachteten Variablen ab, nutze ich iterative oder modellbasierte Imputation. Fehlt mehr als etwa die Hälfte einer Spalte, werfe ich sie meist raus, denn ab da imputiere ich vor allem meine eigenen Annahmen. Und was immer ich nutze, wird nur auf dem Trainingssplit gefittet und dann auf die Validierung angewendet, denn ein Median über den ganzen Datensatz leakt still und leise.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie gehen Gradient Boosted Trees nativ mit fehlenden Werten um?
- Was geht schief, wenn du vor dem Split imputierst?
- Wie gehst du mit einem Feature um, das nur bei Neukunden fehlt?
Weitere Fragen für Data Scientist
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen