Optimiere auf Recall, wenn ein übersehener Positivfall teurer ist als ein Fehlalarm, etwa bei Fraud Screening oder Krankheitserkennung, wo ohnehin ein Mensch jeden Flag prüft. Optimiere auf Precision, wenn Handeln auf einen Positivfall teuer oder nervig ist, etwa Angebote verschicken oder Accounts sperren. Setz den Threshold über erwartete Kosten statt per Default auf 0,5, indem du Thresholds durchfährst und den minimalen erwarteten Verlust nimmst.
Warum Interviewer das fragen
Hier wird geprüft, ob du eine Modellzahl mit Geschäftskosten verbindest. Der Default von 0,5 ist ein Artefakt der Library und keine Entscheidung, und Interviewer wollen hören, dass du ihn durch etwas ersetzt, das aus den relativen Kosten der beiden Fehlerarten abgeleitet ist. Starke Kandidaten nennen zusätzlich die Kapazität stromabwärts, denn ein Review-Team, das nur zweihundert Fälle am Tag schafft, deckelt den Recall unabhängig von der Mathematik.
So baust du deine Antwort auf
- Verankere die Entscheidung in den Kosten jeder Fehlerart.
- Gib je ein konkretes Beispiel für beide Seiten.
- Erklär, wie du aus Kosten einen Threshold machst statt 0,5 zu nehmen.
- Erwähn die operative Kapazität als echte Grenze für Recall.
Beispielantwort
Ich frage zuerst, was bei jeder Art von Fehler passiert. In einer Fraud-Queue ist ein False Negative echtes Geld plus Chargeback, ein False Positive kostet dreißig Sekunden Analystenzeit. Also gewinnt Recall und ich drücke den Threshold runter. Bei einem Push-Notification-Modell dreht sich das: Ein False Positive nervt einen echten Nutzer und kann dich eine Deinstallation kosten, also will ich Precision, selbst wenn ich weniger Leute erreiche. Für die konkrete Zahl hänge ich grobe Kosten an jede Fehlerart, fahre den Threshold über das Validierungsset und plotte die erwarteten Kosten. Meist gibt es eine klare Mulde, und ich nehme die Mitte der Mulde statt des exakten Minimums, weil das Minimum zwischen den Folds hin und her springt. Der Punkt, den alle vergessen, ist Kapazität. In einem Fraud-Projekt sagte die Kostenkurve, wir sollen rund vier Prozent der Transaktionen flaggen, aber das Review-Team schaffte etwa tausend Fälle am Tag, also war der echte Threshold der, der tausend produziert. Das habe ich klar so gesagt, statt so zu tun, als wäre die Wahl rein statistisch.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie hängt der F1-Score mit dem zusammen, was du gerade beschrieben hast, und wann ist er die falsche Zusammenfassung?
- Was, wenn die Kosten eines False Negative unbekannt sind?
- Wie kommunizierst du diese Threshold-Wahl an ein Compliance-Team?
Weitere Fragen für Data Scientist
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen