Interviewfrage für Data Scientist

Zwei deiner Prädiktoren korrelieren mit 0,95. Ist das ein Problem, und was machst du dagegen?

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Kommt auf dein Ziel an. Für reine Prediction schadet Kollinearität der Genauigkeit kaum, das Modell teilt das Gewicht einfach zwischen den Zwillingen auf. Für Inferenz ist es ernst: Koeffizienten werden instabil, ihre Standardfehler blähen sich auf, Vorzeichen können zwischen Samples kippen und du kannst nicht sagen, welche Variable das Ergebnis treibt. Prüf Variance Inflation Factors, dann eine rauswerfen, kombinieren oder Ridge nutzen.

Warum Interviewer das fragen

Die richtige Antwort beginnt mit einer Rückfrage statt mit einem Fix, und genau darauf achten Interviewer. Wer sofort eine rauswerfen sagt, zeigt, dass er ein einziges Rezept hat. Zu sagen, dass Kollinearität eher ein Inferenz- als ein Prediction-Problem ist, und zu wissen, dass Tree Ensembles sich hier anders verhalten als lineare Modelle, zeigt, dass du verstehst, was Koeffizienten wirklich bedeuten, statt sie als Importance-Scores zu behandeln.

So baust du deine Antwort auf

  • Frag zuerst, ob das Modell für Prediction oder für Erklärung da ist.
  • Erklär, was Kollinearität mit Koeffizientenstabilität und Standardfehlern macht.
  • Nenne eine Diagnostik wie VIF oder eine Konditionszahl.
  • Nenne die Optionen (rauswerfen, kombinieren, regularisieren) und wann welche passt.

Beispielantwort

Gesprochenes Beispiel, erste Person

Meine erste Frage ist, wofür das Modell da ist. Wenn wir Leads scoren und niemand die Koeffizienten liest, ist eine Korrelation von 0,95 weitgehend harmlos. Der Fit ist in Ordnung, die Vorhersagen sind in Ordnung, das Gewicht wird nur irgendwie zwischen den beiden Variablen aufgeteilt. Beißen tut es, wenn jemand auf Basis der Koeffizienten handeln will. Dann ist es ein echtes Problem, weil diese Aufteilung instabil ist: Refit auf einem leicht anderen Sample und ein Koeffizient schlägt ins Positive, der andere ins Negative, und die Standardfehler sind so breit, dass keiner signifikant aussieht, obwohl das Paar offensichtlich relevant ist. Ich prüfe VIF, und alles über etwa zehn behandle ich als verdächtig. Der Fix hängt vom Paar ab. Sind es zweimal dasselbe, etwa Umsatz und Umsatz in Landeswährung, werfe ich eines raus. Sind es wirklich zwei Facetten von etwas, kombiniere ich sie zu einer Ratio oder einer Komponente. Brauche ich beide und zählt nur Vorhersagequalität, löst Ridge das sauber, indem es das Gewicht stabil statt willkürlich aufteilt.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Wie geht ein Random Forest mit zwei nahezu identischen Features um?
  • Was sagt dir ein VIF von 15 numerisch tatsächlich?
  • Würden Principal Components das lösen, und was gibst du dafür auf?

Weitere Fragen für Data Scientist

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen