Question d'entretien pour Data Scientist

Deux de vos prédicteurs ont une corrélation de 0,95. Est-ce que ça pose problème, et qu'en faites-vous ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Cela dépend de votre objectif. Pour de la pure prédiction, la colinéarité nuit à peine à la performance ; le modèle se contente de répartir le poids entre les jumeaux. Pour de l'inférence, c'est sérieux : les coefficients deviennent instables et leurs erreurs types gonflent, donc les signes peuvent s'inverser d'un échantillon à l'autre et vous ne pouvez pas dire quelle variable pilote le résultat. Regardez les facteurs d'inflation de la variance, puis supprimez-en une, combinez-les, ou utilisez une ridge.

Pourquoi les recruteurs posent cette question

La bonne réponse commence par une question plutôt que par un correctif, et c'est exactement ce que les recruteurs écoutent. Les candidats qui disent immédiatement d'en supprimer une montrent qu'ils ont une seule recette. Dire que la colinéarité est davantage un problème d'inférence qu'un problème de prédiction, et savoir que les ensembles d'arbres se comportent différemment des modèles linéaires ici, montre que vous comprenez ce que veulent dire les coefficients au lieu de les traiter comme des scores d'importance.

Comment structurer votre réponse

  • Demandez d'abord si le modèle sert à prédire ou à expliquer.
  • Expliquez ce que la colinéarité fait à la stabilité des coefficients et aux erreurs types.
  • Nommez un diagnostic comme le VIF ou un indice de conditionnement.
  • Donnez les options (supprimer, combiner, régulariser) et le cas où chacune convient.

Exemple de réponse

Exemple parlé, à la première personne

Ma première question est de savoir à quoi sert le modèle. Si on score des leads et que personne ne lit les coefficients, une corrélation de 0,95 est surtout inoffensive. L'ajustement est bon, les prédictions sont bonnes, le poids se répartit simplement entre les deux variables d'une façon arbitraire. Là où ça mord, c'est quand quelqu'un compte agir sur les coefficients. Alors c'est un vrai problème, parce que cette répartition est instable : réajustez sur un échantillon légèrement différent et un coefficient bascule au positif pendant que l'autre bascule au négatif, et les erreurs types sont assez larges pour qu'aucun ne paraisse significatif alors que la paire compte manifestement. Je regarde le VIF, et tout ce qui dépasse dix environ, je le traite comme suspect. Le correctif dépend de la paire. Si ce sont deux mesures de la même chose, comme le chiffre d'affaires et le chiffre d'affaires en devise locale, j'en supprime une. Si ce sont vraiment deux facettes d'une même réalité, je les combine en un ratio ou en une composante unique. Si j'ai besoin des deux et que seule la qualité de prédiction m'intéresse, la ridge gère ça proprement en partageant le poids de façon stable plutôt qu'arbitraire.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Comment une forêt aléatoire gère-t-elle deux variables quasi identiques ?
  • Que vous dit numériquement un VIF de 15 ?
  • Les composantes principales régleraient-elles ça, et qu'y perdez-vous ?

Autres questions pour Data Scientist

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot