Question d'entretien pour Data Scientist

Expliquez-moi le compromis biais variance et comment il se manifeste quand vous réglez réellement un modèle.

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Le biais est l'erreur d'un modèle trop simple pour capter le vrai signal ; la variance est l'erreur d'un modèle si flexible qu'il ajuste le bruit de l'échantillon d'entraînement. L'erreur totale attendue vaut le biais au carré plus la variance plus le bruit irréductible. En pratique, vous le voyez comme un écart : une erreur élevée à la fois en entraînement et en validation signale du biais, une erreur d'entraînement faible avec une validation bien pire signale de la variance.

Pourquoi les recruteurs posent cette question

Cela sépare ceux qui ont mémorisé une définition de ceux qui s'en servent pour déboguer. Le recruteur veut savoir ce que vous faites ensuite, une fois le côté diagnostiqué, parce que les correctifs sont opposés : plus de capacité et de meilleures variables pour le biais, plus de données et de régularisation pour la variance. Il vérifie aussi que vous comparez l'erreur d'entraînement à l'erreur de validation au lieu de fixer un seul chiffre.

Comment structurer votre réponse

  • Définissez chacun des deux termes en une phrase.
  • Expliquez comment l'écart entraînement contre validation vous dit lequel domine.
  • Nommez les correctifs opposés de chaque côté.
  • Donnez un exemple concret de réglage, comme la profondeur des arbres.

Exemple de réponse

Exemple parlé, à la première personne

Le biais est l'erreur due au fait que votre modèle ne peut pas représenter la vraie relation, la variance est l'erreur due au fait qu'il court après le bruit de l'échantillon sur lequel vous vous trouvez avoir entraîné. Ce qui rend la notion utile, c'est que c'est un outil de débogage, pas un slogan. Je regarde l'erreur d'entraînement à côté de l'erreur de validation. Si les deux sont mauvaises, j'ai un problème de biais, donc j'ajoute de la capacité, des variables plus riches, ou des interactions. Si l'erreur d'entraînement est proche de zéro et que la validation est bien pire, c'est de la variance, donc je resserre avec une régularisation plus forte, moins de variables, ou plus de données si je peux en obtenir. L'exemple le plus net que j'ai rencontré était un modèle de gradient boosting sur des données de transactions. À profondeur dix, il obtenait un score presque parfait en entraînement et bien pire sur le jeu de test. Redescendre à profondeur quatre et ajouter une pénalité sur les feuilles a comblé l'essentiel de l'écart, et l'AUC sur le jeu de test a même augmenté. L'autre chose que je surveille, c'est que plus de données aide beaucoup contre la variance et quasiment pas contre le biais : si la courbe d'apprentissage a plafonné, acheter plus de lignes est de l'argent jeté.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Comment sauriez-vous, à partir d'une courbe d'apprentissage, si plus de données va aider ?
  • Qu'est-ce que le bagging fait au biais et à la variance, et le boosting ?
  • Un modèle peut-il avoir un biais élevé et une variance élevée en même temps ?

Autres questions pour Data Scientist

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot