Question d'entretien pour Data Scientist

Comment décidez-vous quoi faire des valeurs manquantes dans un jeu de données ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Commencez par découvrir pourquoi les valeurs manquent, puisque le mécanisme décide du correctif. Un manque complètement aléatoire tolère une imputation simple ; un manque aléatoire conditionnel demande une imputation conditionnée aux variables observées ; un manque non aléatoire signifie que l'absence elle-même est un signal et doit devenir une variable. N'imputez jamais avant le découpage, et ajoutez un indicateur de valeur manquante dès que le motif porte de l'information.

Pourquoi les recruteurs posent cette question

Les candidats faibles sautent directement à l'imputation par la moyenne. Le recruteur vérifie si vous enquêtez d'abord sur la cause, parce que dans les vrais systèmes l'absence est en général un pipeline cassé, un champ de formulaire facultatif, ou un champ qui n'existe que pour un segment de clients, et chacun de ces cas appelle une action différente. Il veut aussi vous entendre dire que l'imputation s'ajuste sur les données d'entraînement seulement, puisque l'ajuster sur tout fait fuir de l'information.

Comment structurer votre réponse

  • Demandez pourquoi la donnée manque avant de décider comment la remplir.
  • Associez les trois mécanismes à trois réponses différentes.
  • Dites que l'indicateur de valeur manquante est souvent une variable forte à lui seul.
  • Notez que l'imputation s'ajuste à l'intérieur du pli d'entraînement.

Exemple de réponse

Exemple parlé, à la première personne

La première chose que je fais n'est pas statistique, c'est une conversation avec la personne responsable du champ. Une valeur manquante veut en général dire quelque chose de précis. Sur un jeu de données de crédit sur lequel j'ai travaillé, le revenu était vide pour environ un cinquième des lignes, et ces lignes venaient d'un parcours de demande accéléré qui ne le demandait jamais. Ce n'est pas aléatoire du tout, et ces demandeurs faisaient défaut à un taux différent, donc le fait même que la case soit vide était l'un des prédicteurs les plus forts du modèle. J'ai ajouté un indicateur de valeur manquante et il a gagné sa place. Mécaniquement, si c'est vraiment du bruit aléatoire et que la colonne est presque complète, une imputation par la médiane plus un indicateur suffit. Si cela dépend d'autres variables observées, j'utilise une imputation itérative ou fondée sur un modèle. Si plus de la moitié d'une colonne manque, je la supprime en général, parce qu'à ce stade j'impute surtout mes propres hypothèses. Et quoi que j'utilise, cela s'ajuste sur le seul jeu d'entraînement avant d'être appliqué à la validation, parce que calculer une médiane sur le jeu de données entier fait discrètement fuir de l'information.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Comment les arbres de gradient boosting gèrent-ils nativement les valeurs manquantes ?
  • Qu'est-ce qui se passe mal si vous imputez avant de découper ?
  • Comment traiteriez-vous une variable manquante seulement pour les nouveaux clients ?

Autres questions pour Data Scientist

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot