Question d'entretien pour Data Scientist

Quelle est la différence pratique entre la régularisation L1 et L2, et comment choisissez-vous entre les deux ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

La L1 (lasso) ajoute la somme des coefficients en valeur absolue à la fonction de perte et pousse certains coefficients exactement à zéro, donc elle fait de la sélection de variables. La L2 (ridge) ajoute la somme des coefficients au carré, ce qui rétrécit tout vers zéro sans rien éliminer, et gère plus élégamment les prédicteurs corrélés. Prenez la L1 quand vous voulez un modèle parcimonieux et explicable ; prenez la L2 quand les prédicteurs sont corrélés et que vous voulez de la stabilité.

Pourquoi les recruteurs posent cette question

N'importe qui peut réciter lasso contre ridge. Le recruteur veut la raison géométrique ou pratique pour laquelle la L1 produit des zéros exacts, et il veut vous entendre dire que vous standardisez d'abord les variables, parce que les deux pénalités n'ont aucun sens sur des données non mises à l'échelle. Mentionner l'elastic net comme choix par défaut pragmatique et décrire comment vous choisissez la force de pénalité par validation croisée distingue un praticien de quelqu'un qui répète une ligne de manuel.

Comment structurer votre réponse

  • Énoncez le terme de pénalité de chacune en langage simple.
  • Expliquez pourquoi la L1 atteint des zéros exacts et pas la L2.
  • Mentionnez que les variables doivent être mises à l'échelle avant que l'une ou l'autre pénalité ait un sens.
  • Dites comment vous choisissez la force, et nommez l'elastic net comme juste milieu.

Exemple de réponse

Exemple parlé, à la première personne

La L2 met les coefficients au carré et les rétrécit tous en douceur vers zéro. La L1 utilise les valeurs absolues, et comme cette pénalité a un coin en zéro, l'optimum tombe souvent exactement sur zéro, ce qui fait que le lasso sert aussi de sélection de variables. La règle pratique que j'applique porte sur la corrélation. Si j'ai un bloc de prédicteurs très corrélés, le lasso en choisit un presque arbitrairement et met les autres à zéro, ce qui paraît propre mais est instable : réajustez sur un échantillon bootstrap et il en choisit un autre. La ridge les garde tous et répartit le poids, ce qui est en général plus honnête. Si une partie prenante a besoin d'une courte liste de facteurs, je prends le lasso et j'accepte l'instabilité, mais je dis à voix haute que les survivants sont des représentants d'un groupe corrélé, pas les seules choses qui comptent. En pratique je me tourne souvent vers l'elastic net, ce qui me donne un peu de parcimonie sans le choix arbitraire, et je règle la force par validation croisée. Et je standardise toujours d'abord, sinon la pénalité punit simplement la variable qui se trouve être mesurée dans de petites unités.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Pourquoi la pénalité L1 produit-elle géométriquement des zéros exacts ?
  • Que deviennent les coefficients ridge quand la pénalité tend vers l'infini ?
  • Comment régleriez-vous la force de pénalité quand vous avez aussi un déséquilibre de classes ?

Autres questions pour Data Scientist

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot