Soupçonnez une fuite dès que la performance est étonnamment bonne. Les contrôles principaux : cherchez des variables à l'importance invraisemblablement élevée, confirmez que chaque variable était connaissable au moment de la prédiction, vérifiez que le prétraitement a été ajusté à l'intérieur du pli d'entraînement, et vérifiez qu'aucune entité n'apparaît à la fois en entraînement et en test. Une chute brutale entre le hors ligne et la production est souvent une fuite qui se révèle.
Pourquoi les recruteurs posent cette question
La fuite est l'échec qui survit à tous les contrôles standards, parce qu'elle fait paraître le modèle excellent, donc les recruteurs veulent savoir si votre méfiance se déclenche sur une bonne nouvelle plutôt que sur une mauvaise. Ils écoutent la discipline des horodatages (est-ce que c'était connaissable au moment de la prédiction), l'hygiène des plis pour le prétraitement, et le regroupement des entités dupliquées, les trois voies par lesquelles elle se glisse en général.
Comment structurer votre réponse
- Dites qu'une performance étonnamment élevée est la première alarme.
- Appliquez le test connaissable au moment de la prédiction à chaque variable.
- Vérifiez que le prétraitement et le rééchantillonnage se sont faits dans le pli.
- Vérifiez l'absence d'entités dupliquées de part et d'autre du découpage.
- Donnez une fuite concrète que vous avez trouvée.
Exemple de réponse
Mon déclencheur, c'est la bonne nouvelle. Si un modèle bondit à 0,97 d'AUC sur un problème que le métier trouve difficile, je pars du principe que j'ai fait fuir quelque chose tant que je n'ai pas prouvé le contraire. Le test principal que je fais passer à chaque variable est une question d'horodatage : au moment où on score cet enregistrement en production, cette valeur existerait-elle, et vaudrait-elle ceci ? Un nombre surprenant d'entre elles échouent. La pire que j'aie attrapée était une variable appelée statut du compte. Elle avait l'air innocente, mais l'équipe des opérations la passait à clôturé après le départ d'un client, et l'instantané d'entraînement contenait la valeur actuelle plutôt que la valeur à la date de prédiction : le modèle lisait donc la réponse. La retirer a fait chuter l'AUC d'environ 0,94 à 0,79, ce qui était le vrai chiffre. Au-delà de ça, je vérifie que les scalers, les encodeurs et tout rééchantillonnage ont été ajustés à l'intérieur du pli, qu'aucun identifiant client ne se retrouve à la fois en entraînement et en test, et que les encodages de la cible ont été calculés hors pli. Et je regarde l'importance des variables tôt plutôt qu'en fin de parcours comme étape de reporting, parce qu'une variable qui porte l'essentiel du modèle est en général une fuite, pas une découverte.
Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.
Voir comment ça marcheQuestions de relance à prévoir
- Comment un encodage de la cible fait-il fuir de l'information, et comment le faire proprement ?
- Quelle est la différence entre une fuite et un signal légitime venant d'une variable forte ?
- Comment auditeriez-vous un modèle construit par quelqu'un d'autre à la recherche de fuites ?
Autres questions pour Data Scientist
Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.
Prédire mes questions