Faites un bootstrap. Rééchantillonnez vos données avec remise jusqu'à la taille d'origine, calculez la médiane sur chaque rééchantillon, répétez quelques milliers de fois, puis prenez les 2,5e et 97,5e percentiles de cette distribution comme intervalle à 95%. Cela ne demande aucune hypothèse de distribution et fonctionne pour les médianes, les ratios et d'autres statistiques peu commodes, à condition que les observations rééchantillonnées soient indépendantes.
Pourquoi les recruteurs posent cette question
Cela vérifie si vous savez dépasser les formules mémorisées quand la statistique n'en a pas. Le recruteur écoute le rééchantillonnage avec remise à la même taille, un nombre d'itérations raisonnable, et la conscience de l'hypothèse d'indépendance, puisque faire un bootstrap sur des lignes quand un même utilisateur contribue des centaines de sessions produit des intervalles bien trop étroits pour être utiles.
Comment structurer votre réponse
- Décrivez concrètement la boucle de rééchantillonnage en deux phrases.
- Dites comment l'intervalle sort de l'étalement des percentiles.
- Nommez l'hypothèse dont il a bel et bien besoin : des observations indépendantes.
- Mentionnez le bootstrap par grappes ou par blocs quand les lignes sont groupées.
Exemple de réponse
Je fais un bootstrap. On tire les observations avec remise jusqu'à la taille de l'échantillon d'origine, on calcule la médiane sur ce rééchantillon, on la stocke, et on répète quelques milliers de fois. L'étalement de ces médianes est une distribution d'échantillonnage empirique, et je prends les 2,5e et 97,5e percentiles comme intervalle. C'est facile à implémenter et ça marche pour des statistiques sans formule élégante, ce qui est le cas de la plupart des statistiques intéressantes : médianes, 90e percentiles, ratios de deux indicateurs, différences de médianes entre groupes. L'hypothèse qui mord vraiment, c'est l'indépendance. Si je fais un bootstrap sur la durée de session et qu'un utilisateur intensif a quatre cents sessions, rééchantillonner des sessions individuelles traite ça comme quatre cents faits indépendants et l'intervalle sort bien trop étroit. Je rééchantillonne donc des utilisateurs, pas des sessions, en emportant toutes les sessions de l'utilisateur avec lui. Même idée pour les séries temporelles, où je fais un bootstrap par blocs contigus pour préserver l'autocorrélation. Trompez-vous d'unité de rééchantillonnage et vous obtenez un intervalle serré, plein d'assurance et complètement faux.
Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.
Voir comment ça marcheQuestions de relance à prévoir
- Combien d'itérations de bootstrap faites-vous, et comment le décidez-vous ?
- Quand le bootstrap échoue-t-il purement et simplement ?
- Quelle est la différence entre l'intervalle par percentiles et l'intervalle corrigé du biais ?
Autres questions pour Data Scientist
Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.
Prédire mes questions