Le paradoxe de Simpson, c'est quand une tendance présente dans chaque sous-groupe s'inverse une fois les groupes agrégés, parce que les tailles de groupes et les taux de base diffèrent. Le cas classique est un traitement qui fait mieux à la fois chez les patients légers et chez les patients graves, mais qui paraît moins bon globalement parce qu'il a été donné de façon disproportionnée aux cas graves. Le remède est de segmenter sur la variable confondante plutôt que de faire confiance à l'agrégat.
Pourquoi les recruteurs posent cette question
C'est un test direct de votre capacité à interroger les agrégats. Les recruteurs s'en servent parce que les tableaux de bord métier sont des agrégats par défaut, et un analyste qui ne segmente jamais finira par présenter une conclusion inversée avec une confiance totale. Un exemple réel tiré de votre propre travail vaut bien plus que le cas d'école des admissions universitaires.
Comment structurer votre réponse
- Définissez clairement l'inversion avec son mécanisme, pas seulement le nom.
- Donnez un exemple concret avec la composition confondante.
- Expliquez la défense pratique : segmenter avant de conclure.
- Dites comment vous choisissez la variable de segmentation.
- Notez que la vue segmentée n'est pas non plus automatiquement la bonne.
Exemple de réponse
C'est quand chaque sous-groupe montre un sens et que les données agrégées montrent l'inverse, sous l'effet de tailles de groupes déséquilibrées. J'ai rencontré une version de ça en comparant deux canaux d'acquisition. Le canal A avait un taux de conversion global moins bon, donc le réflexe évident était de couper son budget. En découpant par appareil, le canal A convertissait mieux à la fois sur mobile et sur ordinateur. Si l'agrégat s'inversait, c'est que le canal A envoyait un trafic massivement mobile, et que le mobile convertit moins bien pour tout le monde : le canal était pénalisé pour sa composition, pas pour sa qualité. Le couper aurait été une erreur. Depuis, mon réflexe par défaut est de confronter l'agrégat à deux ou trois segments évidents avant de présenter quoi que ce soit, en général l'appareil, la zone géographique, et nouveaux contre récurrents. J'ajouterais que segmenter n'est pas automatiquement correct non plus. Si vous découpez assez loin, vous trouverez une histoire dans du bruit, donc je choisis les variables de segmentation selon ce qui cause plausiblement le résultat, pas en cherchant le découpage qui me donne raison.
Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.
Voir comment ça marcheQuestions de relance à prévoir
- Comment choisissez-vous les variables de segmentation ?
- Comment évitez-vous de trouver de faux motifs en découpant dans tous les sens ?
- Quand le chiffre agrégé est-il celui qu'il faut présenter ?
Autres questions pour Analyste de données
Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.
Prédire mes questions