Surveillez trois couches : la santé du service (latence, taux d'erreur, débit), la santé des données (distributions des entrées, taux de valeurs nulles et de catégories inconnues, fraîcheur des caractéristiques), et la santé du modèle (distribution des prédictions, et performance une fois les étiquettes arrivées). Alertez sur les pannes de service et sur les ruptures du pipeline d'entrée, parce que ce sont des choses actionnables tout de suite. Envoyez la dérive lente vers un tableau de bord et une revue, pas vers une astreinte à 3 h du matin.
Pourquoi les recruteurs posent cette question
Les recruteurs veulent voir que vous distinguez les signaux qui exigent un humain tout de suite de ceux qui exigent une décision la semaine prochaine. Alerter sur une dérive graduelle réveille les gens pour quelque chose qu'ils ne peuvent pas corriger à 3 h du matin et entraîne l'équipe à ignorer les alertes. Nommer la fraîcheur des caractéristiques et le taux de catégories inconnues est un signal fort, puisqu'un pipeline de caractéristiques périmé ou cassé est l'incident de production le plus courant.
Comment structurer votre réponse
- Découpez la surveillance en couches service, données et modèle.
- Dites quelle couche justifie une alerte d'astreinte et laquelle non.
- Nommez précisément la fraîcheur des caractéristiques et le taux de catégories inconnues.
- Mentionnez le délai des étiquettes et comment vous surveillez avant leur arrivée.
Exemple de réponse
Je vois ça comme trois couches. Le niveau service, c'est le classique, latence p99, taux d'erreur, débit, et ça déclenche une astreinte, parce qu'un modèle qui renvoie des erreurs est une panne comme une autre. Le niveau données, c'est là que vivent les vrais incidents ML : distributions des caractéristiques d'entrée, taux de valeurs nulles, taux de catégories inconnues, et fraîcheur des caractéristiques, c'est-à-dire l'âge de la valeur la plus récente dans le magasin en ligne. La fraîcheur est ce qui m'importe le plus, parce qu'un job amont cassé ne lève pas d'erreur, il sert juste les valeurs d'hier et le modèle continue à renvoyer des absurdités avec assurance. Ça déclenche une astreinte. Le niveau modèle, c'est la distribution des prédictions et, une fois les étiquettes arrivées, la performance réelle. Une distribution de prédictions qui décale brutalement mérite une alerte ; une dérive lente est un point de tableau de bord et une conversation, pas une astreinte, parce que réveiller quelqu'un pour une dérive graduelle fait qu'au bout d'un mois plus personne ne lit les alertes. Ce qui façonne tout ça, c'est le délai des étiquettes. Si la vérité terrain met des semaines, je ne peux pas surveiller l'exactitude quasiment en temps réel, donc je m'appuie sur les distributions d'entrée et de sortie comme indicateurs indirects et je dis clairement que ce sont des indicateurs indirects.
Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.
Voir comment ça marcheQuestions de relance à prévoir
- Comment détecteriez-vous une dérive sur une caractéristique catégorielle à forte cardinalité ?
- Quel seuil d'alerte est raisonnable pour un décalage de la distribution des prédictions ?
- Comment surveillez-vous un modèle dont les étiquettes viennent d'une revue humaine ?
Autres questions pour Ingénieur machine learning
Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.
Prédire mes questions