Commencez par prouver que le modèle peut apprendre : surapprenez un seul petit lot jusqu'à une perte quasi nulle. S'il n'y arrive pas, le bug est dans le modèle, la perte ou l'optimiseur, pas dans le volume de données. Ensuite vérifiez le taux d'apprentissage aux deux extrêmes, contrôlez que les étiquettes sont alignées avec les entrées, confirmez que les gradients circulent, et confirmez que l'optimiseur a bien reçu les paramètres que vous croyez.
Pourquoi les recruteurs posent cette question
C'est l'échec pratique le plus courant en apprentissage profond, et la réponse révèle si vous déboguez systématiquement ou si vous commencez à tripoter des hyperparamètres. Surapprendre un seul lot est le premier geste canonique parce qu'il isole la capacité des données, et les recruteurs l'attendent explicitement. Vérifier les normes de gradient et l'alignement des étiquettes montre que vous savez où se cachent vraiment les bugs.
Comment structurer votre réponse
- Commencez par le test de surapprentissage sur un seul lot pour isoler le problème.
- Vérifiez le taux d'apprentissage aux deux extrêmes.
- Vérifiez que les gradients circulent et que les paramètres sont enregistrés auprès de l'optimiseur.
- Vérifiez le chemin des données : alignement des étiquettes, normalisation, mélange.
Exemple de réponse
Le premier geste est toujours le même : prendre un lot d'environ huit exemples et essayer d'y amener la perte quasiment à zéro. Un modèle qui fonctionne mémorise huit exemples en deux cents pas. S'il n'y arrive pas, le problème n'est ni la quantité de données ni la régularisation, c'est quelque chose de cassé dans le modèle, la perte ou l'optimiseur, et j'ai massivement réduit l'espace de recherche. Ensuite je vérifie le taux d'apprentissage aux deux bouts, parce que trop haut se manifeste par une perte qui rebondit ou part en NaN, et trop bas ressemble à une ligne plate qui avance en réalité au ralenti. J'affiche les normes de gradient par couche, ce qui me dit immédiatement si le signal meurt ou si une couche ne reçoit rien parce qu'elle a été gelée par accident ou jamais passée à l'optimiseur. Puis le chemin des données, et honnêtement c'est là qu'est le bug en général : des étiquettes décalées d'un cran par rapport aux entrées après un mélange, une normalisation appliquée deux fois, ou un tenseur de cibles qui ne contient qu'une seule classe à cause d'un bug de filtrage. Je regarde toujours à l'œil une poignée d'exemples décodés avec leurs étiquettes avant d'accuser l'architecture.
Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.
Voir comment ça marcheQuestions de relance à prévoir
- Que suggérerait une perte qui part en NaN après quelques centaines de pas ?
- Comment vérifieriez-vous que votre chargeur de données mélange correctement ?
- Que signifie une perte d'entraînement qui baisse alors que la perte de validation ne baisse jamais ?
Autres questions pour Ingénieur machine learning
Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.
Prédire mes questions