La batch norm normalise chaque caractéristique à travers le lot, donc ses statistiques dépendent de la composition du lot et du padding des séquences, et elle se comporte différemment à l'inférence où elle utilise des moyennes glissantes. La layer norm normalise à travers les caractéristiques d'un seul token, indépendamment du lot et de la longueur de séquence, ce qui la rend stable pour des séquences de longueur variable, de petits lots et le décodage autorégressif.
Pourquoi les recruteurs posent cette question
Cela distingue ceux qui savent quelle couche utiliser de ceux qui savent pourquoi. Le recruteur sonde si vous comprenez sur quel axe chaque normalisation opère et les conséquences pratiques : dépendance au lot à l'inférence, problèmes avec le padding et les petits lots, et l'écart entre entraînement et test. Mentionner le placement pre-norm ou post-norm et RMSNorm est un vrai bonus.
Comment structurer votre réponse
- Dites sur quel axe chacune normalise.
- Expliquez pourquoi les statistiques de lot cassent pour des séquences de longueur variable.
- Notez l'écart entre entraînement et inférence dans la batch norm.
- Mentionnez le placement pre-norm et RMSNorm comme choix par défaut moderne.
Exemple de réponse
Elles normalisent sur des axes différents. La batch norm prend une seule caractéristique et la normalise sur tous les exemples du lot. La layer norm prend un seul exemple, ou un seul token, et normalise sur ses caractéristiques. Cette différence décide de tout le reste. Avec du texte vous avez des séquences de longueur variable et du padding, donc les statistiques de lot sont polluées par les tokens de remplissage et se déplacent selon ce qui s'est trouvé regroupé. La batch norm porte aussi l'écart entre entraînement et inférence, où vous entraînez sur des statistiques de lot et servez sur des moyennes glissantes, et pendant le décodage autorégressif vous générez souvent un token à la fois avec un lot de taille un, où les statistiques de lot n'ont aucun sens. La layer norm n'a aucune dépendance au lot, donc entraînement et inférence sont identiques et la taille de lot n'a pas d'importance. Sur le placement, les transformeurs modernes mettent la normalisation avant la sous-couche plutôt qu'après, parce que le pre-norm garde le chemin résiduel propre et permet d'entraîner des piles profondes sans schedule de warmup délicat. La plupart des modèles actuels sont aussi passés à RMSNorm, qui abandonne le centrage de la moyenne et se contente de remettre à l'échelle, parce que c'est moins coûteux et que ça marche à peu près aussi bien.
Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.
Voir comment ça marcheQuestions de relance à prévoir
- Qu'est-ce qui casse si vous utilisez la batch norm avec une taille de lot de un ?
- Pourquoi le pre-norm s'entraîne-t-il plus stablement que le post-norm ?
- Qu'abandonne RMSNorm, et pourquoi cela s'avère-t-il sans conséquence ?
Autres questions pour Ingénieur machine learning
Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.
Prédire mes questions