Question d'entretien pour Ingénieur machine learning

Vous doublez la taille de lot sur un entraînement. Que faites-vous du taux d'apprentissage, et pourquoi ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Augmentez le taux d'apprentissage, à peu près linéairement avec la taille de lot pour des hausses modérées, ou en racine carrée selon certaines analyses. Un lot plus grand donne une estimation du gradient à variance plus faible, donc vous pouvez vous permettre un pas plus grand. En pratique il vous faut aussi du warmup, puisque la règle linéaire s'effondre en début d'entraînement, et les très grands lots finissent par ne plus améliorer la généralisation.

Pourquoi les recruteurs posent cette question

C'est une vérification rapide de savoir si vous avez vraiment entraîné des modèles à l'échelle ou seulement suivi des tutoriels. Le recruteur veut le raisonnement sur la variance du gradient plutôt qu'une règle apprise par cœur, plus la conscience que la mise à l'échelle linéaire a des limites et exige du warmup. Les candidats qui disent que rien ne change révèlent qu'ils n'ont jamais vu un entraînement diverger après un passage sur un GPU plus gros.

Comment structurer votre réponse

  • Énoncez d'emblée la règle de mise à l'échelle linéaire.
  • Justifiez-la par la variance du gradient, pas seulement par la convention.
  • Ajoutez le warmup comme exigence pratique.
  • Dites où la règle s'effondre et ce que vous surveillez.

Exemple de réponse

Exemple parlé, à la première personne

Par défaut, mise à l'échelle linéaire : lot doublé, taux d'apprentissage doublé. La logique, c'est que le gradient calculé sur un lot est une estimation du vrai gradient, et que sa variance baisse avec la taille de lot, donc un lot plus grand vous donne une direction plus fiable et vous pouvez faire un pas proportionnellement plus grand dans cette direction. Ce que les gens sautent, c'est le warmup. Tout au début, les poids sont aléatoires et la surface de perte n'est pas accueillante, donc un grand taux d'apprentissage appliqué juste après un saut de taille de lot fera exploser l'entraînement dans les premières centaines de pas. Donc je monte linéairement de presque zéro jusqu'à la cible sur une fenêtre de warmup, puis je décrois. Au-delà d'une certaine taille de lot la règle ne paie plus, à la fois parce que l'estimation du gradient est déjà à faible variance donc vous ne gagnez rien, et parce que vous faites beaucoup moins de pas d'optimiseur par epoch, ce qui semble nuire à la généralisation. J'ai touché ce plafond autour de quelques milliers d'échantillons par lot sur les modèles que j'ai traités. Donc ma routine après tout changement de taille de lot, c'est mettre à l'échelle, faire le warmup, puis surveiller la courbe de perte sur les mille premiers pas plutôt que de partir.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Quelle durée de warmup utiliseriez-vous, et qu'est-ce qui la détermine ?
  • Qu'est-ce que l'accumulation de gradient et quand remplace-t-elle un lot plus grand ?
  • Pourquoi un très grand lot peut-il nuire à l'exactitude finale en validation ?

Autres questions pour Ingénieur machine learning

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot