Question d'entretien pour Ingénieur machine learning

Expliquez à voix haute comment fonctionne l'auto-attention dans un transformeur, sans rien dessiner.

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Chaque token est projeté en un vecteur de requête, un vecteur de clé et un vecteur de valeur. Vous scorez chaque requête contre chaque clé par un produit scalaire, vous divisez par la racine carrée de la dimension de la tête, vous passez les scores dans un softmax pour obtenir des poids, et vous prenez la somme pondérée des valeurs. Chaque token finit par porter une représentation mélangée à partir des autres tokens qu'il a jugés pertinents. Plusieurs têtes font cela en parallèle avec des projections différentes.

Pourquoi les recruteurs posent cette question

Les transformeurs sont sous presque tout ce qui se livre aujourd'hui, donc les recruteurs attendent une explication mécanique plutôt qu'une analogie sur l'attention comme forme de concentration. Le facteur d'échelle et le softmax sont les détails que les gens oublient, et le coût quadratique en longueur de séquence est la relance vers laquelle ils vous mènent, puisque c'est ce qui contraint la longueur de contexte et le coût de service en pratique.

Comment structurer votre réponse

  • Décrivez en une phrase les projections requête, clé et valeur.
  • Déroulez dans l'ordre le produit scalaire, la mise à l'échelle, le softmax, la somme pondérée.
  • Dites ce qu'apportent plusieurs têtes.
  • Notez le coût quadratique en longueur de séquence et pourquoi cela compte.

Exemple de réponse

Exemple parlé, à la première personne

Chaque embedding de token est multiplié par trois matrices apprises pour produire une requête, une clé et une valeur. La requête est ce que ce token cherche, la clé est ce qu'il annonce, la valeur est ce qu'il transmet s'il est retenu. Vous prenez le produit scalaire de chaque requête avec chaque clé, ce qui donne un score de compatibilité pour chaque paire de positions. Divisez par la racine carrée de la dimension de la tête, sinon les produits scalaires croissent avec la dimensionnalité et poussent le softmax dans une zone où il agit comme un argmax dur avec des gradients qui disparaissent. Le softmax sur la ligne transforme ces scores en poids qui somment à un, puis vous prenez la somme pondérée des vecteurs de valeur. Donc chaque token repart avec un mélange des tokens qui l'intéressaient. Plusieurs têtes exécutent toute cette opération en parallèle avec des projections séparées, donc une tête peut suivre la syntaxe pendant qu'une autre suit la coréférence, et les sorties sont concaténées puis projetées. Le coût qu'il faut nommer, c'est que la matrice de scores est en longueur de séquence au carré, et c'est exactement pour ça que servir de longs contextes coûte cher et que flash attention et le cache KV comptent autant.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Que stocke le cache KV pendant le décodage autorégressif, et pourquoi ?
  • Comment le masquage causal change-t-il le calcul ?
  • À quoi renoncent les variantes d'attention sous-quadratiques ?

Autres questions pour Ingénieur machine learning

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot