Question d'entretien pour Ingénieur logiciel

Un service qui allait bien hier a maintenant une latence p99 de quatre secondes. Comment le déboguez-vous ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Délimitez d'abord : tous les endpoints ou un seul, tous les utilisateurs ou un seul locataire, et à quel moment exact ça a commencé. Alignez cet horodatage sur les déploiements, les bascules de flags et les changements de trafic. Ensuite descendez avec la télémétrie que vous avez déjà : les traces pour trouver le span qui a grossi, les logs de requêtes lentes de la base, la saturation du pool de connexions, le CPU et la mémoire des machines. Atténuez d'abord, que ce soit un retour arrière ou du délestage, et cherchez la cause racine ensuite.

Pourquoi les recruteurs posent cette question

Déboguer sous pression, c'est l'essentiel de l'ingénierie senior, et le recruteur veut une méthode plutôt que des devinettes. Il écoute des questions de délimitation avant les hypothèses, l'usage d'une télémétrie que vous devriez déjà avoir en place, la corrélation avec les changements, et le jugement d'atténuer avant d'enquêter. Les candidats qui se mettent immédiatement à deviner des causes ont tendance à faire pareil pendant un vrai incident.

Comment structurer votre réponse

  • Délimitez le problème avant de former une théorie.
  • Corrélez l'heure de départ avec les déploiements et le trafic.
  • Suivez la trace jusqu'au span le plus lent.
  • Atténuez d'abord, puis poursuivez la cause racine.

Exemple de réponse

Exemple parlé, à la première personne

D'abord je veux des bornes, parce qu'elles réduisent vite l'espace de recherche. Est-ce un endpoint ou tous, une région, un locataire, et à quelle heure ça a commencé ? Ensuite j'aligne cet horodatage sur les déploiements, les bascules de feature flags et les changements de configuration, parce que la plupart du temps quelque chose a changé et la réponse est juste là. Si rien n'a changé de notre côté, je vais aux traces et je trouve quel span a grossi, ce qui me dit immédiatement si c'est nous, la base ou un appel en aval. La base est le suspect habituel : une requête qui allait bien à un million de lignes cesse d'aller bien à dix millions, ou un index manque, ou le pool est saturé et le temps est passé à attendre une connexion plutôt qu'à exécuter la requête. Ce dernier cas est sournois parce que chaque requête a encore l'air rapide isolément. Et pendant que je fais tout ça, s'il y a une atténuation évidente comme revenir sur le dernier déploiement, je la prends d'abord. Les clients se soucient de la latence, pas de mon explication.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Et si les traces montrent que le temps est passé à attendre une connexion ?
  • Comment distinguez-vous une requête lente d'une contention de verrous ?
  • Qu'ajouteriez-vous pour que ce soit plus rapide à diagnostiquer la prochaine fois ?

Autres questions pour Ingénieur logiciel

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot