Question d'entretien pour Ingénieur SRE

Pourquoi alerte-t-on sur la latence p99 plutôt que sur la latence moyenne ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Les moyennes cachent la queue de distribution. Un service peut afficher 80ms en moyenne pendant qu'une requête sur cent prend quatre secondes, et ces requêtes lentes tombent en général sur vos plus gros utilisateurs. Un centile décrit la vraie distribution, donc le p99 vous dit ce que vivent réellement vos utilisateurs les plus mal servis. Une réserve : on ne peut pas faire la moyenne de centiles entre plusieurs hôtes, il faut les agréger depuis des histogrammes plutôt que de moyenner des valeurs par hôte.

Pourquoi les recruteurs posent cette question

C'est un test de culture statistique déguisé en question d'exploitation. Beaucoup de candidats savent dire que la latence de queue compte, puis proposent de moyenner le p99 sur dix instances, ce qui n'a aucun sens mathématique. Les recruteurs veulent aussi vous entendre dire qu'une seule requête utilisateur se ramifie souvent en de nombreux appels backend, donc un appel lent rare devient une page lente courante.

Comment structurer votre réponse

  • Commencez par le fait que les moyennes dissimulent la distribution.
  • Donnez un exemple concret où la moyenne a l'air saine et où les utilisateurs souffrent.
  • Expliquez la ramification : de nombreux appels backend par action utilisateur amplifient la queue.
  • Ajoutez la réserve d'agrégation : histogrammes plutôt que moyenne de centiles.

Exemple de réponse

Exemple parlé, à la première personne

Parce que la moyenne est le seul chiffre dont on est certain qu'il ne décrit personne. On avait un endpoint à environ 90ms de moyenne et un flot constant de plaintes, et le p99 était juste au-dessus de trois secondes, entièrement des clients avec de gros comptes qui tapaient un chemin de requête non indexé. La moyenne ne bougeait jamais parce que ces utilisateurs représentaient 1% du trafic. Il y a aussi un effet de ramification. Si une seule page fait trente appels backend, un appel lent sur cent veut dire qu'une part significative des chargements de page est lente, donc la latence de queue au niveau service devient la latence typique au niveau utilisateur. Le point que je signalerais, c'est l'agrégation. Vous ne pouvez pas moyenner le p99 entre instances et obtenir un vrai p99. On exportait des histogrammes Prometheus et on calculait le quantile sur l'ensemble avec histogram_quantile, ce qui nous permettait aussi de découper par endpoint et par palier client sans rien recalculer.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Comment calculeriez-vous un p99 exact sur cinquante instances ?
  • Quand le p50 est-il plus utile que le p99 ?
  • Comment gérez-vous les requêtes qui expirent et n'enregistrent jamais de latence ?

Autres questions pour Ingénieur SRE

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot