Question d'entretien pour Ingénieur SRE

Votre base de données principale bascule à 3h du matin et les écritures se mettent à échouer. Quels sont vos premiers gestes ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

Confirmez que la nouvelle primaire est bien promue et accepte les écritures, puis vérifiez si les applications se sont reconnectées. Des pools de connexions périmés et un DNS en cache sont la raison habituelle pour laquelle les erreurs continuent après une bascule pourtant saine. Vérifiez le retard de réplication et si des écritures validées ont été perdues au regard de votre RPO. Rétablissez le trafic d'écriture, écartez le split brain en vous assurant que l'ancienne primaire est fencée, puis gardez pour le post mortem la question de savoir pourquoi la bascule n'a pas été transparente.

Pourquoi les recruteurs posent cette question

Les recruteurs veulent voir que vous ne vous arrêtez pas à la base a l'air d'aller bien. La couche applicative est là où vivent réellement la plupart des incidents de bascule, à travers des pools qui gardent des sockets morts, des TTL DNS, et des drivers qui ne résolvent jamais à nouveau. Ils vérifient aussi si vous pensez à la perte de données et au fencing, et pas seulement à la disponibilité.

Comment structurer votre réponse

  • Vérifiez la promotion et l'acceptation des écritures directement sur la nouvelle primaire.
  • Passez à la couche client : pools, cache DNS, comportement du driver.
  • Quantifiez la perte de données et le retard au regard du RPO annoncé.
  • Fencez l'ancienne primaire pour écarter les doubles écritures.
  • Rétablissez le trafic, puis notez l'écart de transparence pour le post mortem.

Exemple de réponse

Exemple parlé, à la première personne

Étape un, confirmer la réalité : me connecter directement à la nouvelle primaire et vérifier qu'elle est sortie de récupération et accepte les écritures. Si la base est saine et que les applications échouent encore, le problème est de notre côté, et d'expérience c'est en général là qu'il se trouve. Les pools de connexions gardent des sockets vers une adresse qui ne sert plus les écritures, ou la JVM a mis l'entrée DNS en cache pour toujours, donc le correctif est un redémarrage progressif ou un pool avec une vraie validation. On a eu un cas où le driver respectait un TTL de 30 secondes mais où le pool ne revalidait jamais les connexions inactives, donc la reprise a pris vingt minutes de plus qu'elle n'aurait dû. Ensuite je vérifie le retard de réplication au moment de la promotion pour voir si on a perdu des écritures validées, parce que ça change qui je dois prévenir. Je veux aussi la confirmation que l'ancienne primaire est fencée et ne peut pas accepter d'écriture si elle revient. Une fois les écritures rétablies, la question du post mortem est de savoir pourquoi ça n'a pas été automatique.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Comment rendriez-vous la bascule transparente pour l'application la prochaine fois ?
  • Comment détectez-vous que des écritures ont été perdues pendant la promotion ?
  • Quel est le risque d'une bascule automatique, et quand l'éviteriez-vous ?

Autres questions pour Ingénieur SRE

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot