Pergunta de entrevista para Engenheiro de Confiabilidade de Sites

A latência p99 da sua API principal triplica vinte minutos depois de um deploy. Me explique o que você faz.

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Estabilize antes de investigar: se o horário bate com o deploy, faça rollback ou pare o rollout primeiro. Depois compare a versão antiga e a nova nos mesmos dashboards, cheque taxa de erro e saturação junto com a latência, e estabeleça se o pico é uniforme ou isolado a um endpoint, um shard ou uma zona. Traces mostram qual salto cresceu. Análise de causa raiz acontece depois que os usuários estão seguros.

Por que os entrevistadores perguntam isso

Essa é a simulação central de SRE, e entrevistadores se importam muito mais com a sua ordem do que com a sua hipótese. Eles querem mitigação antes de diagnóstico, evidência coletada de cima para baixo, e checagens explícitas contra a suposição de que o deploy é a causa. Silêncio sobre comunicação e papéis de incidente é uma lacuna comum.

Como estruturar sua resposta

  • Mitigue primeiro: faça rollback ou pause o rollout, e então declare o incidente.
  • Confirme o impacto contra o SLO para a severidade ficar fundamentada em números.
  • Estreite o raio de impacto: qual endpoint, versão, shard ou zona.
  • Use traces para achar o salto que cresceu, e correlacione com o diff.
  • Verifique a recuperação com o SLI voltado ao usuário antes de encerrar.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Primeira coisa, eu estanco o sangramento. Se um deploy saiu vinte minutos atrás e a latência triplicou, isso é rollback até que se prove o contrário, e eu fico feliz de estar errado sobre a causa enquanto os usuários estão bem. Em paralelo eu declaro um incidente para que alguém seja dono da comunicação, porque os piores incidentes em que eu estive foram aqueles em que as mesmas três pessoas estavam depurando e respondendo perguntas em cinco canais. Depois eu checo se é uniforme. É todo endpoint ou um só? Todos os pods ou só o ReplicaSet novo? Uma zona de disponibilidade? Isso normalmente colapsa o espaço de busca na hora. Daí eu puxo um trace exemplar de uma requisição lenta e olho para onde o tempo foi de fato. A gente teve um desses em que o build novo adicionou uma chamada de log inofensiva dentro de um loop que fazia uma consulta de DNS por iteração, então a árvore de spans deixou óbvio em segundos. Depois do rollback eu confirmo que o p99 voltou abaixo do SLO antes de fechar qualquer coisa.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • E se o rollback não for possível por causa de uma migração de schema?
  • Como você distinguiria um pico induzido por deploy de uma mudança orgânica de tráfego?
  • O que você checaria se só uma zona de disponibilidade estivesse afetada?

Mais perguntas para Engenheiro de Confiabilidade de Sites

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot