Delimite primeiro: todo endpoint ou um, todos os usuários ou um tenant, e exatamente quando começou. Alinhe esse timestamp com deploys, viradas de flag e mudanças de tráfego. Depois desça com a telemetria que você já tem: traces para achar o span que cresceu, logs de query lenta do banco, saturação de pool de conexões, CPU e memória do host. Mitigue primeiro, seja um rollback ou descarte de carga, e ache a causa raiz depois.
Por que os entrevistadores perguntam isso
Depurar sob pressão é a maior parte da engenharia sênior, e o entrevistador quer método em vez de chutes. Eles escutam por perguntas de delimitação antes de hipóteses, por uso da telemetria que você já deveria ter no lugar, por correlação com mudanças, e pelo discernimento de mitigar antes de investigar. Candidatos que já começam chutando causas tendem a fazer o mesmo num incidente real.
Como estruturar sua resposta
- Delimite o problema antes de formar uma teoria.
- Correlacione o horário de início com deploys e tráfego.
- Siga o trace até o span mais lento.
- Mitigue primeiro, depois persiga a causa raiz.
Exemplo de resposta
Primeiro eu quero fronteiras, porque elas cortam o espaço de busca rápido. É um endpoint ou todos, uma região, um tenant, e a que horas começou? Depois eu alinho esse timestamp com deploys, viradas de feature flag e mudanças de configuração, porque na maior parte do tempo alguma coisa mudou e a resposta está bem ali. Se nada mudou do nosso lado, eu vou para os traces e acho qual span cresceu, o que imediatamente me diz se somos nós, o banco ou uma chamada downstream. O banco é o suspeito de sempre: uma query que estava bem com um milhão de linhas para de estar bem com dez milhões, ou falta um índice, ou o pool está saturado e o tempo é gasto esperando uma conexão em vez de rodando a query. Essa última é traiçoeira porque toda query continua parecendo rápida isolada. E enquanto eu faço tudo isso, se existe uma mitigação óbvia como fazer rollback do último deploy, eu pego ela primeiro. Os clientes se importam com a latência, não com a minha explicação.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- E se os traces mostrarem que o tempo é gasto esperando uma conexão?
- Como você distinguiria uma query lenta de contenção de lock?
- O que você adicionaria para isso ser mais rápido de diagnosticar da próxima vez?
Mais perguntas para Engenheiro de Software
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas