Latência, tráfego, erros e saturação. Latência é quanto tempo as requisições levam, separada entre chamadas bem sucedidas e falhas. Tráfego é demanda, como requisições por segundo. Erros é a taxa de requisições que falham, incluindo as que retornam 200 com um corpo quebrado. Saturação é o quão cheio está o seu recurso mais restrito. Instrumente erros e latência primeiro, porque eles mapeiam direto na dor do usuário.
Por que os entrevistadores perguntam isso
É um filtro rápido para saber se você tem um modelo mental de observabilidade ou só uma lista de ferramentas. O desdobramento importa mais do que a memorização: entrevistadores querem ouvir que você separa latência por sucesso e falha (senão falhas rápidas embelezam os seus números), que saturação é sobre o recurso restrito e não um gráfico genérico de CPU, e que você começa pelos sinais que o usuário sente.
Como estruturar sua resposta
- Liste os quatro de forma direta antes de detalhar qualquer um deles.
- Acrescente a nuance de que a latência das requisições que falham precisa ser separada.
- Diga qual recurso você trataria como sinal de saturação e por quê.
- Priorize erros e latência num serviço novo e justifique a ordem.
Exemplo de resposta
Latência, tráfego, erros, saturação. Num serviço novo eu ligaria erros e latência primeiro, porque são os dois que um usuário consegue sentir, e eu garantiria que os histogramas de latência sejam separados por desfecho. Isso nos pegou uma vez: o nosso p99 melhorou depois de um deploy ruim, e era só porque uma fatia das requisições estava falhando em 12ms em vez de ter sucesso em 800ms. Tráfego entra em seguida, principalmente porque dá contexto a todos os outros sinais, e permite notar uma queda a zero, que é o alerta que as pessoas esquecem de escrever. Saturação é a que exige pensar de verdade. Numa API sem estado normalmente era o nosso pool de conexões do banco e não a CPU, então a gente exportava tempo de espera do pool e conexões em uso. CPU genérica de nó nunca nos disse nada útil. Uma vez que esses quatro estão de pé, todo o resto é refinamento em vez de um dashboard novo.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você definiria saturação para um worker baseado em fila?
- Em qual dos quatro você alertaria, e quais ficam só no dashboard?
- Como você pega uma requisição que retorna 200 mas é funcionalmente um erro?
Mais perguntas para Engenheiro de Confiabilidade de Sites
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas