Médias escondem a cauda. Um serviço pode ter média de 80ms enquanto uma requisição em cada cem leva quatro segundos, e essas requisições lentas normalmente caem nos seus usuários mais pesados. Um percentil descreve a distribuição real, então o p99 te diz o que os seus usuários pior atendidos de fato experimentam. Uma ressalva: percentis não podem ser tirados na média entre hosts, então agregue a partir de histogramas em vez de tirar média dos valores por host.
Por que os entrevistadores perguntam isso
Isso é uma checagem de letramento estatístico fantasiada de pergunta de ops. Bastante gente sabe dizer que latência de cauda importa e depois propõe tirar a média do p99 de dez instâncias, o que é matematicamente sem sentido. Entrevistadores também querem ouvir que uma única requisição de usuário muitas vezes se abre em muitas chamadas de backend, então uma chamada lenta rara vira uma página lenta comum.
Como estruturar sua resposta
- Comece pelo fato de que médias escondem a distribuição.
- Dê um exemplo concreto em que a média parece saudável e os usuários sofrem.
- Explique o fan out: muitas chamadas de backend por ação do usuário amplificam a cauda.
- Acrescente a ressalva de agregação sobre histogramas versus média de percentis.
Exemplo de resposta
Porque a média é o único número garantidamente incapaz de descrever alguém. A gente tinha um endpoint com média em torno de 90ms e um fluxo constante de reclamações, e o p99 estava pouco acima de três segundos, tudo isso de clientes com contas grandes batendo num caminho de query sem índice. A média nunca se mexia porque esses usuários eram 1% do tráfego. Também existe um efeito de fan out. Se uma única página faz trinta chamadas de backend, uma chamada lenta em cada cem significa que uma parcela relevante dos carregamentos é lenta, então latência de cauda no nível do serviço vira latência típica no nível do usuário. O que eu sinalizaria é a agregação. Você não consegue tirar média do p99 entre instâncias e obter um p99 real. A gente exportava histogramas do Prometheus e calculava o quantil sobre o conjunto todo com histogram_quantile, o que também nos deixava fatiar por endpoint e por tier de cliente sem recalcular nada.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você calcularia um p99 preciso entre cinquenta instâncias?
- Quando o p50 é mais útil que o p99?
- Como você lida com requisições que dão timeout e nunca registram latência?
Mais perguntas para Engenheiro de Confiabilidade de Sites
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas