Pergunta de entrevista para Engenheiro de Confiabilidade de Sites

Por que a gente alerta em latência p99 em vez de latência média?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Médias escondem a cauda. Um serviço pode ter média de 80ms enquanto uma requisição em cada cem leva quatro segundos, e essas requisições lentas normalmente caem nos seus usuários mais pesados. Um percentil descreve a distribuição real, então o p99 te diz o que os seus usuários pior atendidos de fato experimentam. Uma ressalva: percentis não podem ser tirados na média entre hosts, então agregue a partir de histogramas em vez de tirar média dos valores por host.

Por que os entrevistadores perguntam isso

Isso é uma checagem de letramento estatístico fantasiada de pergunta de ops. Bastante gente sabe dizer que latência de cauda importa e depois propõe tirar a média do p99 de dez instâncias, o que é matematicamente sem sentido. Entrevistadores também querem ouvir que uma única requisição de usuário muitas vezes se abre em muitas chamadas de backend, então uma chamada lenta rara vira uma página lenta comum.

Como estruturar sua resposta

  • Comece pelo fato de que médias escondem a distribuição.
  • Dê um exemplo concreto em que a média parece saudável e os usuários sofrem.
  • Explique o fan out: muitas chamadas de backend por ação do usuário amplificam a cauda.
  • Acrescente a ressalva de agregação sobre histogramas versus média de percentis.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Porque a média é o único número garantidamente incapaz de descrever alguém. A gente tinha um endpoint com média em torno de 90ms e um fluxo constante de reclamações, e o p99 estava pouco acima de três segundos, tudo isso de clientes com contas grandes batendo num caminho de query sem índice. A média nunca se mexia porque esses usuários eram 1% do tráfego. Também existe um efeito de fan out. Se uma única página faz trinta chamadas de backend, uma chamada lenta em cada cem significa que uma parcela relevante dos carregamentos é lenta, então latência de cauda no nível do serviço vira latência típica no nível do usuário. O que eu sinalizaria é a agregação. Você não consegue tirar média do p99 entre instâncias e obter um p99 real. A gente exportava histogramas do Prometheus e calculava o quantil sobre o conjunto todo com histogram_quantile, o que também nos deixava fatiar por endpoint e por tier de cliente sem recalcular nada.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Como você calcularia um p99 preciso entre cinquenta instâncias?
  • Quando o p50 é mais útil que o p99?
  • Como você lida com requisições que dão timeout e nunca registram latência?

Mais perguntas para Engenheiro de Confiabilidade de Sites

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot