Métricas te dizem que algo está errado e mais ou menos onde. Logs te dizem o que aconteceu dentro de um processo. Traces te dizem para onde foi o tempo entre serviços numa única requisição. Recorra a um trace quando a latência está alta mas nenhum serviço individual parece doente, ou quando uma requisição atravessa muitos saltos. Métricas são baratas e agregadas, logs são detalhados e caros, traces são amostrados e relacionais.
Por que os entrevistadores perguntam isso
Entrevistadores querem saber se você consegue escolher a ferramenta mais barata que responde a pergunta em vez de sair fazendo grep em terabytes de log por reflexo. Eles também sondam consciência de custo, já que contas de observabilidade muitas vezes rivalizam com contas de computação, e se você entende amostragem: traces normalmente são amostrados, então respondem bem perguntas de onde e mal perguntas de com que frequência.
Como estruturar sua resposta
- Dê o papel de cada um dos três sinais em uma linha.
- Nomeie o sintoma específico que faz de um trace a primeira jogada certa.
- Mencione correlação: trace id e span id carimbados nos logs.
- Feche com os trade offs de custo e de amostragem.
Exemplo de resposta
Eu penso nisso como três perguntas. Métricas respondem se está quebrado e o quão grave, logs respondem o que aconteceu neste processo, e traces respondem para onde foi o tempo na requisição inteira. O momento em que eu recorro a um trace é quando a latência geral subiu mas todo dashboard de serviço individual parece bem, o que quase sempre significa que o tempo está num salto sem dono. Isso aconteceu com a gente com um sidecar de service mesh adicionando retries que a gente não sabia que existiam; o trace deixou óbvio em mais ou menos um minuto, porque dava para ver três spans idênticos aninhados sob uma chamada. A cola prática é colocar trace id e span id em toda linha de log, para você conseguir pular de uma métrica agregada para um trace exemplar lento e daí para as linhas de log exatas daquela requisição. E eu amostraria traces no head com uma taxa baixa, com amostragem no tail para erros e requisições lentas, porque guardar tudo não compensa a conta.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você decidiria uma estratégia de amostragem para traces?
- O que é um exemplar e como ele liga métricas a traces?
- Como você propaga contexto através de uma fila assíncrona?
Mais perguntas para Engenheiro de Confiabilidade de Sites
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas