Faça teste de carga contra o gargalo real, não contra a camada web. Derive a capacidade por componente a partir do tráfego atual e da folga, e então examine o que não escala horizontalmente: throughput de escrita do banco, limites de conexão, rate limits de terceiros e cotas de nuvem. Escale de forma antecipada em vez de confiar que o autoscaling vai reagir a tempo, aumente cotas com antecedência, prepare um plano de descarte e degradação, e escale gente de plantão para a janela.
Por que os entrevistadores perguntam isso
Trabalho de capacidade expõe se você pensa em sistemas ou em servidores. Entrevistadores querem ouvir que você acha o recurso restrito, que você sabe que autoscaling tem tempo de reação e teto de cota, e que você planeja degradação graciosa. Mencionar que você validaria o número e o formato do marketing (um pico, não um platô) é um sinal forte.
Como estruturar sua resposta
- Esclareça o formato do tráfego: pico, duração e composição.
- Modele a folga por componente a partir da utilização atual.
- Faça teste de carga para achar o gargalo real, normalmente com estado.
- Escale de forma antecipada e aumente cotas e limites antes da janela.
- Prepare o plano de degradação e coloque gente para acompanhar o evento.
Exemplo de resposta
Primeiro eu cravaria o que dez vezes significa, porque dez vezes ao longo de um dia é um problema diferente de dez vezes nos primeiros quatro minutos de um disparo de email, e campanhas são quase sempre o segundo caso. Depois eu modelo cada camada a partir do uso atual: se rodamos a 30% de CPU no pico de hoje, a camada sem estado é fácil, mas as partes interessantes são as que não escalam adicionando pods. Para a gente eram throughput de escrita do Postgres e um provedor de pagamento que tinha um rate limit do qual a gente nunca tinha chegado perto, e que exigiu uma ligação e uma semana de antecedência. Eu rodaria um teste de carga que bate no caminho real, não num health check sintético, e eu escalaria de forma antecipada em vez de contar com o autoscaler, porque um cold start de noventa segundos é uma eternidade num pico. Por fim, um plano de degradação escrito: o que a gente desliga primeiro, quem pode acionar, e um canal compartilhado com o marketing para o disparo poder ser pausado.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- O que você desligaria primeiro se tivesse que degradar durante o pico?
- Como você faria teste de carga sem afetar os usuários de produção?
- Que cotas de nuvem você checaria antes de um evento desses?
Mais perguntas para Engenheiro de Confiabilidade de Sites
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas