Confirme o escopo da degradação e se o failover é genuinamente mais rápido que esperar, porque failover não é de graça e quedas parciais às vezes se recuperam antes. Consiga uma decisão explícita de um dono, e então siga o runbook: promova a réplica aceitando a perda de dados conhecida, mova o tráfego na camada de DNS ou de roteamento, verifique com requisições reais e comunique. Planeje o retorno deliberadamente depois, quando a primária estiver estável.
Por que os entrevistadores perguntam isso
Isso testa tomada de decisão e não mecânica. O entrevistador quer ouvir que failover é um julgamento com um custo, que alguém precisa ser dono da decisão, e que você conhece a implicação de perda de dados de promover uma réplica assíncrona. Ele também escuta sobre o retorno, que os times esquecem rotineiramente, e sobre a possibilidade de o control plane do provedor de que você precisa estar degradado também.
Como estruturar sua resposta
- Avalie o escopo e decida se o failover ganha de esperar.
- Nomeie o dono da decisão e a perda de dados que você está aceitando.
- Execute os passos do runbook em ordem, verificando conforme avança.
- Comunique e depois planeje o retorno como um evento controlado próprio.
Exemplo de resposta
A primeira coisa é que fazer failover é uma decisão, não um reflexo. Eu quero saber o escopo, se é um serviço ou a região inteira, e o que o provedor está dizendo, porque se a estimativa é quinze minutos então um failover que leva trinta e perde dados é a pior opção. Então eu levo essa avaliação ao comandante do incidente ou ao dono do negócio e ele toma a decisão explicitamente, porque ninguém deveria estar aceitando perda de dados unilateralmente às três da manhã. Feita a decisão, eu sigo o runbook em vez de improvisar. Promovo a réplica na região secundária, sabendo que a gente está aceitando o atraso de replicação que existia no momento da falha, e eu anoto esse número para a conciliação depois. Movo o tráfego na camada de roteamento, e aqui eu confiro se os health checks e os tempos de vida dos registros são curtos o bastante para mover rápido, porque um registro cacheado por muito tempo faz isso demorar muito mais do que o esperado. Depois verifico com requisições reais em vez de com um dashboard. E o retorno é uma mudança planejada própria em horário comercial, nunca um segundo failover às pressas.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você concilia escritas que foram perdidas no failover?
- E se o control plane de roteamento também for afetado pela queda?
- Como você decide quando é seguro voltar para a região primária?
Mais perguntas para Engenheiro de Nuvem
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas