Rode multi zona de disponibilidade, então existe um standby síncrono em outra zona e o failover é automático, normalmente em um ou dois minutos. Réplicas de leitura são para escalar leitura, não para disponibilidade, porque a replicação é assíncrona e pode atrasar. Sustente isso com backups automatizados e recuperação para um ponto no tempo, conecte pelo endpoint do cluster ou por um proxy para o failover ser tratado, e teste o failover de verdade em vez de confiar nele.
Por que os entrevistadores perguntam isso
O entrevistador quer a distinção entre disponibilidade e durabilidade e o mal-entendido muito comum de que uma réplica de leitura é um alvo de failover. Ele também procura o que acontece com a aplicação durante o failover, já que cache de DNS e pools de conexão causam quedas que duram mais que o evento do banco em si. Testar o failover de propósito é a resposta que marca experiência operacional real.
Como estruturar sua resposta
- Separe disponibilidade, durabilidade e escala de leitura logo de cara.
- Descreva o standby síncrono e o failover automático.
- Explique o que a aplicação precisa fazer durante o failover.
- Cubra backups, teste de recuperação e cópias entre regiões.
Exemplo de resposta
Multi zona de disponibilidade é o coração disso: um standby síncrono em uma segunda zona, e o serviço gerenciado o promove se o primário falhar, normalmente dentro de um ou dois minutos. A distinção que eu sempre deixo explícita é que uma réplica de leitura não é um alvo de failover, ela é assíncrona, então promover uma pode significar perder escritas recentes; ela existe para escala de leitura. Durabilidade é outra coisa ainda, então backups automatizados mais recuperação para um ponto no tempo, e eu copio isso para outra região, porque um banco altamente disponível que só existe em uma região continua a um dia ruim de sumir. A parte que as pessoas esquecem é a aplicação. O failover muda para qual host o endpoint aponta, então um pool de conexões segurando conexões velhas ou um runtime cacheando DNS para sempre vai continuar falhando depois de o banco já estar saudável. Então eu conecto pelo endpoint do cluster ou por um proxy, configuro validação de pool sensata e garanto que os retries sejam seguros. E eu testo, disparando um failover em um ambiente inferior e cronometrando quanto a aplicação leva para se recuperar, porque esse número é sempre pior que o anunciado.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Qual é o seu objetivo de ponto de recuperação com replicação assíncrona?
- Como você lida com tempestades de conexão depois de um failover?
- Quando você promoveria uma réplica de leitura em outra região?
Mais perguntas para Engenheiro de Nuvem
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas