Pergunta de entrevista para Engenheiro de Confiabilidade de Sites

O que é um orçamento de erro, e o que um time deveria de fato fazer quando ele acaba?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Um orçamento de erro é a falta de confiabilidade que o seu SLO permite. Se o SLO é 99.9% ao longo de 28 dias, o orçamento é 0.1% das requisições, mais ou menos 40 minutos de indisponibilidade total. Times gastam isso em lançamentos arriscados, migrações e experimentos. Quando ele acaba, a política escrita normalmente congela releases de funcionalidade e redireciona o time para trabalho de confiabilidade até o orçamento se recuperar na janela móvel.

Por que os entrevistadores perguntam isso

Isso separa quem leu o livro de SRE de quem viveu aquilo. O entrevistador está checando se você trata o orçamento como ferramenta de decisão com uma política atrelada, em vez de um dashboard que ninguém lê. Eles também querem ouvir como você lida com o lado político, porque um congelamento de release só funciona se a liderança concordou com ele de antemão e o caminho de exceção está definido.

Como estruturar sua resposta

  • Derive o orçamento aritmeticamente do SLO para ele ficar concreto.
  • Diga o que gasta o orçamento: lançamentos, incidentes, migrações, dependências.
  • Descreva a política escrita que dispara quando ele chega a zero.
  • Mencione alertas de burn rate como o aviso antecipado, não o postmortem.
  • Nomeie o caminho de exceção e quem aprova.

Exemplo de resposta

Exemplo falado, em primeira pessoa

O orçamento é só o inverso do SLO. Com 99.9% em 28 dias a gente tinha uns 40 minutos de equivalente a queda total para gastar, e gastávamos deliberadamente em coisas como uma migração de banco ou um rollout arriscado. A parte importante é a política, não o número. A nossa dizia que se queimássemos mais da metade do orçamento no meio da janela, os canários ficavam mais lentos e toda mudança precisava de um segundo revisor, e se chegássemos a zero, releases de funcionalidade paravam e o time trabalhava confiabilidade até a janela móvel se curar. Isso foi aprovado pelo diretor de produto antes de a gente precisar, que é o único motivo de ter se sustentado na primeira vez que invocamos. A gente também rodava alertas de burn rate em múltiplas janelas, um rápido para queima de 14x em uma hora e um lento para queima de 6x em seis horas, então descobríamos durante o incidente em vez de no fim do mês.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Quem pode passar por cima de um congelamento de release, e o que isso custa ao time?
  • Como você configuraria alertas de burn rate em múltiplas janelas sobre um SLO de 28 dias?
  • E se o orçamento for destruído por uma queda do provedor de nuvem que você não controla?

Mais perguntas para Engenheiro de Confiabilidade de Sites

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot