Suba no escuro primeiro: rode em modo shadow ao lado do vigente, pontuando tráfego real sem agir sobre a saída, e compare distribuições de score, latência e disponibilidade de features. Se isso parecer sensato, vá para um canário com percentual pequeno e um experimento online na métrica de negócio, mais guardrails. Mantenha a versão antiga carregada para que rollback seja mudança de configuração, não redeploy.
Por que os entrevistadores perguntam isso
Melhora offline não se traduz de forma confiável em melhora online, e entrevistadores querem ouvir que você sabe disso. Deploy em shadow é a prática específica que eles esperam, seguida de um teste online real em vez de confiar em métricas offline. Citar que o rollback deve ser instantâneo, e que métricas de guardrail importam tanto quanto a métrica alvo, mostra maturidade operacional.
Como estruturar sua resposta
- Comece com modo shadow e o que você compara durante ele.
- Passe para um canário pequeno com um experimento online real.
- Cite métricas de guardrail ao lado da métrica alvo.
- Faça do rollback uma troca de configuração e defina o gatilho de antemão.
Exemplo de resposta
Melhor offline não significa melhor online, então eu nunca promovo direto a partir de um número de validação. O primeiro passo é modo shadow: o novo modelo pontua as mesmas requisições ao vivo, a gente loga a saída dele, e nada age sobre ela. Isso pega as coisas chatas mas fatais, diferenças de disponibilidade de feature, regressões de latência, nulos inesperados, e me deixa comparar as duas distribuições de score no mesmo tráfego. Se os scores do novo modelo estão deslocados, limiares lá na frente precisam se mover mesmo que a qualidade do ranking tenha melhorado, e é bem melhor descobrir isso em shadow do que em produção. Depois um canário em alguns por cento com um experimento online decente na métrica de negócio, não na AUC. Junto eu defino guardrails de antemão: latência p99, taxa de erro, e algo que pegue o modelo estando confiantemente errado de um jeito que a métrica principal não perceberia, como um salto grande na taxa de sinalização. O rollback tem que ser uma mudança de configuração com a versão antiga ainda carregada, para levar segundos, e eu escrevo os números que o disparam antes do lançamento, porque decidir se uma métrica está ruim o bastante enquanto ela cai é um péssimo momento para formar opinião.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- O que você compararia entre as distribuições de score do shadow e do ao vivo?
- Por quanto tempo você rodaria o canário, e o que determina isso?
- Como você lida com um modelo cuja métrica de negócio leva semanas para se mover?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas