Percorra a diferença em ordem: confirme que a métrica de produção é calculada do mesmo jeito, cheque desvio entre treino e serving, depois cheque vazamento na montagem offline e então cheque mudança de distribuição. Desvio e vazamento são muito mais comuns do que drift genuíno nas primeiras semanas depois do lançamento. Registre os vetores de features servidos e recalcule os scores offline para isolar onde os números divergem.
Por que os entrevistadores perguntam isso
Essa é a coisa mais realista que um cientista de dados faz, e o entrevistador quer um processo ordenado em vez de uma lista de causas possíveis. O sinal está na sequência: descarte medição e encanamento antes de recorrer a concept drift, porque gente nova quase sempre culpa o drift primeiro. Registrar as features servidas para reproduzir o score offline é o detalhe que prova que você já colocou algo em produção.
Como estruturar sua resposta
- Confirme primeiro que as duas métricas medem a mesma coisa.
- Cheque desvio entre treino e serving recalculando os vetores de features registrados.
- Depois procure vazamento no pipeline offline.
- Só então teste mudança de distribuição e concept drift.
- Diga o que você faria enquanto isso para limitar o estrago.
Exemplo de resposta
Primeiro eu checo se estou comparando coisas equivalentes. A AUC offline muitas vezes é calculada em um snapshot rotulado com uma população diferente e um atraso de rótulo diferente do de produção, e metade das vezes a diferença é em parte isso. Em seguida eu procuro desvio entre treino e serving, que na minha experiência é a causa mais comum. Eu registro os vetores de features que o serviço realmente usou, recalculo os scores com o modelo offline e comparo com o que a produção emitiu. Se eles diferem, o bug está no pipeline de serving, não no modelo, e normalmente é algo sem graça, como uma categoria mapeando para desconhecido ou uma diferença de fuso horário deslocando uma janela móvel. Se os scores batem, eu suspeito de vazamento offline, ou seja, alguma feature foi calculada depois de o rótulo ser conhecido. O sinal é uma feature com importância implausivelmente alta. Só então eu testo drift, comparando distribuições de features e a taxa base entre o treino e agora. Enquanto isso eu não deixaria sangrando: volto para o modelo anterior ou para uma baseline de regras na fatia afetada, e aviso os stakeholders de que o número se moveu antes que eles descubram sozinhos.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você monitoraria isso automaticamente em vez de descobrir tarde?
- Qual estatística você usaria para detectar drift de features?
- Como você lida com um modelo cujos rótulos só chegam sessenta dias depois?
Mais perguntas para Cientista de Dados
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas