Primeiro mude a métrica, já que acurácia é inútil a 0.3 por cento: use AUC de precisão e recall, ou recall dado um orçamento fixo de alertas. Depois tente pesos de classe antes de reamostrar, porque ponderar é mais simples e não fabrica linhas. Se você reamostrar, faça isso apenas dentro do fold de treino. Por fim, recalibre as probabilidades, já que ponderação e oversampling distorcem os scores previstos.
Por que os entrevistadores perguntam isso
Desbalanceamento é onde os candidatos partem para o SMOTE por reflexo sem perguntar se ele ajuda. O entrevistador quer ver a ordem: métrica primeiro, depois ponderação simples, e reamostragem só se necessário, sempre dentro do fold. Citar calibração é um sinal forte, porque um modelo reamostrado que devolve 0.9 para algo que acontece um por cento das vezes quebra qualquer cálculo de valor esperado lá na frente.
Como estruturar sua resposta
- Ajuste a métrica de avaliação antes de tocar nos dados.
- Recorra a pesos de classe antes de oversampling sintético.
- Enfatize que qualquer reamostragem acontece só dentro do fold de treino.
- Cite a recalibração das probabilidades depois.
Exemplo de resposta
A primeira coisa que eu mudo é o placar, porque um modelo que prevê nenhuma fraude sempre acerta 99.7 por cento e é completamente inútil. Eu uso AUC de precisão e recall e, mais útil ainda, recall no volume de alertas que o time consegue de fato revisar. Depois eu começo simples, com pesos de classe na função de perda, o que não custa nada e muitas vezes entrega a maior parte do ganho. Eu só recorro a SMOTE ou undersampling se a ponderação empacar, e sinceramente eu achei as amostras sintéticas da classe minoritária pouco impressionantes em dados tabulares de fraude, porque os pontos interpolados caem em regiões do espaço de features que não existem. Duas coisas em que eu sou rígido. A reamostragem acontece dentro do fold de treino, nunca antes da divisão, senão o conjunto de validação acaba guardando quase duplicatas das linhas de treino e a métrica vira ficção. E depois de qualquer uma dessas coisas as probabilidades previstas deixam de estar calibradas, então se alguém lá na frente multiplica o score por um valor em dinheiro, eu ajusto uma etapa de calibração em um holdout limpo. No meu último modelo de fraude isso mexeu mais na estimativa de perda esperada do que a própria mudança do modelo.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Por que a ponderação de classes quebra a calibração das probabilidades?
- Como você calibraria, e em quais dados?
- A partir de que ponto você decidiria que a classe positiva é rara demais para modelar?
Mais perguntas para Cientista de Dados
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas