Pergunta de entrevista para Cientista de Dados

Como você decide o que fazer com valores ausentes em um dataset?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Comece descobrindo por que os valores estão ausentes, já que o mecanismo define a solução. Ausência completamente aleatória tolera imputação simples; ausência aleatória condicionada exige imputação a partir das variáveis observadas; ausência não aleatória significa que a própria ausência é sinal e deve virar uma feature. Nunca impute antes de dividir os dados, e adicione um indicador de estava ausente sempre que o padrão carregar informação.

Por que os entrevistadores perguntam isso

Candidatos fracos pulam direto para imputação pela média. O entrevistador checa se você investiga a causa primeiro, porque em sistemas reais a ausência costuma ser um pipeline quebrado, um campo opcional de formulário ou um campo que só existe para um segmento de clientes, e cada um desses implica uma ação diferente. Ele também quer ouvir que a imputação é ajustada só nos dados de treino, já que ajustar em tudo vaza.

Como estruturar sua resposta

  • Pergunte por que o dado está ausente antes de decidir como preencher.
  • Mapeie os três mecanismos para três respostas diferentes.
  • Diga que a flag de ausência costuma ser uma feature forte sozinha.
  • Observe que a imputação é ajustada dentro do fold de treino.

Exemplo de resposta

Exemplo falado, em primeira pessoa

A primeira coisa que eu faço não é estatística, é uma conversa com quem é dono do campo. Ausente normalmente significa algo específico. Em um dataset de crédito em que trabalhei, a renda estava em branco em cerca de um quinto das linhas, e essas linhas vinham de um fluxo de aplicação rápida que nunca perguntava isso. Isso não é nada aleatório, e aqueles candidatos ficavam inadimplentes em uma taxa diferente, então o próprio fato do campo em branco era um dos preditores mais fortes do modelo. Eu adicionei uma flag de ausência e ela mereceu o lugar. Mecanicamente, se for mesmo ruído aleatório e a coluna estiver quase completa, imputação pela mediana mais uma flag resolve. Se depende de outras variáveis observadas, eu uso imputação iterativa ou baseada em modelo. Se mais de uns cinquenta por cento de uma coluna está ausente, eu normalmente a descarto, porque nesse ponto eu estou imputando as minhas próprias suposições. E o que quer que eu use é ajustado só na divisão de treino e depois aplicado à validação, porque calcular uma mediana no dataset inteiro vaza silenciosamente.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Como árvores de gradient boosting lidam com valores ausentes nativamente?
  • O que dá errado se você imputa antes de dividir os dados?
  • Como você lidaria com uma feature que está ausente só para clientes novos?

Mais perguntas para Cientista de Dados

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot