Pergunta de entrevista para Cientista de Dados

Você rodou um experimento, mas fatiou os resultados de vinte formas e achou dois segmentos significativos. O que você diz ao time?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Trate isso como hipóteses, não como achados. Com alfa 0.05, testar vinte fatias dá cerca de 64 por cento de chance de pelo menos um falso positivo mesmo quando nada é real, então dois acertos é mais ou menos o que puro ruído produz. Aplique uma correção como Benjamini Hochberg ou, melhor, pré registre os segmentos que importam e confirme qualquer surpresa em um teste novo.

Por que os entrevistadores perguntam isso

Essa é uma pergunta de disciplina disfarçada de pergunta de estatística. Os entrevistadores querem ver você resistir a um resultado tentador, porque fatiar até algo ficar significativo é como lançamentos ruins são justificados. Citar o número esperado de falsos positivos, distinguir Bonferroni de controle de taxa de descoberta falsa e propor uma reexecução confirmatória sugerem que você já se queimou com isso.

Como estruturar sua resposta

  • Quantifique quantos falsos positivos vinte testes devem produzir.
  • Reenquadre os dois acertos como hipóteses e não como resultados.
  • Cite uma correção e diga por que o controle de FDR ganha do Bonferroni aqui.
  • Proponha confirmar em um teste novo antes de qualquer um agir.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Eu diria que a gente achou duas pistas, não dois resultados. Com vinte testes independentes a 0.05, a chance de pelo menos um falso positivo sob uma nula verdadeira é de cerca de 64 por cento, e a contagem esperada é um. Então dois está bem dentro do que o ruído produz. Depois eu aplicaria Benjamini Hochberg em vez de Bonferroni, porque Bonferroni em vinte testes é brutalmente conservador e provavelmente mataria um efeito real junto com o ruído; controle de taxa de descoberta falsa é a ferramenta certa quando você está fazendo triagem. Normalmente um ou os dois caem. Se algo sobrevive, eu ainda trato como hipótese e digo isso: o próximo passo honesto é um teste confirmatório mirando aquele segmento especificamente, com o segmento declarado antes de a gente olhar. Eu já vi isso dar errado, com um time lançando para um segmento com base em um resultado fatiado e o efeito sumindo em escala, e o custo não foi só a feature desperdiçada, foi que ninguém confiou na plataforma de experimentos por um trimestre depois.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Como o Benjamini Hochberg funciona, passo a passo?
  • Quando o Bonferroni é a escolha certa apesar de ser conservador?
  • Como você desenharia o experimento desde o início para evitar essa situação?

Mais perguntas para Cientista de Dados

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot