Um p valor é a probabilidade de observar um resultado pelo menos tão extremo quanto o seu se a hipótese nula fosse verdadeira. Ele não dá a probabilidade de a hipótese nula ser verdadeira, e não diz que o efeito é importante. Um p valor pequeno com um tamanho de efeito minúsculo em uma amostra enorme é estatisticamente significativo e muitas vezes comercialmente irrelevante, então sempre reporte o tamanho do efeito e o intervalo de confiança.
Por que os entrevistadores perguntam isso
Interpretar p valores errado é o erro estatístico mais comum em analytics de negócio, e leva direto a decisões ruins de lançamento. Os entrevistadores querem o condicional dito na direção certa, a separação entre significância estatística e prática e, de preferência, uma menção aos intervalos de confiança como a coisa mais útil de reportar para stakeholders.
Como estruturar sua resposta
- Diga a definição com o condicional na direção correta.
- Corrija explicitamente a leitura equivocada mais comum.
- Separe significância estatística de importância prática.
- Recomende reportar tamanho de efeito e intervalo de confiança no lugar.
- Cite comparações múltiplas se você testa muitas métricas.
Exemplo de resposta
Um p valor é a probabilidade de ver dados pelo menos tão extremos quanto estes supondo que a hipótese nula é verdadeira. A direção importa, porque a leitura errada mais comum é como se fosse a probabilidade de a nula ser verdadeira, ou pior, a probabilidade de o teste ter funcionado, e essas são afirmações completamente diferentes. O que ele definitivamente não diz é se o resultado importa. Em uma amostra grande o suficiente quase qualquer coisa atinge significância. Eu tive um teste em que uma mudança de botão foi significativa com p abaixo de 0,01 e o ganho real foi de 0,1% em uma métrica com um intervalo de confiança largo que incluía valores pequenos demais para pagar o trabalho de engenharia. Então o que eu apresento para stakeholders é o tamanho do efeito com intervalo de confiança, e enquadro assim: a nossa melhor estimativa é um ganho de 2%, plausivelmente entre 0,5% e 3,5%. Isso dá às pessoas algo que elas conseguem pesar contra o custo. Eu também fico de olho em comparações múltiplas, já que testar quinze métricas garante um par de falsos positivos.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você corrigiria o fato de testar muitas métricas de uma vez?
- O que é um intervalo de confiança, em linguagem simples, para um stakeholder?
- O que um resultado não significativo permite que você conclua?
Mais perguntas para Analista de Dados
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas