Viés é o erro de um modelo simples demais para capturar o sinal real; variância é o erro de um modelo tão flexível que ajusta o ruído da amostra de treino. O erro esperado total é viés ao quadrado mais variância mais ruído irredutível. Na prática você enxerga isso como uma diferença: erro alto no treino e na validação significa viés, erro baixo no treino com validação bem pior significa variância.
Por que os entrevistadores perguntam isso
Isso separa quem decorou uma definição de quem a usa para depurar. O entrevistador quer saber o que você faz depois de diagnosticar de que lado você está, porque as correções são opostas: mais capacidade e features melhores para viés, mais dados e regularização para variância. Ele também checa se você compara o erro de treino com o de validação em vez de encarar um número só.
Como estruturar sua resposta
- Defina os dois termos em uma frase cada.
- Explique como a diferença entre treino e validação diz qual dos dois domina.
- Nomeie as correções opostas para cada lado.
- Dê um exemplo concreto de ajuste, como profundidade de árvore.
Exemplo de resposta
Viés é o erro que você tem porque o seu modelo não consegue representar a relação verdadeira, variância é o erro que você tem porque ele está perseguindo o ruído da amostra em que você por acaso treinou. O que torna isso útil é que é uma ferramenta de depuração, não um slogan. Eu olho o erro de treino ao lado do erro de validação. Se os dois estão ruins, eu tenho um problema de viés, então adiciono capacidade, features mais ricas ou interações. Se o erro de treino está perto de zero e o de validação está bem pior, isso é variância, então eu recuo com regularização mais forte, menos features, ou mais dados se eu conseguir. O exemplo mais claro que eu peguei foi um modelo de gradient boosting em dados de transação. Com profundidade dez ele acertava quase tudo no treino e ia bem pior no holdout. Baixar para profundidade quatro e adicionar uma penalidade por folha fechou boa parte da diferença e a AUC de holdout até subiu. A outra coisa que eu observo é que mais dados ajudam muito na variância e quase nada no viés, então se a curva de aprendizado já estabilizou, comprar mais linhas é desperdício de dinheiro.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você diria, olhando uma curva de aprendizado, se mais dados vão ajudar?
- O que o bagging faz com viés e variância, e o que o boosting faz?
- Um modelo pode ter viés alto e variância alta ao mesmo tempo?
Mais perguntas para Cientista de Dados
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas