Pergunta de entrevista para Cientista de Dados

Explique a diferença entre random forest e gradient boosting, e quando você escolheria cada um.

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Um random forest treina muitas árvores profundas em paralelo, em amostras de bootstrap com subconjuntos aleatórios de features, e depois faz a média, o que reduz principalmente a variância. O gradient boosting treina árvores rasas em sequência, cada uma ajustando os erros residuais do conjunto até ali, o que reduz principalmente o viés. Boosting costuma ganhar em acurácia para dados tabulares, mas exige ajuste cuidadoso; forests são bem mais tolerantes já de saída.

Por que os entrevistadores perguntam isso

Esse é o ponto de checagem padrão para saber se você entende ensembles mecanicamente e não como chamadas de biblioteca. O diferencial principal é paralelo e redutor de variância versus sequencial e redutor de viés, mais a consequência: forests raramente sofrem overfitting conforme você adiciona árvores, boosting sofre e muito. Os entrevistadores costumam avançar para taxa de aprendizado e early stopping logo depois, então esteja pronto para explicar por que uma taxa baixa com muitas rodadas ganha do contrário.

Como estruturar sua resposta

  • Contraste bagging paralelo com ajuste sequencial de resíduos.
  • Diga qual componente do erro cada um ataca.
  • Observe que mais árvores é seguro em um forest e não em boosting.
  • Dê o seu padrão prático e os parâmetros de ajuste que importam.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Um forest cria muitas árvores profundas de forma independente, cada uma em uma amostra de bootstrap e cada uma considerando um subconjunto aleatório de features em cada divisão, e depois tira a média. As árvores individualmente sofrem overfitting e são descorrelacionadas, então a média mata a variância. O boosting tem o formato oposto: árvores rasas, construídas uma de cada vez, cada nova árvore ajustada aos erros que o conjunto ainda comete, então ele vai corroendo o viés. A consequência que as pessoas deixam passar é o que acontece conforme você adiciona árvores. Em um forest, mais árvores nunca atrapalha de verdade, só converge. No boosting, mais árvores eventualmente causa overfitting, e é por isso que a taxa de aprendizado e o early stopping importam tanto. Meu padrão em dados tabulares ainda é gradient boosting, normalmente LightGBM ou XGBoost, com taxa de aprendizado baixa e early stopping em um conjunto de validação, porque essa combinação ganhou de tudo o que eu já testei em problemas estruturados. Eu recorro a um forest quando quero uma baseline sólida em dez minutos com quase nenhum ajuste, ou quando quero estimativas out of bag sem separar um conjunto de validação à parte.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Por que uma taxa de aprendizado menor com mais rodadas costuma generalizar melhor?
  • O que o parâmetro subsample faz no gradient boosting?
  • Quando um modelo linear simples ainda ganharia dos dois?

Mais perguntas para Cientista de Dados

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot