Pergunta de entrevista para Cientista de Dados

Qual é a diferença prática entre regularização L1 e L2, e como você escolhe entre elas?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

L1 (lasso) soma os valores absolutos dos coeficientes à função de perda e leva alguns coeficientes exatamente a zero, então faz seleção de variáveis. L2 (ridge) soma os coeficientes ao quadrado, encolhendo tudo em direção a zero sem eliminar nada, o que lida melhor com preditores correlacionados. Escolha L1 quando você quer um modelo esparso e explicável; escolha L2 quando os preditores são correlacionados e você quer estabilidade.

Por que os entrevistadores perguntam isso

Qualquer um recita lasso versus ridge. O entrevistador quer a razão geométrica ou prática de o L1 produzir zeros exatos, e quer ouvir que você escala as features antes, porque as duas penalidades não significam nada em dados sem escala. Citar elastic net como padrão pragmático e descrever como você escolhe a força da penalidade por validação cruzada separa um praticante de alguém repetindo uma frase de livro.

Como estruturar sua resposta

  • Diga o termo de penalidade de cada uma em linguagem simples.
  • Explique por que o L1 chega a zeros exatos e o L2 não.
  • Mencione que as features precisam estar escaladas antes de qualquer penalidade fazer sentido.
  • Diga como você escolhe a força e cite elastic net como meio termo.

Exemplo de resposta

Exemplo falado, em primeira pessoa

O L2 eleva os coeficientes ao quadrado e encolhe todos suavemente em direção a zero. O L1 usa valores absolutos, e como essa penalidade tem um bico em zero, o ótimo frequentemente cai exatamente em zero, e é por isso que o lasso serve também como seleção de variáveis. A regra prática que eu uso tem a ver com correlação. Se eu tenho um bloco de preditores muito correlacionados, o lasso escolhe um quase arbitrariamente e zera o resto, o que parece organizado mas é instável: refaça o ajuste em uma amostra de bootstrap e ele escolhe outro. O ridge mantém todos e divide o peso, o que costuma ser mais honesto. Se um stakeholder precisa de uma lista curta de fatores, eu levo o lasso e aceito a instabilidade, mas eu digo em voz alta que os sobreviventes são representantes de um grupo correlacionado, não as únicas coisas que importam. Na prática eu costumo usar elastic net para ter alguma esparsidade sem a escolha arbitrária, e ajusto a força por validação cruzada. E eu sempre padronizo antes, porque senão a penalidade só castiga a feature que por acaso está medida em unidades pequenas.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Por que a penalidade L1 produz zeros exatos do ponto de vista geométrico?
  • O que acontece com os coeficientes do ridge quando a penalidade tende ao infinito?
  • Como você ajustaria a força da penalidade quando também há desbalanceamento de classes?

Mais perguntas para Cientista de Dados

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot