SGD com momentum usa uma única taxa de aprendizado global e acumula um termo de velocidade para suavizar as atualizações. O Adam mantém taxas adaptativas por parâmetro a partir de estimativas correntes do primeiro e do segundo momento do gradiente, então ele converge rápido com pouco ajuste. O Adam é o padrão para transformers e problemas esparsos; um SGD com momentum bem tunado ainda generaliza melhor em muitos modelos de visão.
Por que os entrevistadores perguntam isso
Entrevistadores querem saber se você entende otimizadores como mecanismos e não como argumentos de string. O discriminante é a adaptatividade por parâmetro e o que ela compra: robustez a uma taxa de aprendizado mal escolhida e a gradientes esparsos. Candidatos fortes citam AdamW e por que desacoplar o weight decay importa, mais warmup e schedules, já que quase ninguém treina um transformer sem os dois.
Como estruturar sua resposta
- Descreva o que cada otimizador guarda de estado.
- Explique o que a adaptatividade por parâmetro realmente compra.
- Cite o seu padrão e o caso em que você trocaria.
- Cite AdamW, warmup e o schedule que você combina com ele.
Exemplo de resposta
O momentum guarda uma média corrente dos gradientes passados, então a atualização carrega velocidade por regiões planas e amortece a oscilação ao atravessar uma ravina. Ainda existe uma única taxa de aprendizado para todo parâmetro. O Adam adiciona uma segunda média corrente, dos gradientes ao quadrado, e divide pela raiz quadrada dela, o que dá a cada parâmetro seu próprio tamanho de passo efetivo. Parâmetros com gradientes consistentemente grandes ganham passos menores, features raras com gradientes esparsos ganham passos maiores. Na prática isso significa que o Adam é muito menos sensível a escolher a taxa de aprendizado inicial errada, e é por isso que ele é o padrão para qualquer coisa em formato de transformer e para modelos pesados em embeddings. Meu padrão de fato é o AdamW em vez do Adam puro, porque dobrar o weight decay dentro do termo adaptativo faz o decaimento ficar efetivamente diferente por parâmetro, e desacoplar corrige isso. Eu combino com warmup linear por algumas centenas de passos e depois decaimento cosseno. Onde eu de fato troco para SGD com momentum é no fine tuning de backbones convolucionais de visão, onde um schedule bem tunado ainda tende a ficar cerca de um ponto melhor na acurácia de validação, se eu tiver orçamento para tunar.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Por que o Adam precisa de correção de viés nos primeiros passos?
- O que exatamente o AdamW muda em relação ao Adam?
- Como você escolheria uma taxa de aprendizado inicial para um modelo que nunca treinou?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas