Comece provando que o modelo consegue aprender: faça overfit de um único batch pequeno até a loss ficar perto de zero. Se ele não consegue, o bug está no modelo, na loss ou no otimizador, não no volume de dados. Depois cheque a taxa de aprendizado nos dois extremos, verifique se os rótulos estão alinhados com as entradas, confirme que os gradientes estão fluindo, e confirme que o otimizador de fato recebeu os parâmetros que você acha que ele recebeu.
Por que os entrevistadores perguntam isso
Essa é a falha prática mais comum em trabalho de deep learning, e a resposta revela se você depura de forma sistemática ou sai virando hiperparâmetros. Fazer overfit de um único batch é o primeiro movimento canônico porque isola capacidade de dados, e entrevistadores escutam especificamente por isso. Checar normas de gradiente e alinhamento de rótulos mostra que você sabe onde os bugs reais costumam se esconder.
Como estruturar sua resposta
- Comece com o teste de overfit de um único batch para isolar o problema.
- Cheque a taxa de aprendizado nos dois extremos.
- Verifique se gradientes fluem e se os parâmetros estão registrados no otimizador.
- Cheque o caminho dos dados: alinhamento de rótulos, normalização, embaralhamento.
Exemplo de resposta
O primeiro movimento é sempre o mesmo: pegar um batch de uns oito exemplos e tentar levar a loss para perto de zero nele. Um modelo que funciona memoriza oito exemplos em algumas centenas de passos. Se ele não consegue, o problema não é quantidade de dados nem regularização, é algo quebrado no modelo, na loss ou no otimizador, e eu estreitei a busca enormemente. A partir daí eu checo a taxa de aprendizado nas duas pontas, porque alta demais aparece como loss quicando ou indo para NaN, e baixa demais parece uma linha reta que na verdade está rastejando. Eu imprimo normas de gradiente por camada, o que me diz na hora se o sinal está morrendo ou se alguma camada não está recebendo nada porque foi congelada por acidente ou nunca foi passada ao otimizador. Depois o caminho dos dados, e sinceramente é aí que o bug costuma estar: rótulos deslocados em um em relação às entradas depois de um shuffle, normalização aplicada duas vezes, ou um tensor de alvos que é todo de uma classe por causa de um bug de filtragem. Eu sempre olho um punhado de exemplos decodificados com seus rótulos no olho antes de culpar a arquitetura.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- O que uma loss que vai para NaN depois de algumas centenas de passos sugeriria?
- Como você faria uma checagem de sanidade de que o seu data loader está embaralhando corretamente?
- O que significa se a loss de treino cai mas a de validação nunca cai?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas