Batch norm normaliza cada feature ao longo do batch, então suas estatísticas dependem da composição do batch e do padding da sequência, e ele se comporta de forma diferente na inferência, onde usa médias correntes. Layer norm normaliza ao longo das features de um único token, independente de batch e de comprimento de sequência, o que o torna estável para sequências de tamanho variável, batches pequenos e decodificação autorregressiva.
Por que os entrevistadores perguntam isso
Isso distingue quem sabe qual camada usar de quem sabe por quê. O entrevistador está sondando se você entende sobre qual eixo cada normalização opera e as consequências práticas: dependência de batch na inferência, problemas com padding e batches pequenos, e a discrepância entre treino e teste. Citar posicionamento pre norm versus post norm e RMSNorm é um bônus forte.
Como estruturar sua resposta
- Diga sobre qual eixo cada uma normaliza.
- Explique por que estatísticas de batch quebram com sequências de tamanho variável.
- Note a discrepância entre treino e inferência no batch norm.
- Cite o posicionamento pre norm e o RMSNorm como padrão moderno.
Exemplo de resposta
Eles normalizam sobre eixos diferentes. O batch norm pega uma única feature e normaliza ela ao longo de todos os exemplos do batch. O layer norm pega um único exemplo, ou um único token, e normaliza ao longo das features dele. Essa diferença decide todo o resto. Com texto você tem sequências de tamanho variável e padding, então as estatísticas de batch ficam poluídas por tokens de pad e mudam dependendo do que calhou de ser agrupado junto. O batch norm também carrega o descasamento entre treino e inferência, em que você treina com estatísticas de batch e serve com médias correntes, e durante a decodificação autorregressiva você costuma estar gerando um token por vez com batch de um, onde estatísticas de batch não significam nada. O layer norm não tem dependência de batch nenhuma, então treino e inferência são idênticos e o tamanho do batch não importa. Sobre posicionamento, transformers modernos colocam a norma antes da subcamada em vez de depois, porque o pre norm mantém o caminho residual limpo e permite treinar pilhas profundas sem um schedule de warmup delicado. A maioria dos modelos atuais também migrou para o RMSNorm, que abandona a centralização pela média e só reescala, porque é mais barato e funciona praticamente igual.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- O que quebra se você usar batch norm com batch de tamanho um?
- Por que o pre norm treina de forma mais estável que o post norm?
- O que o RMSNorm descarta, e por que isso acaba não sendo problema?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas