Pergunta de entrevista para Engenheiro de Machine Learning

Por que transformers usam layer normalization em vez de batch normalization?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Batch norm normaliza cada feature ao longo do batch, então suas estatísticas dependem da composição do batch e do padding da sequência, e ele se comporta de forma diferente na inferência, onde usa médias correntes. Layer norm normaliza ao longo das features de um único token, independente de batch e de comprimento de sequência, o que o torna estável para sequências de tamanho variável, batches pequenos e decodificação autorregressiva.

Por que os entrevistadores perguntam isso

Isso distingue quem sabe qual camada usar de quem sabe por quê. O entrevistador está sondando se você entende sobre qual eixo cada normalização opera e as consequências práticas: dependência de batch na inferência, problemas com padding e batches pequenos, e a discrepância entre treino e teste. Citar posicionamento pre norm versus post norm e RMSNorm é um bônus forte.

Como estruturar sua resposta

  • Diga sobre qual eixo cada uma normaliza.
  • Explique por que estatísticas de batch quebram com sequências de tamanho variável.
  • Note a discrepância entre treino e inferência no batch norm.
  • Cite o posicionamento pre norm e o RMSNorm como padrão moderno.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Eles normalizam sobre eixos diferentes. O batch norm pega uma única feature e normaliza ela ao longo de todos os exemplos do batch. O layer norm pega um único exemplo, ou um único token, e normaliza ao longo das features dele. Essa diferença decide todo o resto. Com texto você tem sequências de tamanho variável e padding, então as estatísticas de batch ficam poluídas por tokens de pad e mudam dependendo do que calhou de ser agrupado junto. O batch norm também carrega o descasamento entre treino e inferência, em que você treina com estatísticas de batch e serve com médias correntes, e durante a decodificação autorregressiva você costuma estar gerando um token por vez com batch de um, onde estatísticas de batch não significam nada. O layer norm não tem dependência de batch nenhuma, então treino e inferência são idênticos e o tamanho do batch não importa. Sobre posicionamento, transformers modernos colocam a norma antes da subcamada em vez de depois, porque o pre norm mantém o caminho residual limpo e permite treinar pilhas profundas sem um schedule de warmup delicado. A maioria dos modelos atuais também migrou para o RMSNorm, que abandona a centralização pela média e só reescala, porque é mais barato e funciona praticamente igual.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • O que quebra se você usar batch norm com batch de tamanho um?
  • Por que o pre norm treina de forma mais estável que o post norm?
  • O que o RMSNorm descarta, e por que isso acaba não sendo problema?

Mais perguntas para Engenheiro de Machine Learning

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot