Pregunta de entrevista para Ingeniero de machine learning

¿Por qué usan los transformers normalización por capa en lugar de normalización por batch?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

La batch norm normaliza cada característica a lo largo del batch, así que sus estadísticas dependen de la composición del batch y del padding de la secuencia, y se comporta distinto en inferencia, donde usa medias móviles. La layer norm normaliza a lo largo de las características de un solo token, con independencia del batch y de la longitud de secuencia, lo que la vuelve estable con secuencias de longitud variable, batches pequeños y decodificación autorregresiva.

Por qué lo preguntan los entrevistadores

Esto distingue a quien sabe qué capa usar de quien sabe por qué. El entrevistador indaga si entiendes sobre qué eje opera cada normalización y las consecuencias prácticas: dependencia del batch en inferencia, problemas con el padding y con batches pequeños, y la discrepancia entre entrenamiento y prueba. Mencionar la colocación pre norm frente a post norm y RMSNorm es un buen extra.

Cómo estructurar tu respuesta

  • Di sobre qué eje normaliza cada una.
  • Explica por qué las estadísticas de batch se rompen con secuencias de longitud variable.
  • Anota la discrepancia entre entrenamiento e inferencia en la batch norm.
  • Menciona la colocación pre norm y RMSNorm como el valor por defecto moderno.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Normalizan sobre ejes distintos. La batch norm toma una sola característica y la normaliza a lo largo de todos los ejemplos del batch. La layer norm toma un solo ejemplo, o un solo token, y normaliza a lo largo de sus características. Esa diferencia decide todo lo demás. Con texto tienes secuencias de longitud variable y padding, así que las estadísticas de batch se contaminan con tokens de relleno y cambian según lo que haya caído junto en el batch. La batch norm también arrastra el desajuste entre entrenamiento e inferencia, donde entrenas con estadísticas de batch y sirves con medias móviles, y durante la decodificación autorregresiva a menudo generas un token cada vez con un batch de uno, donde las estadísticas de batch no significan nada. La layer norm no tiene ninguna dependencia del batch, así que entrenamiento e inferencia son idénticos y el tamaño de batch da igual. Sobre la colocación, los transformers modernos ponen la norma antes del subnivel en vez de después, porque el pre norm mantiene limpio el camino residual y te deja entrenar pilas profundas sin un schedule de warmup delicado. La mayoría de los modelos actuales también se han pasado a RMSNorm, que quita el centrado de la media y solo reescala, porque es más barata y funciona más o menos igual de bien.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Qué se rompe si usas batch norm con un tamaño de batch de uno?
  • ¿Por qué entrena el pre norm de forma más estable que el post norm?
  • ¿Qué quita RMSNorm, y por qué resulta que no pasa nada?

Más preguntas para Ingeniero de machine learning

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot