Pregunta de entrevista para Ingeniero de machine learning

¿Qué causa el desvanecimiento del gradiente en una red profunda, y cómo lo evitan las arquitecturas modernas?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Los gradientes se desvanecen cuando la multiplicación repetida de derivadas pequeñas durante la retropropagación encoge la señal hacia cero antes de llegar a las primeras capas, así que esas capas dejan de aprender. Las activaciones saturantes como sigmoid y tanh son la causa clásica. Los arreglos modernos son las activaciones de la familia ReLU, las conexiones residuales que dan al gradiente un camino directo, la inicialización escalada tipo He o Xavier, y las capas de normalización.

Por qué lo preguntan los entrevistadores

Esto prueba si entiendes por qué las arquitecturas tienen la forma que tienen en vez de solo saberte sus nombres. El entrevistador quiere la explicación de la regla de la cadena, no la palabra de moda. Mencionar que las conexiones residuales aportan un camino identidad para el gradiente, y que la normalización mantiene las activaciones en un rango bien condicionado, demuestra que sabrías depurar de verdad un modelo profundo que se niega a entrenar.

Cómo estructurar tu respuesta

  • Explica la multiplicación de la regla de la cadena que encoge la señal.
  • Nombra las activaciones saturantes que lo causan.
  • Explica las conexiones residuales como camino identidad para los gradientes.
  • Añade la inicialización y la normalización como la otra mitad del arreglo.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

La retropropagación multiplica derivadas capa a capa. Si la derivada local de cada capa es menor que uno y tienes cincuenta, el producto se va a cero de forma exponencial y las primeras capas no reciben prácticamente gradiente, así que nunca se mueven de su inicialización. Sigmoid es la culpable clásica porque su derivada llega como mucho a 0,25, así que pierdes al menos tres cuartos de la señal por capa incluso en el mejor caso. Los arreglos se apilan. ReLU tiene derivada exactamente uno en el lado positivo, así que no encoge nada. Las conexiones residuales son la clave: como la salida es x más f de x, el gradiente consigue un camino identidad directo hacia atrás, así que aunque un bloque no aporte nada útil, la señal sigue llegando a las capas de abajo. Por eso podemos entrenar pilas muy profundas siquiera. Luego la inicialización escalada al fan in, He para ReLU, mantiene estable la varianza de activación al principio, y la layer norm la mantiene estable durante el entrenamiento. Cuando veo un modelo profundo donde la pérdida apenas se mueve, lo primero que grafico es la norma del gradiente por capa, porque eso te dice de inmediato si el fondo de la red está recibiendo algo.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo se ve el caso de explosión del gradiente, y cómo lo manejas?
  • ¿Por qué ayuda el recorte de gradiente, y dónde lo aplicas?
  • ¿Cómo cambian las conexiones residuales la profundidad efectiva de una red?

Más preguntas para Ingeniero de machine learning

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot