SGD con momentum usa una sola tasa de aprendizaje global y acumula un término de velocidad para suavizar las actualizaciones. Adam mantiene tasas adaptativas por parámetro a partir de estimaciones móviles del primer y el segundo momento del gradiente, así que converge rápido con poco ajuste. Adam es el valor por defecto para transformers y problemas dispersos; un SGD con momentum bien ajustado todavía generaliza mejor en muchos modelos de visión.
Por qué lo preguntan los entrevistadores
Los entrevistadores quieren saber si entiendes los optimizadores como mecanismos y no como argumentos de texto. El discriminador es la adaptatividad por parámetro y qué te aporta: robustez frente a una tasa de aprendizaje mal elegida y frente a gradientes dispersos. Los buenos candidatos mencionan AdamW y por qué importa desacoplar el weight decay, además del warmup y los schedules, ya que casi nadie entrena un transformer sin ambos.
Cómo estructurar tu respuesta
- Describe qué estado guarda cada optimizador.
- Explica qué te aporta realmente la adaptatividad por parámetro.
- Nombra tu opción por defecto y el caso en el que cambiarías.
- Menciona AdamW, el warmup y el schedule con el que lo combinas.
Ejemplo de respuesta
El momentum guarda una media móvil de los gradientes pasados, así que la actualización arrastra velocidad por las zonas planas y amortigua la oscilación al cruzar un barranco. Sigue habiendo una sola tasa de aprendizaje para todos los parámetros. Adam añade una segunda media móvil, la de los gradientes al cuadrado, y divide por su raíz, lo que le da a cada parámetro su propio tamaño de paso efectivo. Los parámetros con gradientes grandes de forma consistente reciben pasos más pequeños, y las características raras con gradientes dispersos reciben pasos mayores. En la práctica eso significa que Adam es mucho menos sensible a elegir mal la tasa de aprendizaje inicial, y por eso es el valor por defecto para cualquier cosa con forma de transformer y para modelos con muchos embeddings. Mi opción real por defecto es AdamW y no Adam a secas, porque meter el weight decay dentro del término adaptativo hace que el decay sea de hecho distinto por parámetro, y desacoplarlo lo corrige. Lo combino con un warmup lineal de unos cientos de pasos y luego un decaimiento coseno. Donde sí me paso a SGD con momentum es en el ajuste fino de backbones convolucionales de visión, donde un schedule bien ajustado todavía suele acabar un punto por encima en precisión de validación, si tengo presupuesto para ajustarlo.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Por qué necesita Adam corrección de sesgo en los primeros pasos?
- ¿Qué cambia exactamente AdamW respecto a Adam?
- ¿Cómo elegirías una tasa de aprendizaje inicial para un modelo que nunca has entrenado?
Más preguntas para Ingeniero de machine learning
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas