Pregunta de entrevista para Ingeniero de machine learning

Arrancas un entrenamiento y la pérdida no baja en absoluto. ¿Cómo lo depuras?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Empieza demostrando que el modelo puede aprender: sobreajusta un único batch pequeño hasta una pérdida casi nula. Si no puede, el bug está en el modelo, en la pérdida o en el optimizador, no en el volumen de datos. Luego comprueba la tasa de aprendizaje en ambos extremos, verifica que las etiquetas estén alineadas con las entradas, confirma que los gradientes fluyen, y confirma que el optimizador recibió de verdad los parámetros que crees.

Por qué lo preguntan los entrevistadores

Es el fallo práctico más común en trabajo de deep learning, y la respuesta revela si depuras de forma sistemática o si empiezas a cambiar hiperparámetros al tuntún. Sobreajustar un solo batch es el primer movimiento canónico porque aísla la capacidad de los datos, y los entrevistadores lo escuchan específicamente. Revisar las normas de gradiente y la alineación de etiquetas demuestra que sabes dónde se esconden los bugs de verdad.

Cómo estructurar tu respuesta

  • Empieza con la prueba de sobreajustar un solo batch para aislar el problema.
  • Comprueba la tasa de aprendizaje en ambos extremos.
  • Verifica que los gradientes fluyen y que los parámetros están registrados en el optimizador.
  • Revisa la ruta de datos: alineación de etiquetas, normalización, barajado.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

El primer movimiento siempre es el mismo: coger un batch de unos ocho ejemplos e intentar llevar la pérdida casi a cero sobre él. Un modelo que funciona memoriza ocho ejemplos en un par de cientos de pasos. Si no puede, el problema no es la cantidad de datos ni la regularización, es algo roto en el modelo, en la pérdida o en el optimizador, y he estrechado muchísimo la búsqueda. A partir de ahí compruebo la tasa de aprendizaje en ambos extremos, porque demasiado alta se ve como una pérdida que rebota o se va a NaN, y demasiado baja parece una línea plana que en realidad avanza a rastras. Imprimo las normas de gradiente por capa, lo que me dice de inmediato si la señal se está muriendo o si alguna capa no recibe nada porque se congeló por accidente o nunca se le pasó al optimizador. Luego la ruta de datos, y con sinceridad ahí suele estar el bug: etiquetas desplazadas en uno respecto a las entradas tras un barajado, normalización aplicada dos veces, o un tensor de objetivos que es todo de una clase por un bug de filtrado. Siempre miro un puñado de ejemplos decodificados con sus etiquetas a ojo antes de culpar a la arquitectura.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Qué sugeriría una pérdida que se va a NaN tras unos cientos de pasos?
  • ¿Cómo comprobarías que tu cargador de datos baraja correctamente?
  • ¿Qué significa que la pérdida de entrenamiento baje pero la de validación nunca lo haga?

Más preguntas para Ingeniero de machine learning

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot