Dispara con evidencia, no solo con el calendario. Monitoriza la deriva de entradas, la distribución de predicciones y, donde las etiquetas lo permitan, el rendimiento real sobre una ventana móvil. Reentrena cuando una métrica cruza un umbral que definiste de antemano, o con una cadencia acorde a lo rápido que se mueve el dominio. Valida siempre el candidato contra el modelo vigente con datos recientes antes de promoverlo.
Por qué lo preguntan los entrevistadores
Los entrevistadores quieren saber si tratas el reentrenamiento como una publicación controlada y no como un cron que pisa producción. Lo importante es un disparador definido de antemano, entender el retraso de las etiquetas, y no promover nunca un modelo reentrenado sin compararlo con el actual sobre datos frescos. El reentrenamiento automático sin control es un error común y caro.
Cómo estructurar tu respuesta
- Separa el reentrenamiento programado del reentrenamiento por disparador.
- Nombra qué monitorizas, y menciona el retraso de las etiquetas como restricción.
- Insiste en comparar el candidato con el vigente antes de promoverlo.
- Menciona los bucles de retroalimentación donde el modelo moldea sus propios datos de entrenamiento.
Ejemplo de respuesta
Uso calendario y disparadores. El calendario lo marca lo rápido que se mueve el dominio: un modelo de fraude lo reentrenaría semanalmente, una previsión de demanda cada mes, un clasificador de imágenes sobre una taxonomía estable quizá dos veces al año. Los disparadores vienen de la monitorización: estabilidad poblacional en las entradas clave, desplazamiento de la distribución de predicciones y, donde las etiquetas llegan lo bastante rápido, el rendimiento real sobre una ventana móvil. La restricción que se subestima es el retraso de las etiquetas. Si las etiquetas de abandono tardan sesenta días, no puedo medir la degradación real durante dos meses, así que me apoyo más en la deriva de entradas como aviso temprano y digo con claridad que es un indicador indirecto. La parte que no me salto es el control. Un modelo reentrenado es un candidato a publicación, no una mejora. Se evalúa contra el vigente sobre el periodo reservado más reciente, y si no gana nos quedamos con el viejo, porque datos de entrenamiento más frescos no hacen automáticamente un modelo mejor. Y vigilo los bucles de retroalimentación: si el modelo decide quién ve una oferta, el siguiente conjunto de entrenamiento solo tiene resultados de la gente que ya le gustaba, así que mantengo un pequeño grupo aleatorio de control para que los datos sigan siendo honestos.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Qué estadístico usarías para detectar deriva de entradas, y con qué umbral?
- ¿Cómo manejas el reentrenamiento cuando las etiquetas llegan con mucho retraso?
- ¿Qué te haría reentrenar desde cero en vez de continuar el entrenamiento?
Más preguntas para Ingeniero de machine learning
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas