Monitoriza tres capas: salud del servicio (latencia, tasa de error, rendimiento), salud de los datos (distribuciones de entrada, tasas de nulos y de categorías desconocidas, frescura de las características) y salud del modelo (distribución de predicciones, y rendimiento cuando lleguen las etiquetas). Avisa por fallos de servicio y por roturas del pipeline de entrada, porque son accionables de inmediato. Manda la deriva lenta a un panel y a una revisión, no a una alarma a las 3 de la madrugada.
Por qué lo preguntan los entrevistadores
Los entrevistadores quieren ver que distingues las señales que necesitan a una persona ahora mismo de las que necesitan una decisión la semana que viene. Alertar por deriva gradual despierta a gente por algo que no puede arreglar a las 3 de la madrugada y entrena al equipo para ignorar las alertas. Nombrar la frescura de las características y la tasa de categorías desconocidas es buena señal, ya que un pipeline de características parado o roto es el incidente real más común en producción.
Cómo estructurar tu respuesta
- Divide la monitorización en capas de servicio, datos y modelo.
- Di qué capa justifica un aviso y cuál no.
- Nombra específicamente la frescura de características y la tasa de categorías desconocidas.
- Menciona el retraso de las etiquetas y cómo monitorizas antes de que lleguen.
Ejemplo de respuesta
Lo pienso en tres capas. La de servicio es lo estándar, latencia p99, tasa de error, rendimiento, y eso sí avisa, porque un modelo devolviendo errores es una caída como cualquier otra. La de datos es donde viven los incidentes de ML de verdad: distribuciones de las características de entrada, tasas de nulos, tasas de categorías desconocidas, y frescura de las características, es decir cuánto tiempo tiene el valor más nuevo del almacén online. La frescura es la que más me importa, porque un trabajo aguas arriba roto no lanza ningún error, simplemente sirve los valores de ayer y el modelo sigue devolviendo tonterías con confianza. Eso sí avisa. La capa de modelo es la distribución de predicciones y, cuando llegan las etiquetas, el rendimiento real. Una distribución de predicciones que se desplaza de golpe merece una alerta; una que deriva despacio es tema de panel y de conversación, no de aviso, porque despertar a alguien por deriva gradual significa que en un mes nadie lee las alertas. Lo que da forma a todo esto es el retraso de las etiquetas. Si la verdad tarda semanas, no puedo monitorizar la precisión casi en tiempo real, así que me apoyo en las distribuciones de entrada y de salida como indicadores indirectos y digo claramente que son indirectos.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo detectarías deriva en una característica categórica de alta cardinalidad?
- ¿Cuál es un umbral de alerta razonable para el desplazamiento de la distribución de predicciones?
- ¿Cómo monitorizas un modelo cuyas etiquetas vienen de revisión humana?
Más preguntas para Ingeniero de machine learning
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas