Publícala a oscuras primero: ejecútala en modo sombra junto al modelo vigente, puntuando tráfico real sin actuar sobre la salida, y compara distribuciones de puntuación, latencia y disponibilidad de características. Si eso pinta razonable, pasa a un canario en un porcentaje pequeño con un experimento online sobre la métrica de negocio, más guardarraíles. Mantén cargada la versión antigua para que la vuelta atrás sea un cambio de configuración y no un redespliegue.
Por qué lo preguntan los entrevistadores
Una mejora offline no se traduce de forma fiable en una mejora online, y los entrevistadores quieren oír que lo sabes. El despliegue en sombra es la práctica concreta que escuchan, seguida de una prueba online real en vez de fiarse de métricas offline. Mencionar que la vuelta atrás debería ser instantánea, y que las métricas de guardarraíl importan tanto como la métrica objetivo, demuestra madurez operativa.
Cómo estructurar tu respuesta
- Empieza con el modo sombra y qué comparas durante él.
- Pasa a un canario pequeño con un experimento online real.
- Nombra métricas de guardarraíl junto a la métrica objetivo.
- Haz que la vuelta atrás sea un cambio de configuración y define el disparador de antemano.
Ejemplo de respuesta
Mejor offline no significa mejor online, así que nunca promuevo directamente por un número de validación. El primer paso es el modo sombra: el modelo nuevo puntúa las mismas peticiones reales, registramos su salida, y nada actúa sobre ella. Eso pilla las cosas aburridas pero fatales, diferencias en la disponibilidad de características, regresiones de latencia, nulos inesperados, y me deja comparar las dos distribuciones de puntuación sobre tráfico idéntico. Si las puntuaciones del modelo nuevo están desplazadas, hay que mover los umbrales aguas abajo aunque la calidad del ranking haya mejorado, y eso es mucho mejor descubrirlo en sombra que en producción. Luego un canario en un pequeño porcentaje con un experimento online en condiciones sobre la métrica de negocio, no sobre el AUC. En paralelo defino guardarraíles por adelantado: latencia p99, tasa de error, y algo que pille al modelo equivocándose con confianza de un modo que la métrica principal no vería, como un desplazamiento grande en la tasa de marcado. La vuelta atrás tiene que ser un cambio de configuración con la versión antigua todavía cargada, así que tarda segundos, y escribo los números que la disparan antes de lanzar, porque decidir si una métrica está lo bastante mal mientras cae es un momento pésimo para formarse opiniones.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Qué compararías entre las distribuciones de puntuación en sombra y en producción?
- ¿Cuánto tiempo dejarías correr el canario, y qué lo determina?
- ¿Cómo manejas un modelo cuya métrica de negocio tarda semanas en moverse?
Más preguntas para Ingeniero de machine learning
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas