Saca la lógica de las celdas a módulos con pruebas, con la ingeniería de variables compartida entre entrenamiento y servicio para que no puedan divergir. Envuelve el entrenamiento como un job parametrizado, serializa el pipeline completo incluido el preprocesado y no solo el estimador, y expón la puntuación tras una interfaz con validación de entradas. Añade monitorización de entradas y predicciones antes del lanzamiento, no después.
Por qué lo preguntan los entrevistadores
El entrevistador comprueba si sabes entregar algo a los ingenieros sin que tengan que reescribirlo. El punto crítico es una única ruta compartida de transformación de variables, porque reimplementar las variables en el lenguaje del servicio es la fuente clásica de desviación entre entrenamiento y servicio. Serializar el pipeline completo y añadir monitorización desde el principio son las otras marcas de alguien que ha operado un modelo y no solo lo ha entrenado.
Cómo estructurar tu respuesta
- Describe cómo sacas la lógica de las celdas a funciones importables y probadas.
- Insiste en una sola ruta de variables compartida entre entrenamiento y servicio.
- Serializa el pipeline completo, no el estimador pelado.
- Añade validación de entradas y monitorización antes de que salga en vivo.
Ejemplo de respuesta
El notebook es donde averiguo qué es el modelo, no lo que se entrega. El primer movimiento es sacar la lógica a un módulo con funciones que pueda importar y probar, más un par de pruebas unitarias sobre las transformaciones de variables con un fixture minúsculo, porque ahí es donde viven los bugs sutiles. La regla con la que soy más estricto es que entrenamiento y servicio llamen al mismo código de variables. En cuanto alguien reimplementa las variables en el servicio, derivan, y acabas con un modelo puntuando distinto en producción por motivos que nadie encuentra en una semana. Luego serializo el pipeline completo, imputador, codificador, escalador y modelo, como un único objeto, para que el servicio no pueda olvidarse de un paso de preprocesado. El entrenamiento pasa a ser un job que toma una configuración y un rango de fechas y escribe un artefacto versionado. En el lado del servicio valido las entradas y rechazo o pongo por defecto cualquier cosa fuera de rango en lugar de puntuar basura en silencio. Y la monitorización entra antes del lanzamiento: distribuciones de entrada, distribución de predicciones, tasas de nulos, latencia. Si solo pudiera tener una, me quedo con la deriva de entradas, porque es lo primero que cambia.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo manejarías variables que necesitan agregación en tiempo real al servir?
- ¿Qué pinta tiene un buen plan de reversión para un modelo?
- ¿Cómo pruebas un pipeline de modelo en integración continua?
Más preguntas para Científico de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas