Pregunta de entrevista para Científico de datos

¿Cómo llevas el registro de los experimentos para poder reproducir un modelo seis meses después?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Versiona cuatro cosas a la vez: código, datos, configuración y entorno. Usa una herramienta de seguimiento como MLflow o Weights and Biases para registrar parámetros, métricas y artefactos por ejecución; fija los datos con una instantánea fechada en lugar de una consulta en vivo; guarda los hiperparámetros en ficheros de configuración bajo git; y registra las versiones de los paquetes. El artefacto del modelo debe llevar el SHA de git que lo produjo.

Por qué lo preguntan los entrevistadores

Las preguntas de reproducibilidad separan a quien ha mantenido un modelo de quien solo lo ha construido. El entrevistador quiere los cuatro ejes nombrados, en especial el versionado de datos, ya que es el que más gente olvida y el que rompe la reproducción en silencio. Atar el artefacto del modelo a un commit concreto es la práctica tangible que demuestra que has tenido que hacerlo de verdad.

Cómo estructurar tu respuesta

  • Nombra las cuatro cosas que hay que versionar juntas.
  • Di qué herramienta usas para el seguimiento por ejecución y qué registras.
  • Explica cómo fijas los datos, no solo el código.
  • Menciona el entorno y el SHA de git en el artefacto.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

La regla con la que trabajo es que un modelo solo es reproducible si código, datos, configuración y entorno están todos fijados. El código es fácil, eso es git. La configuración la guardo en YAML en el repositorio y no en celdas de notebook, así los hiperparámetros exactos viven en el historial de commits. El entorno es un fichero de bloqueo y una etiqueta de imagen de contenedor. Los datos son lo que pilla a la gente, y me pilló a mí: una vez intenté reproducir un modelo de cuatro meses antes, tenía el código y los parámetros exactos, y salió un resultado distinto, porque la consulta de entrenamiento leía de una tabla que se había rellenado hacia atrás mientras tanto. Ahora el entrenamiento lee de una instantánea fechada con un recuento de filas y una suma de verificación registrados, nunca de una consulta en vivo. Para el seguimiento de ejecuciones uso MLflow, registrando parámetros, métricas, la lista de variables y el artefacto del modelo por ejecución, y el artefacto lleva el SHA de git y el ID de la instantánea de datos en sus metadatos. Así un modelo en producción se rastrea hasta una ejecución exacta y esa ejecución se puede repetir. Es como una hora de montaje y me ha ahorrado semanas.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo versionas un conjunto de datos genuinamente demasiado grande para hacerle una instantánea?
  • ¿Qué registras de una ejecución que falla?
  • ¿Cómo compararías cincuenta ejecuciones de ajuste sin ahogarte en ellas?

Más preguntas para Científico de datos

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot