Pregunta de entrevista para Científico de datos

¿Cómo detectas fuga de datos en un modelo?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Sospecha de fuga siempre que el rendimiento sea sorprendentemente bueno. Las comprobaciones principales: busca variables con una importancia inverosímil, confirma que cada variable era conocible en el momento de la predicción, verifica que el preprocesado se ajustó dentro del fold de entrenamiento, y comprueba que ninguna entidad aparece a la vez en entrenamiento y en test. Una caída brusca de lo offline a producción suele ser la fuga saliendo a la luz.

Por qué lo preguntan los entrevistadores

La fuga es el fallo que sobrevive a todas las comprobaciones estándar, porque hace que el modelo parezca excelente, así que los entrevistadores quieren saber si tu sospecha se dispara con las buenas noticias y no con las malas. Escuchan la disciplina de la marca temporal (¿esto era conocible en el momento de la predicción?), la higiene de folds en el preprocesado, y el agrupamiento de entidades duplicadas, que son las tres formas en que suele colarse.

Cómo estructurar tu respuesta

  • Di que un rendimiento inesperadamente alto es la primera alarma.
  • Aplica la prueba de conocible en el momento de la predicción a cada variable.
  • Comprueba que el preprocesado y el remuestreo ocurrieron dentro del fold.
  • Comprueba si hay entidades duplicadas cruzando el reparto.
  • Da una fuga concreta que hayas encontrado.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Mi disparador son las buenas noticias. Si un modelo salta a 0,97 de AUC en un problema que el negocio considera difícil, asumo que he filtrado algo hasta demostrar lo contrario. La prueba principal que aplico a cada variable es una pregunta de marca temporal: en el momento en que puntuamos este registro en producción, ¿existiría este valor y tendría este valor? Fallan sorprendentemente muchas. La peor que pillé fue una variable llamada estado de la cuenta. Parecía inocente, pero el equipo de operaciones la actualizaba a cerrada después de que un cliente se diera de baja, y la instantánea de entrenamiento guardaba el valor actual en vez del valor en la fecha de predicción, así que el modelo estaba leyendo la respuesta. Quitarla bajó el AUC de unos 0,94 a 0,79, que era el número real. Más allá de eso compruebo que escaladores, codificadores y cualquier remuestreo se ajustaron dentro del fold, que ningún ID de cliente cruza entrenamiento y test, y que las codificaciones por objetivo se calcularon fuera del fold. Y miro la importancia de las variables pronto, no como un paso de informe al final, porque una sola variable cargando con la mayor parte del modelo suele ser una fuga y no un descubrimiento.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo filtra la codificación por objetivo y cómo se hace de forma segura?
  • ¿Cuál es la diferencia entre fuga y señal legítima de una variable fuerte?
  • ¿Cómo auditarías por fuga un modelo construido por otra persona?

Más preguntas para Científico de datos

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot