Pregunta de entrevista para Científico de datos

¿Cómo decides qué hacer con los valores ausentes de un conjunto de datos?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Empieza averiguando por qué faltan los valores, ya que el mecanismo decide el arreglo. Ausencia completamente aleatoria tolera una imputación simple; ausencia aleatoria condicionada necesita imputación en función de las variables observadas; ausencia no aleatoria significa que la propia ausencia es señal y debería convertirse en una variable. Nunca imputes antes de repartir, y añade un indicador de estaba ausente siempre que el patrón lleve información.

Por qué lo preguntan los entrevistadores

Los candidatos flojos saltan directamente a imputar la media. El entrevistador comprueba si investigas primero la causa, porque en sistemas reales la ausencia suele ser un pipeline roto, un campo opcional de un formulario o un campo que solo existe para un segmento de clientes, y cada uno implica una acción distinta. También quieren oír que la imputación se ajusta solo con los datos de entrenamiento, ya que ajustar con todo provoca fuga.

Cómo estructurar tu respuesta

  • Pregunta por qué faltan los datos antes de decidir cómo rellenarlos.
  • Mapea los tres mecanismos a tres respuestas distintas.
  • Di que el indicador de ausencia suele ser una variable fuerte por sí sola.
  • Señala que la imputación se ajusta dentro del fold de entrenamiento.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Lo primero que hago no es estadístico, es hablar con quien sea dueño del campo. Que falte suele significar algo concreto. En un conjunto de datos de crédito con el que trabajé, los ingresos estaban en blanco en torno a una quinta parte de las filas, y resultó que venían de un flujo de solicitud exprés que nunca los pedía. Eso no es aleatorio en absoluto, y esos solicitantes impagaban a una tasa distinta, así que el hecho del blanco era uno de los predictores más fuertes del modelo. Añadí un indicador de ausencia y se ganó su sitio. Mecánicamente, si de verdad es ruido aleatorio y la columna está casi completa, imputar la mediana más un indicador está bien. Si depende de otras variables observadas, uso imputación iterativa o basada en modelos. Si falta más de la mitad de una columna, normalmente la elimino, porque a esas alturas estoy imputando sobre todo mis propios supuestos. Y lo que use se ajusta solo con el reparto de entrenamiento y luego se aplica a validación, porque calcular una mediana sobre todo el conjunto provoca fuga en silencio.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo manejan los árboles con gradient boosting los valores ausentes de forma nativa?
  • ¿Qué sale mal si imputas antes de repartir?
  • ¿Cómo manejarías una variable que solo falta para los clientes nuevos?

Más preguntas para Científico de datos

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot