Pregunta de entrevista para Científico de datos

Dos de tus predictores tienen una correlación de 0,95. ¿Importa eso y qué haces al respecto?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Depende de tu objetivo. Para pura predicción, la colinealidad apenas daña la precisión; el modelo simplemente reparte el peso entre los gemelos. Para inferencia es grave: los coeficientes se vuelven inestables y sus errores estándar se inflan, así que los signos pueden cambiar entre muestras y no puedes decir qué variable impulsa el resultado. Revisa los factores de inflación de la varianza y luego elimina uno, combínalos o usa ridge.

Por qué lo preguntan los entrevistadores

La respuesta correcta empieza con una pregunta y no con un arreglo, y los entrevistadores escuchan exactamente eso. Quien dice de inmediato que elimina uno está mostrando que tiene una única receta. Decir que la colinealidad es más un problema de inferencia que de predicción, y saber que los conjuntos de árboles se comportan distinto que los modelos lineales aquí, demuestra que entiendes lo que significan los coeficientes en vez de tratarlos como puntuaciones de importancia.

Cómo estructurar tu respuesta

  • Pregunta primero si el modelo es para predecir o para explicar.
  • Explica qué le hace la colinealidad a la estabilidad de los coeficientes y a los errores estándar.
  • Nombra un diagnóstico como el VIF o el número de condición.
  • Da las opciones (eliminar, combinar, regularizar) y cuándo encaja cada una.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Mi primera pregunta es para qué sirve el modelo. Si estamos puntuando leads y nadie lee los coeficientes, una correlación de 0,95 es casi inofensiva. El ajuste está bien, las predicciones están bien, el peso simplemente se reparte entre las dos variables de alguna forma arbitraria. Donde muerde es cuando alguien piensa actuar sobre los coeficientes. Entonces es un problema real, porque ese reparto es inestable: reajusta sobre una muestra ligeramente distinta y un coeficiente se va a positivo mientras el otro se va a negativo, y los errores estándar son lo bastante anchos como para que ninguno parezca significativo aunque la pareja claramente importe. Reviso el VIF, y todo lo que pase de diez lo trato como sospechoso. El arreglo depende de la pareja. Si son la misma cosa medida dos veces, como ingresos e ingresos en moneda local, elimino una. Si son dos facetas genuinas de algo, las combino en un ratio o en una sola componente. Si necesito ambas y solo me importa la calidad predictiva, ridge lo maneja con limpieza repartiendo el peso de forma estable en vez de arbitraria.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo maneja un random forest dos variables casi idénticas?
  • ¿Qué te dice numéricamente un VIF de 15?
  • ¿Resolverían esto las componentes principales y qué pierdes a cambio?

Más preguntas para Científico de datos

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot