Pregunta de entrevista para Científico de datos

¿Cómo montas la validación cruzada y qué cambia cuando los datos son una serie temporal?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

El k fold estándar reparte las filas al azar en k partes, entrena con k menos una y valida con la que queda fuera, y luego promedia. Con series temporales eso es inválido, porque los repartos aleatorios dejan que el modelo entrene con el futuro y prediga el pasado. Usa en su lugar encadenamiento hacia delante: entrena con todo hasta el instante t, valida en la siguiente ventana, avanza, y deja un hueco si las variables usan ventanas móviles.

Por qué lo preguntan los entrevistadores

La fuga a través del tiempo es una de las razones más comunes por las que un modelo luce genial fuera de línea y muere en producción, así que los entrevistadores usan esto para ver si piensas en cómo se va a usar el modelo de verdad. También escuchan si haces repartos por grupos cuando las filas no son independientes, por ejemplo varias filas por cliente, y si ajustas el preprocesado dentro del fold en lugar de sobre todo el conjunto.

Cómo estructurar tu respuesta

  • Describe el k fold normal en una frase.
  • Explica por qué los repartos aleatorios provocan fuga cuando el tiempo importa.
  • Describe el encadenamiento hacia delante y el hueco entre entrenamiento y validación.
  • Añade los repartos por grupos para entidades repetidas y el preprocesado por fold.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

El k fold normal baraja las filas en folds y va rotando cuál dejas fuera. Eso está bien cuando las filas son independientes, y se cae en cuanto dejan de serlo. Con series temporales uso encadenamiento hacia delante: entreno con los meses uno a seis, valido con el siete, luego entreno hasta el siete y valido con el ocho, y así sucesivamente. La validación siempre queda después de la ventana de entrenamiento, que es como se usa el modelo. También dejo un hueco cuando mis variables usan ventanas móviles, porque una media móvil de treinta días calculada justo en la frontera contiene en silencio información del periodo de validación. La otra trampa son las entidades repetidas. Si un cliente tiene cuarenta filas y caen en entrenamiento y en validación, el modelo puede memorizar a ese cliente y la puntuación está inflada, así que agrupo por ID de cliente. Y ajusto escaladores y codificadores dentro de cada fold, nunca sobre el conjunto completo primero, porque ajustar sobre todo filtra la distribución de validación al entrenamiento. Eso solo me ha explicado un par de puntos de caída entre lo offline y lo real.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cuántos folds usas y por qué?
  • ¿Qué es la validación cruzada anidada y cuándo la necesitas?
  • ¿Cómo validarías un modelo que predice un evento raro que ocurre unas pocas veces al año?

Más preguntas para Científico de datos

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot