Define primero el abandono y el horizonte de predicción, ya que la etiqueta determina todo lo demás. Construye un conjunto de variables correcto en el tiempo a partir del comportamiento anterior al corte, reparte por tiempo, empieza con una línea base de logística regularizada o gradient boosting, y evalúa con la precisión al nivel de capacidad de retención que exista. Luego diseña la intervención junto con el modelo, porque una puntuación sobre la que nadie actúa no vale nada.
Por qué lo preguntan los entrevistadores
Las preguntas de diseño abiertas van de orden y criterio, no de algoritmos. Los entrevistadores quieren oír la definición de la etiqueta y el horizonte antes de modelar, la corrección temporal de las variables, un reparto por tiempo y un plan de cómo se usará la puntuación. Quien empieza por la elección de modelo suele saltarse las partes que deciden si el proyecto triunfa o muere en silencio.
Cómo estructurar tu respuesta
- Clava la etiqueta y el horizonte de predicción antes que nada.
- Describe la construcción de variables correcta en el tiempo y el corte de observación.
- Reparte por tiempo y nombra primero una línea base simple.
- Evalúa frente al tamaño de la intervención que el negocio puede ejecutar.
- Cierra con cómo la puntuación se convierte en una acción.
Ejemplo de respuesta
Empiezo por la etiqueta, porque el abandono no es obvio. En una suscripción mensual puede ser no renovar en la siguiente fecha de facturación; en un producto de uso puede ser sin actividad durante treinta días. También fijo el horizonte: ¿predecimos el abandono en los próximos treinta días o en el próximo trimestre? Son modelos distintos con intervenciones distintas. Luego construyo variables a una fecha de corte, usando solo comportamiento anterior a ella: tendencia de uso, tickets de soporte, fallos de pago, cambios en el número de licencias, antigüedad. La corrección temporal es la parte con la que más cuidado tengo. Reparto por tiempo, entrenando con cohortes anteriores y validando con posteriores. La línea base es una regresión logística regularizada para tener algo interpretable, y luego gradient boosting para ver cuánto margen queda. Para evaluar pregunto al equipo de retención a cuántos clientes puede contactar por semana e informo de la precisión en esa franja superior en lugar del AUC global. Y insisto en diseñar la intervención con ellos, idealmente con un grupo de control, porque si no, en seis meses nadie podrá decir si el modelo salvó a un solo cliente.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo medirías si la campaña de retención funcionó de verdad?
- ¿Y si la propia intervención cambia quién abandona y rompe tus datos de entrenamiento?
- ¿Cada cuánto reentrenarías y qué lo dispararía?
Más preguntas para Científico de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas