Primero cambia la métrica, ya que la exactitud es inútil al 0,3 por ciento: usa AUC de precisión y recall, o recall a un presupuesto fijo de alertas. Luego prueba pesos de clase antes de remuestrear, porque ponderar es más simple y no fabrica filas. Si remuestreas, hazlo solo dentro del fold de entrenamiento. Por último recalibra las probabilidades, ya que tanto la ponderación como el sobremuestreo distorsionan las puntuaciones predichas.
Por qué lo preguntan los entrevistadores
El desbalance es donde los candidatos recurren a SMOTE por reflejo sin preguntarse si ayuda. El entrevistador quiere ver el orden: primero la métrica, luego la ponderación simple, y remuestrear solo si hace falta, y siempre dentro del fold. Mencionar la calibración es una señal fuerte, porque un modelo remuestreado que devuelve 0,9 para algo que ocurre el uno por ciento de las veces rompe cualquier cálculo de valor esperado aguas abajo.
Cómo estructurar tu respuesta
- Arregla la métrica de evaluación antes de tocar los datos.
- Recurre a los pesos de clase antes que al sobremuestreo sintético.
- Insiste en que cualquier remuestreo ocurre solo dentro del fold de entrenamiento.
- Menciona recalibrar las probabilidades después.
Ejemplo de respuesta
Lo primero que cambio es el marcador, porque un modelo que predice que nunca hay fraude acierta el 99,7 por ciento de las veces y no vale absolutamente nada. Uso AUC de precisión y recall y, más útil todavía, el recall al volumen de alertas que el equipo puede revisar de verdad. Luego empiezo simple con pesos de clase en la función de pérdida, que no cuesta nada y a menudo consigue casi todo el beneficio. Solo recurro a SMOTE o al submuestreo si la ponderación se estanca y, sinceramente, las muestras sintéticas de la clase minoritaria me han parecido flojas en datos tabulares de fraude, porque los puntos interpolados caen en regiones del espacio de variables que no existen. Hay dos cosas con las que soy estricto. El remuestreo ocurre dentro del fold de entrenamiento, nunca antes del reparto, o el conjunto de validación acaba conteniendo casi duplicados de filas de entrenamiento y la puntuación es ficción. Y después de todo esto las probabilidades predichas ya no están calibradas, así que si alguien aguas abajo multiplica la puntuación por un importe en euros, ajusto un paso de calibración sobre un holdout limpio. En mi último modelo de fraude eso movió la estimación de pérdida esperada más que el propio cambio de modelo.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Por qué la ponderación de clases rompe la calibración de probabilidades?
- ¿Cómo calibrarías y con qué datos?
- ¿En qué punto decidirías que la clase positiva es demasiado rara para modelarla siquiera?
Más preguntas para Científico de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas