Optimiza recall cuando un positivo perdido cuesta más que una falsa alarma, como en cribado de fraude o detección de enfermedades donde de todos modos un humano revisa cada aviso. Optimiza precisión cuando actuar sobre un positivo es caro o molesto, como enviar ofertas o bloquear cuentas. Fija el umbral a partir del coste esperado en lugar de dejarlo por defecto en 0,5, barriendo umbrales y eligiendo la pérdida esperada mínima.
Por qué lo preguntan los entrevistadores
Esto comprueba si conectas un número del modelo con un coste de negocio. El umbral por defecto de 0,5 es un artefacto de la librería, no una decisión, y los entrevistadores quieren oír que lo sustituyes por algo derivado del coste relativo de los dos tipos de error. Los mejores candidatos también mencionan la capacidad aguas abajo, ya que un equipo de revisión que solo puede con doscientos casos al día limita el recall al margen de las matemáticas.
Cómo estructurar tu respuesta
- Ancla la elección en el coste de cada tipo de error.
- Da un ejemplo concreto de cada lado.
- Explica cómo conviertes los costes en un umbral en lugar de quedarte en 0,5.
- Menciona la capacidad operativa como una restricción real sobre el recall.
Ejemplo de respuesta
Empiezo preguntando qué pasa con cada tipo de error. En una cola de fraude, un falso negativo es dinero que se va más un contracargo, mientras que un falso positivo son treinta segundos del tiempo de un analista, así que gana el recall y bajo el umbral. En un modelo de notificaciones push se invierte: un falso positivo irrita a un usuario real y te puede costar una desinstalación, así que quiero precisión aunque llegue a menos gente. Para elegir el número concreto, pongo un coste aproximado a cada tipo de error, barro el umbral por el conjunto de validación y dibujo el coste esperado. Suele tener una cuenca clara, y cojo el centro de la cuenca en lugar del mínimo exacto, porque el mínimo salta entre folds. La restricción que la gente olvida es la capacidad. En un proyecto de fraude la curva de coste decía que marcáramos alrededor del cuatro por ciento de las transacciones, pero el equipo de revisión podía con unos mil casos al día, así que el umbral real era el que produjera mil. Lo dije con claridad en lugar de fingir que la elección era puramente estadística.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo se relaciona el F1 con lo que acabas de describir, y cuándo es un resumen equivocado?
- ¿Y si se desconoce el coste de un falso negativo?
- ¿Cómo comunicarías esa elección de umbral a un equipo de cumplimiento?
Más preguntas para Científico de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas