L1 (lasso) añade a la pérdida la suma de los valores absolutos de los coeficientes y lleva algunos exactamente a cero, así que hace selección de variables. L2 (ridge) añade la suma de los coeficientes al cuadrado, encogiéndolo todo hacia cero sin eliminar nada, lo que maneja los predictores correlacionados con más elegancia. Elige L1 cuando quieras un modelo disperso y explicable; elige L2 cuando los predictores estén correlacionados y quieras estabilidad.
Por qué lo preguntan los entrevistadores
Cualquiera puede recitar lasso frente a ridge. El entrevistador quiere la razón geométrica o práctica por la que L1 produce ceros exactos, y quiere oír que escalas las variables primero, porque ambas penalizaciones no significan nada sobre datos sin escalar. Mencionar elastic net como opción pragmática por defecto y describir cómo eliges la fuerza de la penalización por validación cruzada separa a un profesional de quien repite una frase de libro de texto.
Cómo estructurar tu respuesta
- Enuncia el término de penalización de cada una en lenguaje llano.
- Explica por qué L1 llega a ceros exactos y L2 no.
- Menciona que hay que escalar las variables para que cualquiera de las penalizaciones signifique algo.
- Di cómo eliges la fuerza y nombra elastic net como término medio.
Ejemplo de respuesta
L2 eleva al cuadrado los coeficientes y los encoge todos suavemente hacia cero. L1 usa valores absolutos y, como esa penalización tiene un pico en cero, el óptimo cae a menudo exactamente en cero, que es la razón por la que lasso sirve también como selección de variables. La regla práctica que uso tiene que ver con la correlación. Si tengo un bloque de predictores muy correlacionados, lasso elige uno casi de forma arbitraria y pone a cero el resto, lo cual queda ordenado pero es inestable: reajusta sobre una muestra bootstrap y elige otro distinto. Ridge los mantiene todos y reparte el peso, que suele ser más honesto. Si un interesado necesita una lista corta de factores, uso lasso y acepto la inestabilidad, pero digo en voz alta que los supervivientes son representantes de un grupo correlacionado y no lo único que importa. En la práctica suelo recurrir a elastic net para tener algo de dispersión sin la elección arbitraria, y ajusto la fuerza por validación cruzada. Y siempre estandarizo primero, porque si no, la penalización solo castiga a la variable que casualmente esté medida en unidades pequeñas.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Por qué la penalización L1 produce ceros exactos desde el punto de vista geométrico?
- ¿Qué les pasa a los coeficientes de ridge cuando la penalización tiende a infinito?
- ¿Cómo ajustarías la fuerza de la penalización si además tienes desbalance de clases?
Más preguntas para Científico de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas