Pregunta de entrevista para Científico de datos

Explica la diferencia entre un random forest y el gradient boosting, y cuándo elegirías cada uno.

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Un random forest entrena muchos árboles profundos en paralelo sobre muestras bootstrap con subconjuntos aleatorios de variables y luego promedia, lo que reduce sobre todo la varianza. El gradient boosting entrena árboles poco profundos de forma secuencial, cada uno ajustando los errores residuales del conjunto hasta ese momento, lo que reduce sobre todo el sesgo. El boosting suele ganar en precisión con datos tabulares pero exige un ajuste cuidadoso; los bosques son mucho más indulgentes tal cual vienen.

Por qué lo preguntan los entrevistadores

Este es el punto de control estándar para ver si entiendes los conjuntos de forma mecánica y no como llamadas a una librería. El discriminador clave es paralelo y reductor de varianza frente a secuencial y reductor de sesgo, más la consecuencia: los bosques rara vez sobreajustan según añades árboles, el boosting sí puede. Los entrevistadores suelen seguir con la tasa de aprendizaje y la parada temprana, así que ten listo por qué una tasa baja con muchas rondas gana a lo contrario.

Cómo estructurar tu respuesta

  • Contrasta el bagging en paralelo con el ajuste secuencial de residuos.
  • Di qué componente del error ataca cada uno.
  • Señala que más árboles es seguro en un bosque y no en el boosting.
  • Da tu opción por defecto y los parámetros de ajuste que importan.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Un bosque hace crecer muchos árboles profundos de forma independiente, cada uno sobre una muestra bootstrap y considerando un subconjunto aleatorio de variables en cada división, y luego los promedia. Los árboles están individualmente sobreajustados y descorrelacionados, así que promediar mata la varianza. El boosting tiene la forma opuesta: árboles poco profundos, construidos de uno en uno, cada árbol nuevo ajustado a los errores que el conjunto todavía comete, así que va royendo el sesgo. La consecuencia que se pierde la gente es qué pasa según añades árboles. En un bosque, más árboles nunca hace daño de verdad, simplemente converge. En el boosting, más árboles acaba sobreajustando, que es por lo que la tasa de aprendizaje y la parada temprana importan tanto. Mi opción por defecto en datos tabulares sigue siendo gradient boosting, normalmente LightGBM o XGBoost, con una tasa de aprendizaje baja y parada temprana sobre un conjunto de validación, porque esa combinación le ha ganado a todo lo demás que he probado en problemas estructurados. Recurro a un bosque cuando quiero una línea base sólida en diez minutos casi sin ajuste, o cuando quiero estimaciones out of bag sin separar un conjunto de validación aparte.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Por qué una tasa de aprendizaje más baja con más rondas suele generalizar mejor?
  • ¿Qué hace el parámetro subsample en gradient boosting?
  • ¿Cuándo seguiría ganando a ambos un modelo lineal simple?

Más preguntas para Científico de datos

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot