Pregunta de entrevista para Ingeniero de machine learning

La inferencia cuesta más de lo que el producto ingresa. ¿Cómo lo recortarías sin destrozar la calidad?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Mide el coste por petición y encuentra dónde se concentra, ya que el tráfico suele estar sesgado. Luego aplica, en orden aproximado: caché de peticiones repetidas o casi duplicadas, una cascada para que un modelo barato atienda a la mayoría fácil y solo escale los casos inciertos, cuantización más un runtime compilado, hardware bien dimensionado con batching adecuado, y por último recortar el trabajo que nadie aguas abajo consume.

Por qué lo preguntan los entrevistadores

El coste es ahora una restricción de primera clase, y los entrevistadores quieren saber si puedes atacarlo con algo más que un modelo más pequeño. La cascada y la caché son los movimientos de mayor palanca y los que más se le escapan a la gente. Partir de la medición, y estar dispuesto a cuestionar si cada predicción se usa siquiera, demuestra que piensas en el sistema y no solo en el modelo.

Cómo estructurar tu respuesta

  • Parte del coste por petición y de dónde se concentra.
  • Propón caché y deduplicación como la victoria más barata.
  • Explica una cascada: modelo barato primero, escalar ante la incertidumbre.
  • Luego hardware, batching y cuantización.
  • Pregunta si cada predicción se consume de verdad.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Empiezo consiguiendo el coste por petición y troceándolo, porque el tráfico casi siempre está sesgado y una clase pequeña de peticiones tiende a comerse el presupuesto. Después la victoria más barata suele ser la caché. En un sistema, una parte apreciable de las peticiones eran repeticiones exactas en cuestión de minutos, y una caché de vida corta indexada por una entrada normalizada quitó un buen trozo de carga con un día de trabajo. Lo siguiente es la cascada. Ejecuta un modelo pequeño y barato sobre todo y solo escala al caro cuando el pequeño está inseguro. Si el modelo pequeño resuelve con confianza el setenta por ciento del tráfico, has recortado el coste en casi esa fracción manteniendo la precisión en los casos difíciles, y el umbral de escalado es ajustable contra un presupuesto de calidad. Después viene la ingeniería: cuantización, un runtime compilado, batching dinámico para que el acelerador no esté ocioso, y comprobar si estamos en hardware sobredimensionado para el modelo. La última pregunta que hago es la incómoda, que es si se usa cada predicción. Una vez encontré un pipeline puntuando toda la base de usuarios cada noche cuando la superficie solo mostraba los primeros miles, y puntuar menos entidades fue el mayor ahorro individual.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo fijarías el umbral de escalado en una cascada?
  • ¿Qué regresión de calidad aceptarías por un recorte de coste del cincuenta por ciento?
  • ¿Cómo atribuyes el coste por petición cuando varios modelos comparten un clúster?

Más preguntas para Ingeniero de machine learning

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot