Perfila antes de optimizar: reparte los 400 milisegundos entre obtención de características, preprocesado, el pase hacia delante del modelo y la red, porque el modelo a menudo no es la porción mayor. Luego ataca la pieza más grande. Las ganancias típicas son concurrencia en las consultas de características, caché, cuantización, un runtime compilado, un modelo destilado, y sacar trabajo de la ruta de la petición. Apunta al p99 en concreto, no a la media.
Por qué lo preguntan los entrevistadores
Es una pregunta de sistemas disfrazada de ML, y los entrevistadores quieren verte medir antes de optimizar. Quien propone de inmediato un modelo más pequeño está adivinando. Nombrar los componentes ajenos al modelo, especialmente la obtención de características y la serialización, y saber que una cola muy por encima de la mediana suele significar encolamiento o arranques en frío, son las marcas de alguien que ha operado un servicio.
Cómo estructurar tu respuesta
- Niégate a optimizar antes de tener el desglose de los 400 ms.
- Nombra los componentes que cronometrarías por separado.
- Ordena los arreglos por el tamaño de la porción que atacan.
- Anota que el p99 suele apuntar a encolamiento, arranques en frío o recolección de basura.
Ejemplo de respuesta
No tocaría el modelo hasta tener un desglose. Trazo una petición de extremo a extremo y cronometro la obtención de características, la deserialización, el preprocesado, el pase hacia delante, el posprocesado y la red. Cada vez que he hecho esto en un servicio que se sentía lento, el modelo era la minoría del tiempo. El último rondaba los 400 milisegundos en total, con unos 90 en el modelo y más de 200 esperando tres consultas secuenciales de características contra un almacén remoto. Arreglar eso no era un problema de ML, era lanzarlas de forma concurrente y cachear las dos que solo cambiaban a diario, y solo con eso hicimos casi todo el camino. Después miro el modelo: batching dinámico, cuantización a int8, o exportar a un runtime compilado como ONNX Runtime o TensorRT, que en modelos pequeños suele ser una ganancia de dos o tres veces sin coste de precisión. La otra cosa sobre el p99 en concreto es que una cola tan por encima de la mediana normalmente no es cómputo, es encolamiento bajo carga, un arranque en frío en una réplica nueva, o recolección de basura. Así que compruebo si el p50 ya está bien, porque si lo está, el arreglo es capacidad y pools calientes.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo ayuda el batching dinámico al rendimiento pero perjudica la latencia de una petición suelta?
- ¿Qué cachearías, y cómo lo invalidarías?
- ¿Cómo harías pruebas de carga para encontrar el punto donde la cola se dispara?
Más preguntas para Ingeniero de machine learning
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas