Tres palancas principales. La cuantización guarda los pesos, y a menudo las activaciones, con menor precisión, típicamente int8 o 4 bits, lo que recorta memoria y acelera la inferencia limitada por memoria a un coste pequeño en precisión. La destilación entrena un estudiante más pequeño para imitar las salidas de un profesor grande. El podado elimina pesos o estructuras enteras. La cuantización suele ir primero porque no requiere reentrenar.
Por qué lo preguntan los entrevistadores
El coste de servir es una restricción real en todo equipo de ML, y los entrevistadores quieren ver una jerarquía y no un único truco. El orden importa: cuantización posentrenamiento primero porque es barata, luego destilación si te puedes permitir un ciclo de entrenamiento, y después podado estructurado. Saber que el podado no estructurado rara vez produce aceleraciones reales sin soporte de hardware es un discriminador fuerte.
Cómo estructurar tu respuesta
- Nombra las tres palancas con una línea cada una.
- Di cuál pruebas primero y por qué es la más barata.
- Distingue el podado estructurado del no estructurado en cuanto a aceleración real.
- Ancla la decisión en el objetivo de latencia o memoria que te dieron.
Ejemplo de respuesta
Empiezo preguntando contra qué restricción estamos chocando de verdad, porque memoria, latencia y coste apuntan a arreglos distintos. Suponiendo que sean las tres, la cuantización es lo primero que pruebo, ya que int8 posentrenamiento no requiere reentrenar, suele llevar una tarde, y en inferencia limitada por memoria a menudo da una aceleración casi lineal por una fracción de punto de precisión. Si int8 duele demasiado miro dónde: normalmente es un puñado de capas con rangos de activación amplios, así que escalas por canal o dejar esas capas en mayor precisión recupera casi todo. Si la cuantización no basta, lo siguiente es la destilación, entrenar un estudiante más pequeño con las salidas suaves del profesor, lo que típicamente supera a entrenar ese mismo modelo pequeño desde cero solo con etiquetas. Eso cuesta un ciclo de entrenamiento completo, así que es un compromiso mayor. El podado es lo que menos uso, y tengo cuidado de decir estructurado, es decir cabezas o canales enteros, porque la dispersión no estructurada te da un checkpoint más pequeño y casi ninguna ganancia de tiempo real salvo que el hardware soporte kernels dispersos. Y mido el p99 de extremo a extremo, no FLOPs, porque en pilas de servicio reales la tokenización y la carga de datos pueden dominar.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cuál es la diferencia entre cuantización posentrenamiento y entrenamiento consciente de la cuantización?
- ¿Por qué la destilación con objetivos suaves supera a entrenar el modelo pequeño directamente?
- ¿Cómo decidirías qué pérdida de precisión estás dispuesto a aceptar?
Más preguntas para Ingeniero de machine learning
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas