Três alavancas principais. Quantização guarda pesos e muitas vezes ativações em precisão menor, tipicamente int8 ou 4 bits, cortando memória e acelerando inferência limitada por memória a um custo pequeno de acurácia. Distillation treina um aluno menor para reproduzir as saídas de um professor grande. Pruning remove pesos ou estruturas inteiras. Quantização normalmente vem primeiro porque não precisa de retreino.
Por que os entrevistadores perguntam isso
Custo de serving é uma restrição real em todo time de ML, e entrevistadores querem ver uma hierarquia em vez de um truque só. A ordem importa: quantização pós treino primeiro porque é barata, depois distillation se você tem orçamento para um ciclo de treino, depois pruning estruturado. Saber que pruning não estruturado raramente produz ganho real de velocidade sem suporte de hardware é um discriminante forte.
Como estruturar sua resposta
- Cite as três alavancas em uma linha cada.
- Diga qual você tenta primeiro e por que é a mais barata.
- Distinga pruning estruturado de não estruturado quanto a ganho real.
- Ancore a decisão na meta de latência ou memória que te deram.
Exemplo de resposta
Eu começo perguntando qual restrição estamos batendo de verdade, porque memória, latência e custo apontam para correções diferentes. Assumindo que sejam as três, a quantização é a primeira coisa que eu tento, já que int8 pós treino não precisa de retreino, costuma levar uma tarde, e em inferência limitada por memória ela normalmente dá um ganho quase linear por uma fração de ponto de acurácia. Se int8 dói demais eu olho onde: normalmente é um punhado de camadas com faixas de ativação largas, então escalas por canal ou deixar essas camadas em precisão maior recupera quase tudo. Se a quantização não basta, distillation é a próxima, treinando um aluno menor com as saídas suaves do professor, o que tipicamente bate treinar esse mesmo modelo pequeno do zero só com rótulos. Isso custa um ciclo inteiro de treino, então é um compromisso maior. Pruning eu uso menos, e tomo o cuidado de dizer estruturado, ou seja heads ou canais inteiros, porque esparsidade não estruturada te dá um checkpoint menor e quase nenhum ganho de tempo real a menos que o hardware suporte kernels esparsos. E eu meço p99 fim a fim, não FLOPs, porque em stacks de serving reais tokenização e carregamento de dados podem dominar.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Qual é a diferença entre quantização pós treino e quantization aware training?
- Por que distillation com alvos suaves bate treinar o modelo pequeno diretamente?
- Como você decidiria a perda de acurácia que está disposto a aceitar?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas