Meça o custo por requisição e ache onde ele se concentra, já que o tráfego costuma ser enviesado. Depois aplique, em ordem aproximada: cache de requisições repetidas ou quase duplicadas, cascata para que um modelo barato trate a maioria fácil e só escale casos incertos, quantização mais um runtime compilado, hardware do tamanho certo com batching adequado, e por fim cortar trabalho que ninguém lá na frente consome.
Por que os entrevistadores perguntam isso
Custo é uma restrição de primeira classe hoje, e entrevistadores querem saber se você consegue atacá lo com algo além de um modelo menor. Cascata e cache são os movimentos de maior alavancagem e os que os candidatos mais deixam passar. Começar pela medição, e estar disposto a questionar se toda previsão é de fato usada, mostra que você pensa no sistema e não só no modelo.
Como estruturar sua resposta
- Comece pelo custo por requisição e por onde ele se concentra.
- Proponha cache e deduplicação como o ganho mais barato.
- Explique uma cascata: modelo barato primeiro, escala sob incerteza.
- Depois hardware, batching e quantização.
- Pergunte se toda previsão é de fato consumida.
Exemplo de resposta
Eu começo pegando o custo por requisição e fatiando ele, porque o tráfego quase sempre é enviesado e uma classe pequena de requisições costuma comer o orçamento. Aí o ganho mais barato geralmente é cache. Num sistema, uma parcela relevante das requisições eram repetições exatas em questão de minutos, e um cache de vida curta chaveado numa entrada normalizada removeu um pedaço da carga com um dia de trabalho. Em seguida vem a cascata. Rode um modelo pequeno e barato em tudo e só escale para o caro quando o pequeno estiver incerto. Se o modelo pequeno resolve com confiança setenta por cento do tráfego, você cortou custo na maior parte dessa fração mantendo acurácia nos casos difíceis, e o limiar de escalonamento é ajustável contra um orçamento de qualidade. Depois disso vem a engenharia: quantização, um runtime compilado, batching dinâmico para o acelerador não ficar ocioso, e checar se estamos em hardware superdimensionado para o modelo. A última pergunta que eu faço é a desconfortável, que é se toda previsão é usada. Eu já achei um pipeline pontuando a base inteira de usuários toda noite quando a tela só mostrava os poucos milhares do topo, e pontuar menos entidades foi a maior economia isolada.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você definiria o limiar de escalonamento numa cascata?
- Que regressão de qualidade você aceitaria por um corte de cinquenta por cento no custo?
- Como você atribui custo por requisição quando vários modelos compartilham um cluster?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas