Pergunta de entrevista para Engenheiro de Machine Learning

A inferência está custando mais do que o produto rende. Como você cortaria isso sem destruir a qualidade?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Meça o custo por requisição e ache onde ele se concentra, já que o tráfego costuma ser enviesado. Depois aplique, em ordem aproximada: cache de requisições repetidas ou quase duplicadas, cascata para que um modelo barato trate a maioria fácil e só escale casos incertos, quantização mais um runtime compilado, hardware do tamanho certo com batching adequado, e por fim cortar trabalho que ninguém lá na frente consome.

Por que os entrevistadores perguntam isso

Custo é uma restrição de primeira classe hoje, e entrevistadores querem saber se você consegue atacá lo com algo além de um modelo menor. Cascata e cache são os movimentos de maior alavancagem e os que os candidatos mais deixam passar. Começar pela medição, e estar disposto a questionar se toda previsão é de fato usada, mostra que você pensa no sistema e não só no modelo.

Como estruturar sua resposta

  • Comece pelo custo por requisição e por onde ele se concentra.
  • Proponha cache e deduplicação como o ganho mais barato.
  • Explique uma cascata: modelo barato primeiro, escala sob incerteza.
  • Depois hardware, batching e quantização.
  • Pergunte se toda previsão é de fato consumida.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Eu começo pegando o custo por requisição e fatiando ele, porque o tráfego quase sempre é enviesado e uma classe pequena de requisições costuma comer o orçamento. Aí o ganho mais barato geralmente é cache. Num sistema, uma parcela relevante das requisições eram repetições exatas em questão de minutos, e um cache de vida curta chaveado numa entrada normalizada removeu um pedaço da carga com um dia de trabalho. Em seguida vem a cascata. Rode um modelo pequeno e barato em tudo e só escale para o caro quando o pequeno estiver incerto. Se o modelo pequeno resolve com confiança setenta por cento do tráfego, você cortou custo na maior parte dessa fração mantendo acurácia nos casos difíceis, e o limiar de escalonamento é ajustável contra um orçamento de qualidade. Depois disso vem a engenharia: quantização, um runtime compilado, batching dinâmico para o acelerador não ficar ocioso, e checar se estamos em hardware superdimensionado para o modelo. A última pergunta que eu faço é a desconfortável, que é se toda previsão é usada. Eu já achei um pipeline pontuando a base inteira de usuários toda noite quando a tela só mostrava os poucos milhares do topo, e pontuar menos entidades foi a maior economia isolada.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Como você definiria o limiar de escalonamento numa cascata?
  • Que regressão de qualidade você aceitaria por um corte de cinquenta por cento no custo?
  • Como você atribui custo por requisição quando vários modelos compartilham um cluster?

Mais perguntas para Engenheiro de Machine Learning

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot