Pergunta de entrevista para Engenheiro de Machine Learning

O que você monitora num modelo em produção, e o que de fato aciona o plantão de alguém?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Monitore três camadas: saúde do serviço (latência, taxa de erro, throughput), saúde dos dados (distribuições de entrada, taxas de nulo e de categoria desconhecida, frescura das features) e saúde do modelo (distribuição de previsões e, quando os rótulos chegam, performance). Acione plantão para falhas de serviço e para quebra do pipeline de entrada, porque essas são acionáveis na hora. Mande drift lento para um dashboard e uma revisão, não para o pager às 3 da manhã.

Por que os entrevistadores perguntam isso

Entrevistadores querem ver que você distingue sinais que precisam de um humano agora de sinais que precisam de uma decisão semana que vem. Alertar sobre drift gradual acorda gente para algo que ela não pode resolver às 3 da manhã e treina o time a ignorar alertas. Citar frescura de feature e taxa de categoria desconhecida é um sinal forte, já que um pipeline de features velho ou quebrado é o incidente real mais comum em produção.

Como estruturar sua resposta

  • Divida o monitoramento em camadas de serviço, dados e modelo.
  • Diga qual camada justifica acionar plantão e qual não justifica.
  • Cite frescura de feature e taxa de categoria desconhecida especificamente.
  • Cite o atraso de rótulos e como você monitora antes deles chegarem.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Eu penso nisso como três camadas. Nível de serviço é o de sempre, latência p99, taxa de erro, throughput, e isso aciona plantão, porque um modelo retornando erros é uma indisponibilidade como qualquer outra. Nível de dados é onde os incidentes reais de ML moram: distribuições das features de entrada, taxas de nulo, taxas de categoria desconhecida, e frescura de feature, ou seja qual a idade do valor mais novo na store online. Frescura é a que mais me preocupa, porque um job upstream quebrado não lança erro, ele só serve os valores de ontem e o modelo segue devolvendo besteira com confiança. Isso aciona plantão. Nível de modelo é distribuição de previsões e, quando os rótulos chegam, performance real. Uma distribuição de previsões deslocando de forma abrupta merece um alerta; deslocando devagar é item de dashboard e conversa, não pager, porque acordar alguém por drift gradual significa que em um mês ninguém lê mais os alertas. O que molda tudo isso é o atraso dos rótulos. Se a verdade de campo leva semanas, eu não consigo monitorar acurácia quase em tempo real, então eu me apoio em distribuições de entrada e saída como proxies e digo claramente que são proxies.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Como você detectaria drift numa feature categórica de alta cardinalidade?
  • Qual é um limiar razoável de alerta para deslocamento na distribuição de previsões?
  • Como você monitora um modelo cujos rótulos vêm de revisão humana?

Mais perguntas para Engenheiro de Machine Learning

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot