Pergunta de entrevista para Cientista de Dados

Como você registra os experimentos para conseguir reproduzir um modelo seis meses depois?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Versione quatro coisas juntas: código, dados, configuração e ambiente. Use uma ferramenta de tracking como MLflow ou Weights and Biases para registrar parâmetros, métricas e artefatos por execução; fixe os dados com um snapshot datado em vez de uma consulta ao vivo; mantenha os hiperparâmetros em arquivos de configuração no git; e registre as versões dos pacotes. O artefato do modelo deve carregar o SHA do git que o produziu.

Por que os entrevistadores perguntam isso

Perguntas de reprodutibilidade separam quem já manteve um modelo de quem só construiu um. O entrevistador quer os quatro eixos nomeados, em especial o versionamento dos dados, já que é o que a maioria esquece e o que quebra a reprodução em silêncio. Amarrar o artefato do modelo a um commit específico é a prática concreta que prova que você já teve que fazer isso na raiva.

Como estruturar sua resposta

  • Nomeie as quatro coisas que precisam ser versionadas juntas.
  • Diga qual ferramenta você usa para tracking por execução e o que você registra.
  • Explique como você fixa os dados, e não só o código.
  • Cite o ambiente e o SHA do git no artefato.

Exemplo de resposta

Exemplo falado, em primeira pessoa

A regra que eu sigo é que um modelo só é reprodutível se código, dados, configuração e ambiente estiverem todos fixados. Código é fácil, é o git. Configuração eu mantenho em YAML no repositório em vez de em células de notebook, então os hiperparâmetros exatos vivem no histórico de commits. Ambiente é um arquivo de lock e uma tag de imagem de container. Dados é o que pega as pessoas, e pegou a mim: uma vez eu tentei reproduzir um modelo de quatro meses antes, tinha o código e os parâmetros exatos, e obtive um resultado diferente, porque a consulta de treino puxava de uma tabela que tinha sido reprocessada nesse meio tempo. Agora o treino lê de um snapshot datado com contagem de linhas e checksum registrados, nunca de uma consulta ao vivo. Para tracking eu uso MLflow, registrando parâmetros, métricas, a lista de features e o artefato do modelo por execução, e o artefato carrega o SHA do git e o ID do snapshot de dados nos metadados. Assim um modelo em produção é rastreado até uma execução exata e a execução pode ser repetida. É cerca de uma hora de configuração e já me poupou semanas.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Como você versiona um dataset grande demais para tirar snapshot?
  • O que você registra em uma execução que falha?
  • Como você compararia cinquenta execuções de ajuste sem se afogar nelas?

Mais perguntas para Cientista de Dados

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot