Decida em quatro eixos: qualidade na sua tarefa específica, custo no seu volume real, requisitos de latência e controle, e restrições de dados ou de conformidade. Comece pela API hospedada com prompting e recuperação para estabelecer uma barra de qualidade de forma barata. Faça fine tuning quando você tem uma tarefa estável com bons dados rotulados, volume alto o bastante para a economia virar, ou uma exigência de manter os dados dentro do seu próprio ambiente.
Por que os entrevistadores perguntam isso
Esta é a pergunta viva de construir versus comprar para times de ML, e entrevistadores querem um framework em vez de uma preferência. As respostas mais fortes insistem em medir a baseline hospedada primeiro, tratam o ponto de cruzamento como um problema aritmético no seu volume real, e contam o custo contínuo de ser dono de um stack de serving em vez de só o treino de fine tuning.
Como estruturar sua resposta
- Cite os quatro eixos de decisão de cara.
- Insista em estabelecer uma baseline hospedada antes de se comprometer.
- Faça a aritmética de volume para onde self hosting compensa.
- Conte o custo contínuo de posse, não só o treino.
- Dê os casos em que conformidade decide na hora.
Exemplo de resposta
Eu empurraria para responder isso com números em vez de preferência. Primeiro, construa a baseline hospedada: um bom prompt, recuperação se a tarefa precisa de contexto, e um conjunto de avaliação. Isso costuma levar dias e nos diz qual qualidade é alcançável, e muitas vezes ela já é boa o bastante, ponto em que fine tuning vira uma solução procurando um problema. Se a qualidade realmente está aquém, eu pergunto se a lacuna é de conhecimento, que recuperação resolve, ou de comportamento e formato, que fine tuning resolve. Depois a economia. O custo hospedado escala linearmente com tokens; self hosting é majoritariamente custo fixo de acelerador, então existe um volume de cruzamento, e eu calculo isso com projeções reais de tráfego em vez de esperanças. Abaixo do cruzamento, self hosting perde antes mesmo de você contar o tempo de um engenheiro. O custo que as pessoas esquecem é a posse: serving, autoscaling, upgrades, reavaliação quando você troca de modelo base, alguém de plantão. Isso é um compromisso permanente. Onde a coisa se decide sozinha é conformidade. Se os dados não podem sair do nosso ambiente, a decisão já está tomada e a discussão é só sobre qual modelo aberto, não sobre se.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você estimaria o volume de cruzamento de forma concreta?
- O que o LoRA muda no custo do fine tuning?
- Como você lidaria com o provedor hospedado descontinuando o modelo em que você construiu?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas