Ingira e fatie os documentos com divisão consciente da estrutura, gere embeddings dos chunks e indexe num vector store junto com metadados para filtragem. No momento da query, gere o embedding da pergunta, recupere candidatos, opcionalmente reordene com um cross encoder, e monte um prompt com as passagens recuperadas e citações. Avalie recuperação e geração separadamente, e mantenha o índice atualizado conforme os documentos mudam.
Por que os entrevistadores perguntam isso
RAG é o sistema de ML aplicado mais comum sendo construído hoje, então entrevistadores querem saber se você consegue raciocinar sobre ele como sistema de engenharia em vez de demo. Eles escutam por estratégia de chunking, um estágio de reranking, filtragem por metadados e, acima de tudo, avaliação separada de recuperação e geração, porque a maioria das falhas de RAG são falhas de recuperação diagnosticadas errado como modelo ruim.
Como estruturar sua resposta
- Percorra o caminho offline: fatiar, gerar embeddings, indexar, com metadados.
- Percorra o caminho online: embedding, recuperar, reordenar, montar prompt.
- Insista em avaliar recuperação separadamente da geração.
- Cubra frescura, permissões e citação de fontes.
Exemplo de resposta
No offline, eu fatio por estrutura em vez de por contagem fixa de caracteres, para que títulos e seções fiquem inteiros, com um pouco de sobreposição para que uma frase que cruza uma fronteira não se perca. Cada chunk ganha um embedding mais metadados: fonte, seção, última modificação e grupo de acesso, porque permissões precisam ser aplicadas na recuperação, não pedindo educadamente ao modelo. Isso vai para um índice vetorial com um índice de palavra chave ao lado, já que busca híbrida bate consistentemente vetor puro em documentação interna cheia de códigos de erro e nomes de produto que embeddings tratam mal. No online, eu gero o embedding da query, puxo talvez cinquenta candidatos, reordeno com um cross encoder até cinco ou seis, e aí monto o prompt com essas passagens e instruções para citá las e para dizer claramente quando o contexto não cobre a pergunta. A parte em que eu insisto é a avaliação separada. Eu monto um conjunto de perguntas reais com os documentos fonte corretos conhecidos e meço recall em k só para a recuperação. Na maioria das vezes em que uma resposta está errada, a recuperação nunca trouxe o chunk certo, e nenhuma quantidade de trabalho no prompt conserta isso.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Como você escolheria um tamanho de chunk para um corpus específico?
- O que você faz quando o contexto recuperado se contradiz?
- Como você mantém o índice em sincronia com documentos que mudam diariamente?
Mais perguntas para Engenheiro de Machine Learning
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas