Ingérez et découpez les documents avec un découpage conscient de la structure, embarquez les fragments, et indexez-les dans un magasin vectoriel avec des métadonnées pour le filtrage. À la requête, embarquez la question, récupérez des candidats, reclassez éventuellement avec un cross-encoder, puis construisez un prompt avec les passages récupérés et leurs citations. Évaluez la récupération et la génération séparément, et gardez l'index à jour à mesure que les documents changent.
Pourquoi les recruteurs posent cette question
Le RAG est le système de ML appliqué le plus construit en ce moment, donc les recruteurs veulent savoir si vous savez le raisonner comme un système d'ingénierie plutôt que comme une démo. Ils guettent la stratégie de découpage, une étape de reclassement, le filtrage par métadonnées, et surtout une évaluation séparée de la récupération et de la génération, puisque la plupart des échecs RAG sont des échecs de récupération mal diagnostiqués comme un mauvais modèle.
Comment structurer votre réponse
- Déroulez le chemin hors ligne : découper, embarquer, indexer, avec métadonnées.
- Déroulez le chemin en ligne : embarquer, récupérer, reclasser, prompter.
- Insistez pour évaluer la récupération séparément de la génération.
- Couvrez la fraîcheur, les permissions et la citation des sources.
Exemple de réponse
Hors ligne, je découpe sur la structure plutôt que sur un nombre fixe de caractères, pour que les titres et les sections restent intacts, avec un peu de chevauchement afin qu'une phrase à cheval sur une frontière ne soit pas perdue. Chaque fragment reçoit un embedding plus des métadonnées : source, section, date de dernière modification et groupe d'accès, parce que les permissions doivent être appliquées au moment de la récupération, pas en le demandant gentiment au modèle. Tout ça part dans un index vectoriel avec un index par mots-clés à côté, puisque la recherche hybride bat régulièrement le vectoriel pur sur de la doc interne pleine de codes d'erreur et de noms de produits que les embeddings gèrent mal. En ligne, j'embarque la requête, je remonte peut-être cinquante candidats, je reclasse avec un cross-encoder pour descendre à cinq ou six, puis je construis le prompt avec ces passages et des consignes de les citer et de dire clairement quand le contexte ne couvre pas la question. Le point sur lequel j'insiste, c'est l'évaluation séparée. Je constitue un jeu de vraies questions avec les documents sources corrects connus et je mesure le rappel à k pour la récupération seule. La plupart du temps, quand une réponse est fausse, la récupération n'a jamais fait remonter le bon fragment, et aucun travail sur le prompt ne corrige ça.
Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.
Voir comment ça marcheQuestions de relance à prévoir
- Comment choisiriez-vous une taille de fragment pour un corpus donné ?
- Que faites-vous quand le contexte récupéré se contredit lui-même ?
- Comment gardez-vous l'index synchronisé avec des documents qui changent chaque jour ?
Autres questions pour Ingénieur machine learning
Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.
Prédire mes questions