Question d'entretien pour ingénieur data

Quelle est la différence entre ETL et ELT, et pourquoi le secteur a-t-il basculé vers l'ELT ?

Ce que le recruteur cherche à évaluer, comment structurer votre réponse et un exemple parlé à adapter.

Réponse rapide

L'ETL transforme la donnée avant de la charger, en général sur un cluster de calcul séparé. L'ELT charge d'abord la donnée brute dans l'entrepôt, puis la transforme sur place en SQL. Le basculement s'est produit parce que les entrepôts cloud ont rendu le stockage bon marché et le calcul élastique : garder le brut et transformer sur place permet d'itérer plus vite, d'auditer plus facilement et de retraiter l'historique sans réextraire depuis les systèmes sources.

Pourquoi les recruteurs posent cette question

Cette question vérifie si vous comprenez l'économie derrière les stacks data modernes, et pas seulement les noms des outils. Les recruteurs veulent vous entendre dire que l'ELT préserve la donnée brute, ce qui rend les transformations reproductibles, et que ce n'est pas universellement supérieur : un traitement lourd de données non structurées, des exigences de confidentialité strictes ou une facturation coûteuse à la requête peuvent tous vous ramener vers une transformation avant chargement.

Comment structurer votre réponse

  • Définissez les deux par l'endroit où tourne la transformation.
  • Expliquez l'économie qui a poussé vers l'ELT.
  • Insistez sur la conservation du brut pour le rejeu et l'auditabilité.
  • Donnez les cas où l'ETL reste gagnant.
  • Reliez cela à la façon dont vous structurez les couches dans l'entrepôt.

Exemple de réponse

Exemple parlé, à la première personne

La différence tient uniquement à l'endroit où la transformation se produit. L'ETL transforme en vol, donc ce qui atterrit dans l'entrepôt est déjà modélisé. L'ELT atterrit brut et modélise dans l'entrepôt, en SQL. Si l'ELT s'est imposé, c'est que le stockage est devenu bon marché et le calcul de l'entrepôt élastique : il n'y a plus de bonne raison de jeter le payload brut. Cela compte plus qu'on ne le croit. Quand nous avons trouvé un bug dans notre logique de revenus, nous avons reconstruit dix-huit mois de marts depuis le brut en quarante minutes environ, sans repasser par les API sources, dont certaines ne conservent que quatre-vingt-dix jours. Cela garde aussi la logique de transformation en gestion de version, sous forme de SQL, plutôt que dans un outil propriétaire. Cela dit, je transformerais toujours avant chargement pour des choses comme le décodage de gros fichiers binaires, ou quand je dois supprimer ou tokeniser des données personnelles avant qu'elles ne touchent l'entrepôt, parce qu'on ne décharge pas des données sensibles une fois qu'elles y sont.

Vous passez cet entretien bientôt ? GhostPilot écoute votre appel en direct, repère la question dès qu'elle est posée et affiche une réponse structurée à l'écran en temps réel. Essayez-le lors de votre prochain entretien blanc, ou prenez un Session Pass à $29, sans abonnement, pour le jour J.

Voir comment ça marche

Questions de relance à prévoir

  • Où masqueriez-vous les données personnelles dans un pipeline ELT ?
  • Comment structurez-vous les couches brute, staging et mart ?
  • Dans quel cas une facturation à la requête changerait-elle votre réponse ?

Autres questions pour ingénieur data

Votre recruteur posera sa propre version de celle-ci. Collez votre véritable fiche de poste dans le Question Predictor gratuit et obtenez les 20 questions que ce poste a le plus de chances de poser, avec ce que chacune cherche vraiment à sonder.

Prédire mes questions

Répétez les questions difficiles avant qu'on vous les pose

Entraînez-vous avec un copilote en direct, puis présentez-vous prêt. Un Session Pass à $29 vous accompagne pendant l'entretien, sans abonnement et sans engagement.

Obtenir GhostPilot