ETL transforma o dado antes de carregá-lo, normalmente em um cluster de computação separado. ELT carrega o dado bruto no warehouse primeiro e depois transforma ali mesmo com SQL. A virada aconteceu porque os warehouses em nuvem deixaram o armazenamento barato e a computação elástica, então guardar o dado bruto e transformar no lugar é mais rápido de iterar, mais fácil de auditar e permite reprocessar o histórico sem reextrair dos sistemas de origem.
Por que os entrevistadores perguntam isso
Isso verifica se você entende a economia por trás das stacks de dados modernas, e não só os nomes das ferramentas. Os entrevistadores querem que você mencione que ELT preserva o dado bruto, o que torna as transformações reprodutíveis, e que ele não é universalmente melhor: processamento pesado de dados não estruturados, requisitos rígidos de privacidade ou cobrança cara por consulta podem empurrar você de volta para transformar antes de carregar.
Como estruturar sua resposta
- Defina os dois pelo lugar onde a transformação roda.
- Explique a economia que impulsionou a virada para ELT.
- Enfatize a preservação do dado bruto para replay e auditoria.
- Dê os casos em que ETL ainda vence.
- Conecte isso com a forma como você estrutura as camadas no warehouse.
Exemplo de resposta
A diferença é só onde a transformação acontece. ETL transforma em trânsito, então o que aterrissa no warehouse já vem modelado. ELT aterrissa o bruto e modela dentro do warehouse com SQL. O motivo pelo qual ELT dominou é que o armazenamento ficou barato e a computação do warehouse ficou elástica, então não existe mais uma boa razão para jogar fora o payload bruto. Isso importa mais do que as pessoas esperam. Quando encontramos um bug na nossa lógica de receita, reconstruímos dezoito meses de marts a partir do bruto em uns quarenta minutos, sem voltar às APIs de origem, algumas das quais só retêm noventa dias. Também mantém a lógica de transformação em controle de versão como SQL, em vez de dentro de uma ferramenta proprietária. Dito isso, eu ainda transformaria antes de carregar em casos como decodificar arquivos binários grandes, ou quando eu preciso descartar ou tokenizar dados pessoais antes que eles cheguem ao warehouse, porque você não consegue descarregar dado sensível depois que ele já está lá.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- Onde você mascararia dados pessoais em um pipeline ELT?
- Como você estrutura as camadas raw, staging e mart?
- Quando a cobrança por consulta mudaria a sua resposta?
Mais perguntas para Engenheiro de Dados
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas