ETL transforma los datos antes de cargarlos, normalmente en un clúster de cómputo aparte. ELT carga los datos crudos primero en el warehouse y luego los transforma allí con SQL. El cambio ocurrió porque los warehouses en la nube abarataron el almacenamiento e hicieron elástico el cómputo, así que conservar el dato crudo y transformar en el sitio es más rápido de iterar, más fácil de auditar y te permite reprocesar el histórico sin volver a extraer de los sistemas origen.
Por qué lo preguntan los entrevistadores
Esto comprueba si entiendes la economía detrás del stack de datos moderno y no solo los nombres de las herramientas. Los entrevistadores quieren que menciones que ELT preserva el dato crudo, de modo que las transformaciones se vuelven reproducibles, y que no es universalmente mejor: procesamiento pesado de datos no estructurados, requisitos estrictos de privacidad o facturación cara por consulta pueden empujarte de vuelta a transformar antes de cargar.
Cómo estructurar tu respuesta
- Define ambos por el lugar donde corre la transformación.
- Explica la economía que impulsó el cambio hacia ELT.
- Insiste en conservar el dato crudo para replay y auditoría.
- Da los casos en los que ETL sigue ganando.
- Conéctalo con cómo estructuras las capas dentro del warehouse.
Ejemplo de respuesta
La diferencia es simplemente dónde ocurre la transformación. ETL transforma en vuelo, así que lo que aterriza en el warehouse ya viene modelado. ELT aterriza crudo y lo modela dentro del warehouse con SQL. La razón por la que ELT se impuso es que el almacenamiento se abarató y el cómputo del warehouse se volvió elástico, así que ya no hay una buena razón para tirar el payload crudo. Eso importa más de lo que la gente espera. Cuando encontramos un bug en nuestra lógica de ingresos, reconstruimos dieciocho meses de marts desde crudo en unos cuarenta minutos, sin volver a las APIs origen, algunas de las cuales solo retienen noventa días. También mantiene la lógica de transformación en control de versiones como SQL en vez de dentro de una herramienta propietaria. Dicho eso, yo seguiría transformando antes de cargar para cosas como decodificar ficheros binarios grandes, o cuando necesito eliminar o tokenizar datos personales antes de que toquen el warehouse, porque no puedes descargar datos sensibles una vez que ya están dentro.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Dónde enmascararías los datos personales en un pipeline ELT?
- ¿Cómo estructuras las capas raw, staging y mart?
- ¿Cuándo cambiaría tu respuesta una facturación por consulta?
Más preguntas para Ingeniero de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas