Pregunta de entrevista para Ingeniero de datos

¿Qué problema resuelven formatos de tabla como Iceberg y Delta Lake que Parquet a secas sobre almacenamiento de objetos no resuelve?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Ficheros Parquet sueltos en un bucket no te dan transacciones, así que un lector puede ver un directorio escrito a medias y un job fallido deja datos parciales. Los formatos de tabla añaden una capa de metadatos con commits atómicos y aislamiento por snapshot, de modo que las escrituras aparecen todas de golpe. También aportan evolución de esquema, actualizaciones y borrados a nivel de fila, viaje en el tiempo a snapshots previos, y poda de ficheros mediante estadísticas en lugar de listar directorios.

Por qué lo preguntan los entrevistadores

Los formatos lakehouse son ya el valor por defecto en la mayoría de plataformas nuevas, y los entrevistadores quieren saber si entiendes qué arreglan y no solo que están de moda. Las respuestas fuertes nombran primero la atomicidad y el aislamiento por snapshot, mencionan que el particionado oculto de Iceberg elimina la frágil convención de rutas de partición, y señalan la compactación como mantenimiento continuo.

Cómo estructurar tu respuesta

  • Expón el dolor concreto de los directorios de Parquet crudo.
  • Explica la capa de metadatos y los commits atómicos por snapshot.
  • Enumera las capacidades que desbloquea: actualizaciones, borrados, viaje en el tiempo, evolución.
  • Menciona el particionado oculto frente a las convenciones de directorios.
  • Añade el coste de mantenimiento: compactación y caducidad de snapshots.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Con Parquet a secas la tabla es en realidad una convención de directorios, así que no hay atomicidad. Si un job muere a mitad, los lectores ven datos parciales, y no hay forma de actualizar o borrar una sola fila sin reescribir particiones enteras a mano. Los formatos de tabla arreglan eso con una capa de metadatos. Un commit intercambia de forma atómica un puntero a un snapshot nuevo, así que los lectores ven o el estado antiguo o el nuevo, nunca una mezcla, y obtienes viaje en el tiempo casi gratis porque los snapshots antiguos siguen existiendo. Esa última parte nos salvó una vez, cuando una transformación mala sobrescribió un mart y recuperamos consultando el snapshot anterior en lugar de restaurar desde backups. La otra cosa que me gusta de Iceberg en concreto es el particionado oculto, donde la tabla rastrea ella misma la transformación de partición, así que un analista que filtra por un timestamp obtiene poda sin conocer la disposición. El coste es mantenimiento: necesitas compactación programada de ficheros pequeños y caducidad de snapshots, o los metadatos crecen sin límite.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿En qué se diferencian copy on write y merge on read para las actualizaciones?
  • ¿Qué se rompe si nunca caducas los snapshots antiguos?
  • ¿Cómo migrarías una tabla Parquet existente a Iceberg?

Más preguntas para Ingeniero de datos

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot