Pergunta de entrevista para Engenheiro de Dados

Qual problema formatos de tabela como Iceberg e Delta Lake resolvem que Parquet puro em object storage não resolve?

O que o entrevistador está avaliando, como estruturar sua resposta e um exemplo falado que você pode adaptar.

Resposta rápida

Arquivos Parquet soltos em um bucket não dão transação nenhuma, então um leitor pode ver um diretório escrito pela metade e um job que falhou deixa dados parciais. Formatos de tabela adicionam uma camada de metadados com commits atômicos e isolamento por snapshot, então as escritas aparecem de uma vez só. Eles também trazem evolução de schema, updates e deletes em nível de linha, viagem no tempo para snapshots anteriores e poda de arquivos por estatísticas em vez de listagem de diretório.

Por que os entrevistadores perguntam isso

Formatos de lakehouse hoje são o padrão na maioria das plataformas novas, e os entrevistadores querem saber se você entende o que eles corrigem, e não apenas que são populares. Boas respostas citam atomicidade e isolamento por snapshot primeiro, mencionam que o particionamento oculto do Iceberg elimina a convenção frágil de caminho de partição e apontam a compactação como manutenção contínua.

Como estruturar sua resposta

  • Diga a dor concreta de diretórios Parquet crus.
  • Explique a camada de metadados e os commits atômicos de snapshot.
  • Liste os recursos que isso libera: updates, deletes, viagem no tempo, evolução.
  • Mencione particionamento oculto versus convenções de diretório.
  • Acrescente o custo de manutenção: compactação e expiração de snapshots.

Exemplo de resposta

Exemplo falado, em primeira pessoa

Com Parquet puro a tabela é na verdade só uma convenção de diretório, então não existe atomicidade. Se um job morre no meio, os leitores enxergam dados parciais, e não tem como atualizar ou apagar uma única linha sem reescrever partições inteiras na mão. Formatos de tabela resolvem isso com uma camada de metadados. Um commit troca o ponteiro para um novo snapshot de forma atômica, então os leitores veem ou o estado antigo ou o novo, nunca uma mistura, e você ganha viagem no tempo quase de graça porque os snapshots antigos continuam existindo. Essa última parte nos salvou uma vez, quando uma transformação ruim sobrescreveu um mart e recuperamos consultando o snapshot anterior em vez de restaurar de backup. A outra coisa que eu gosto no Iceberg especificamente é o particionamento oculto, em que a própria tabela rastreia a transformação de partição, então um analista que filtra por um timestamp ganha poda sem saber do layout. O custo é manutenção: você precisa de compactação agendada de arquivos pequenos e de expiração de snapshots, ou os metadados crescem sem limite.

Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.

Veja como funciona

Perguntas de acompanhamento que você pode esperar

  • Como copy on write e merge on read diferem para updates?
  • O que quebra se você nunca expirar snapshots antigos?
  • Como você migraria uma tabela Parquet existente para Iceberg?

Mais perguntas para Engenheiro de Dados

Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.

Prever minhas perguntas

Ensaie as perguntas difíceis antes que elas apareçam

Pratique com um copiloto ao vivo e depois entre pronto. Um Session Pass de $29 te leva até o fim da entrevista, sem assinatura e sem amarras.

Instalar o GhostPilot