Você precisa saber onde os dados pessoais vivem antes de conseguir apagá-los, então comece por classificação e linhagem. Prefira um design que evite o problema: pseudonimize na ingestão e mantenha o mapeamento de identificadores em um único repositório restrito, para que apagar esse mapeamento torne o resto não identificável. Onde o dado bruto precisar mesmo ser apagado, use um formato de tabela com suporte a deletes em nível de linha e acompanhe o pedido até a conclusão, incluindo os backups.
Por que os entrevistadores perguntam isso
Pedidos de exclusão expõem se uma arquitetura foi desenhada pensando em governança ou remendada depois. Os entrevistadores querem a ideia de crypto shredding ou tokenização, porque reescrever Parquet imutável por um lake inteiro é realmente caro. Eles também querem honestidade sobre as partes difíceis: backups, snapshots, extrações para outros lugares e ferramentas de terceiros que guardam cópias.
Como estruturar sua resposta
- Comece por classificação e linhagem: você não apaga o que não consegue achar.
- Prefira pseudonimização na ingestão para que a exclusão seja uma operação em um ponto só.
- Explique deletes em nível de linha em formatos de tabela modernos, quando a exclusão do bruto é necessária.
- Trate backups, snapshots e cópias downstream de forma explícita.
- Acompanhe o pedido com evidência de conclusão.
Exemplo de resposta
A primeira resposta honesta é que você não apaga o que não catalogou, então isso depende inteiramente de classificação e linhagem já estarem no lugar. O design que eu defendo é pseudonimização na ingestão: o identificador bruto é trocado por um token substituto na fronteira e o mapeamento vive em um único repositório restrito. Aí um pedido de exclusão é basicamente apagar uma linha nesse repositório, e depois disso nada mais adiante está ligado a uma pessoa. Isso é muito mais barato do que reescrever anos de Parquet. Onde a exclusão de fato é obrigatória, um formato de tabela como Iceberg ou Delta oferece deletes em nível de linha sem reescrever partições inteiras na mão. As partes que as pessoas esquecem são as chatas: snapshots e histórico de viagem no tempo, backups com a própria retenção, extrações em CSV que alguém mandou por e-mail, e qualquer ferramenta de analytics de terceiros guardando uma cópia. Eu definiria a janela de retenção dos snapshots para que as exclusões se tornem permanentes dentro dela, documentaria isso e manteria um registro auditável de cada pedido e da sua conclusão.
Vai encarar essa entrevista em breve? O GhostPilot escuta a sua chamada ao vivo, identifica a pergunta no instante em que ela é feita e coloca uma resposta estruturada na sua tela em tempo real. Teste na sua próxima entrevista simulada ou pegue um Session Pass de $29, sem assinatura, para a hora da verdade.
Veja como funcionaPerguntas de acompanhamento que você pode esperar
- O que é crypto shredding e quando ele é uma estratégia válida de exclusão?
- Como snapshots de viagem no tempo complicam as garantias de exclusão?
- Como você acharia dados pessoais em um lake existente e sem documentação?
Mais perguntas para Engenheiro de Dados
Seu entrevistador vai fazer a própria versão desta. Cole a descrição real da vaga no Question Predictor gratuito e receba as 20 perguntas que essa vaga tem mais chance de fazer, com o que cada uma está de fato sondando.
Prever minhas perguntas