Necesitas saber dónde viven los datos personales antes de poder borrarlos, así que empieza por la clasificación y el linaje. Prefiere un diseño que evite el problema: seudonimiza en la ingesta y guarda el mapeo de identificadores en un único almacén restringido, de modo que borrar ese mapeo deje el resto sin capacidad de identificar. Donde haya que borrar el dato crudo, usa un formato de tabla que soporte borrados a nivel de fila y sigue la solicitud hasta el final, incluyendo los backups.
Por qué lo preguntan los entrevistadores
Las solicitudes de borrado revelan si una arquitectura se diseñó pensando en gobernanza o se le añadió después. Los entrevistadores quieren la idea del crypto shredding o la tokenización, porque reescribir Parquet inmutable por todo un lake es genuinamente caro. También quieren honestidad sobre las partes difíciles: backups, snapshots, extractos aguas abajo y herramientas de terceros que guardan copias.
Cómo estructurar tu respuesta
- Empieza por clasificación y linaje: no puedes borrar lo que no puedes encontrar.
- Prefiere la seudonimización en la ingesta para que el borrado sea una operación de un solo punto.
- Explica los borrados a nivel de fila en formatos de tabla modernos cuando hace falta borrar el crudo.
- Aborda de forma explícita backups, snapshots y copias aguas abajo.
- Registra la solicitud con evidencia de que se completó.
Ejemplo de respuesta
La primera respuesta honesta es que no puedes borrar lo que no has catalogado, así que esto depende por completo de que la clasificación y el linaje ya estuvieran en su sitio. El diseño que defiendo es la seudonimización en la ingesta: el identificador crudo se sustituye por un token subrogado en la frontera y el mapeo vive en un único almacén restringido. Entonces una solicitud de borrado es sobre todo borrar una fila en ese almacén, tras lo cual nada de lo que hay aguas abajo sigue vinculado a una persona. Eso es mucho más barato que reescribir años de Parquet. Donde hace falta el borrado real, un formato de tabla como Iceberg o Delta te da borrados a nivel de fila sin reescribir particiones enteras a mano. Las partes que la gente olvida son las incómodas: los snapshots y el histórico de viaje en el tiempo, los backups con su propia retención, el CSV que alguien mandó por correo y cualquier herramienta de analítica de terceros que guarde una copia. Yo definiría la ventana de retención de snapshots para que los borrados sean permanentes dentro de ella, lo documentaría, y guardaría un registro auditable de cada solicitud y de cuándo se completó.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Qué es el crypto shredding y cuándo es una estrategia de borrado válida?
- ¿Cómo complican los snapshots de viaje en el tiempo las garantías de borrado?
- ¿Cómo encontrarías datos personales en un lake existente sin documentar?
Más preguntas para Ingeniero de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas