Recoge los eventos con un endpoint ligero hacia un log duradero como Kafka o Kinesis, de modo que los productores queden desacoplados de los consumidores. Valida contra un schema registry en la frontera y manda los fallos a un topic de dead letter. Aterriza los eventos crudos de forma inmutable en almacenamiento de objetos particionado por fecha de evento, y luego transforma en capas limpias y modeladas. Deduplica por id de evento e indexa todo por tiempo de evento.
Por qué lo preguntan los entrevistadores
Esta es una pregunta de diseño abierta que se usa para ver cómo estructuras un sistema y dónde colocas las protecciones. Los entrevistadores buscan un búfer duradero, validación de esquema en el borde, una capa cruda inmutable para replay, un particionado sensato y una historia para duplicados y datos tardíos. Saltar directamente a nombres de herramientas sin describir el flujo es el fallo habitual.
Cómo estructurar tu respuesta
- Aclara volumen, requisito de latencia y quién consume la salida.
- Describe la recogida hacia un log duradero y reproducible.
- Impón el esquema en la frontera con una ruta de dead letter.
- Aterriza el crudo de forma inmutable y luego modela por capas.
- Cubre duplicados, datos tardíos y tratamiento de datos personales.
Ejemplo de respuesta
Preguntaría primero por volumen y latencia, porque cien mil eventos al día y cien mil por segundo son sistemas distintos, y también si alguien necesita de verdad datos por debajo del minuto. Suponiendo un caso normal de analítica de producto, un endpoint colector fino escribe en Kafka, lo que me da durabilidad y me deja reprocesar si un consumidor aguas abajo tiene un bug. En esa frontera valido contra un esquema registrado y empujo todo lo inválido a un topic de dead letter con el motivo, porque descartar eventos malformados en silencio significa enterarte meses después. Los eventos crudos aterrizan en almacenamiento de objetos particionados por fecha de evento, inmutables, y esa capa es la fuente de verdad desde la que siempre puedo reconstruir. A partir de ahí, una capa de transformación limpia, deduplica por id de evento, sesionaliza y modela en tablas de hechos y dimensiones. Los datos personales los trataría en la ingesta, hasheando los identificadores de usuario y guardando el mapeo en un almacén restringido, ya que es mucho más fácil que intentar limpiar un lake después.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo sesionalizarías los eventos y qué define el límite de una sesión?
- ¿Cómo manejas el tráfico de bots en la capa cruda?
- ¿Qué cambia si el cliente es una app móvil que se queda sin conexión?
Más preguntas para Ingeniero de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas