Deja que la decisión la marque la rapidez con la que el dato cambia una decisión. Si nadie actúa sobre el dato antes de la mañana siguiente, batch sale más barato, es más simple de razonar y muchísimo más fácil de rellenar hacia atrás. Elige streaming cuando la latencia forma parte del producto, como en scoring de fraude, inventario en vivo o alertas. El streaming te cuesta manejo de exactly once, datos tardíos, gestión de estado y guardia permanente.
Por qué lo preguntan los entrevistadores
Los entrevistadores quieren saber si eliges arquitecturas por razones y no por moda, porque un pipeline de streaming que nadie necesitaba es un impuesto operativo permanente. Están escuchando si mencionas el coste operativo del streaming (estado, watermarks, replay, cambios de esquema sobre un job en marcha) y el punto de que un micro batch de quince minutos satisface la mayoría de los supuestos requisitos de tiempo real.
Cómo estructurar tu respuesta
- Ancla la respuesta en la latencia de decisión que el negocio necesita de verdad.
- Fija el valor por defecto: batch salvo que la latencia sea parte del producto.
- Nombra los costes reales que añade el streaming más allá del camino feliz.
- Ofrece el micro batch como término medio.
- Da un ejemplo de cada uno sacado de tu propio trabajo.
Ejemplo de respuesta
Empiezo preguntando quién actúa sobre esto y con qué rapidez. Si la respuesta es un analista que abre un dashboard a las 9 de la mañana, entonces un job batch nocturno u horario es la decisión correcta, porque es más barato, se puede reprocesar sin drama y puedo volver a ejecutar el martes pasado sin pensarlo demasiado. Me voy a streaming cuando la latencia es realmente parte del producto. En un equipo de pagos mandábamos eventos de transacción en streaming a un modelo de fraude porque una decisión tomada noventa minutos después no vale absolutamente nada. Lo que intento dejar explícito es lo que cuesta el streaming. Heredas stores de estado, watermarks y una política de datos tardíos, además del hecho de que cambiar un esquema sobre un job en marcha es una migración y no un deploy. Muchas veces, cuando un stakeholder dice tiempo real, lo que quiere decir es no mañana, y un micro batch de quince minutos sobre el warehouse le da lo que busca por una fracción de la carga operativa.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo migrarías un pipeline batch existente a streaming?
- ¿Qué resuelve una arquitectura lambda y qué te cuesta?
- ¿Cómo rellenas hacia atrás un pipeline de streaming después de un bug?
Más preguntas para Ingeniero de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas