Mide antes de recortar. Saca el historial de consultas agrupado por usuario, herramienta y warehouse para encontrar dónde está el gasto de verdad, ya que suele ser un puñado de consultas o un dashboard refrescándose muchísimo más de lo necesario. Luego ataca lo de arriba: añade filtros de partición, materializa los joins pesados repetidos, reduce la frecuencia de refresco de los dashboards, dimensiona bien el cómputo con auto suspend, y pon caducidad a las tablas temporales.
Por qué lo preguntan los entrevistadores
El trabajo de coste es una parte grande del oficio moderno de ingeniería de datos, y los entrevistadores quieren pruebas de que lo abordas con datos y no con reglas generales. Están escuchando los culpables concretos (dashboards con refresco agresivo, SELECT estrella sobre tablas anchas, escaneos sin partición, warehouses ociosos) y las barreras que evitan que el problema vuelva.
Cómo estructurar tu respuesta
- Empieza por el historial de consultas y atribuye el gasto por usuario, herramienta y job.
- Ordena por coste total, no por lo lenta que se siente una consulta.
- Arregla a los mayores culpables con poda, materialización y planificación.
- Dimensiona bien el cómputo y fuerza el auto suspend.
- Pon barreras para que el ahorro se mantenga.
Ejemplo de respuesta
Primero consigo los datos, porque todo el mundo tiene una teoría y la teoría suele estar equivocada. Todo warehouse importante expone historial de consultas con bytes escaneados o créditos consumidos, así que agrupo por usuario, por cuenta de servicio y por warehouse del último mes y ordeno por coste total. El patrón que sigo encontrando es que un puñado de cosas domina. La última vez, el 40% del gasto era un dashboard de BI refrescándose cada quince minutos contra una tabla de eventos cruda para una audiencia de unas seis personas, ninguna de las cuales la miraba más de una vez al día. Moverlo a una tabla preagregada con refresco horario recortó la factura en más de un tercio por sí solo. Después viene la lista de siempre: consultas sin el filtro de partición, SELECT estrella sobre tablas muy anchas, warehouses dimensionados en XL porque alguien tenía prisa, y sin auto suspend, así que quedan ociosos toda la noche. Luego barreras: timeouts de consulta, límites de bytes por usuario, y un dashboard de coste que el equipo mira de verdad cada semana.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo atribuirías el coste de vuelta a cada equipo?
- ¿Cuándo es una vista materializada la solución equivocada?
- ¿Cómo evitas que el coste vuelva a subir tras una limpieza?
Más preguntas para Ingeniero de datos
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas