Pregunta de entrevista para Site Reliability Engineer

¿Cuándo recurrirías a una traza distribuida en lugar de a una métrica o a un log?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Las métricas te dicen que algo va mal y más o menos dónde. Los logs te dicen qué pasó dentro de un proceso. Las trazas te dicen dónde se fue el tiempo entre servicios para una sola petición. Recurre a una traza cuando la latencia es alta pero ningún servicio parece enfermo por separado, o cuando una petición atraviesa muchos saltos. Las métricas son baratas y agregadas, los logs son detallados y caros, las trazas son muestreadas y relacionales.

Por qué lo preguntan los entrevistadores

Los entrevistadores quieren saber si sabes elegir la herramienta más barata que responde la pregunta en lugar de hacer grep sobre terabytes de logs por reflejo. También indagan en la conciencia de costes, porque las facturas de observabilidad a menudo rivalizan con las de cómputo, y en si entiendes el muestreo: las trazas suelen muestrearse, así que responden bien a preguntas de dónde y mal a preguntas de cuántas veces.

Cómo estructurar tu respuesta

  • Da el papel de cada una de las tres señales en una línea.
  • Nombra el síntoma concreto que hace de una traza el primer movimiento correcto.
  • Menciona la correlación: ids de traza y de span estampados en los logs.
  • Cierra con los compromisos de coste y muestreo.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Lo pienso como tres preguntas. Las métricas responden a si está roto y cuánto, los logs responden a qué pasó en este proceso concreto, y las trazas responden a dónde se fue el tiempo a lo largo de toda la petición. El momento en que recurro a una traza es cuando la latencia global ha subido pero el dashboard de cada servicio individual se ve bien, lo que casi siempre significa que el tiempo está en un salto que no tiene dueño. Nos pasó con un sidecar de la malla de servicios que añadía reintentos que desconocíamos; la traza lo dejó claro en un minuto porque veíamos tres spans idénticos anidados bajo una llamada. El pegamento práctico es meter los ids de traza y de span en cada línea de log, así puedes saltar de una métrica agregada a una traza de ejemplo lenta y de ahí a las líneas de log exactas de esa petición. Y muestrearía las trazas en origen a una tasa baja, con muestreo en cola para errores y peticiones lentas, porque guardarlo todo no compensa la factura.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo decidirías una estrategia de muestreo para las trazas?
  • ¿Qué es un exemplar y cómo enlaza métricas con trazas?
  • ¿Cómo propagas el contexto a través de una cola asíncrona?

Más preguntas para Site Reliability Engineer

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot