Pregunta de entrevista para Site Reliability Engineer

La latencia p99 de tu API principal se triplica veinte minutos después de un despliegue. Explícame qué haces.

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Estabiliza antes de investigar: si el momento coincide con el despliegue, haz vuelta atrás o detén el despliegue primero. Después compara la versión vieja y la nueva en los mismos dashboards, mira la tasa de error y la saturación junto a la latencia, y determina si el pico es uniforme o está aislado en un endpoint, un shard o una zona. Las trazas muestran qué salto creció. El análisis de causa raíz llega cuando los usuarios están a salvo.

Por qué lo preguntan los entrevistadores

Es la simulación central de SRE, y a los entrevistadores les importa mucho más tu orden que tu hipótesis. Quieren mitigación antes que diagnóstico, evidencias recogidas de arriba abajo y comprobaciones explícitas contra la suposición de que el despliegue es la causa. El silencio sobre la comunicación y los roles del incidente es un hueco común.

Cómo estructurar tu respuesta

  • Mitiga primero: vuelta atrás o pausa del despliegue, y luego declara el incidente.
  • Confirma el impacto contra el SLO para que la gravedad se base en números.
  • Acota el radio de impacto: qué endpoint, versión, shard o zona.
  • Usa trazas para encontrar el salto que creció y correlaciónalo con el diff.
  • Verifica la recuperación con el SLI de cara al usuario antes de cerrar.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Lo primero, paro la hemorragia. Si un despliegue salió hace veinte minutos y la latencia se ha triplicado, eso es vuelta atrás hasta que se demuestre lo contrario, y con gusto me equivoco sobre la causalidad mientras los usuarios estén bien. En paralelo declaro el incidente para que alguien se haga cargo de las comunicaciones, porque los peores incidentes en los que he estado fueron aquellos en los que las mismas tres personas depuraban y contestaban preguntas en cinco canales. Después compruebo si es uniforme. ¿Es cada endpoint o solo uno? ¿Todos los pods o solo el ReplicaSet nuevo? ¿Una zona de disponibilidad? Eso normalmente reduce el espacio de búsqueda de inmediato. A partir de ahí saco una traza de ejemplo de una petición lenta y miro adónde se fue el tiempo de verdad. Tuvimos uno de estos donde la compilación nueva añadía una llamada de log inofensiva dentro de un bucle que hacía una resolución DNS por iteración, así que el árbol de spans lo dejó claro en segundos. Tras la vuelta atrás confirmo que el p99 está de nuevo por debajo del SLO antes de cerrar nada.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Y si la vuelta atrás no es posible por una migración de esquema?
  • ¿Cómo distinguirías un pico causado por un despliegue de un cambio orgánico de tráfico?
  • ¿Qué comprobarías si solo una zona de disponibilidad estuviera afectada?

Más preguntas para Site Reliability Engineer

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot