Una buena alerta es urgente, accionable y ligada al impacto en el usuario, con un enlace al runbook adjunto. Cualquier otra cosa debería ser un ticket o un dashboard. Para limpiar una rotación, saca un mes de avisos, cuéntalos por regla de alerta, y borra o degrada todo lo que se cierra de forma rutinaria sin ninguna acción. Sustituye las alertas basadas en causa por alertas basadas en síntoma sobre la tasa de consumo del SLO, y fija un presupuesto de avisos por turno.
Por qué lo preguntan los entrevistadores
La fatiga de alertas es un riesgo real de fiabilidad, porque una rotación que avisa cuarenta veces por semana entrena a la gente a ignorar la que importa. Los entrevistadores quieren un proceso de limpieza guiado por datos, la distinción entre síntoma y causa, y pruebas de que de verdad borrarías alertas en vez de añadir más. Nombrar una tasa objetivo de avisos demuestra que has llevado una rotación.
Cómo estructurar tu respuesta
- Enuncia las tres pruebas que debe pasar un aviso: urgente, accionable, con impacto en el usuario.
- Saca los datos: avisos por alerta, por turno y qué acción se tomó.
- Borra o degrada las alertas que nunca llevan a una acción.
- Pasa de alertas basadas en causa a alertas de tasa de consumo del SLO.
- Fija un presupuesto de avisos y trata superarlo como un defecto.
Ejemplo de respuesta
Mi prueba es sencilla: ¿necesita a una persona ahora mismo, puede esa persona hacer algo al respecto, y le importa a algún usuario? Si alguna respuesta es no, es un ticket o un gráfico, no un aviso. Para limpiar siempre parto de los datos, así que exporto un mes de avisos agrupados por regla de alerta y añado una columna con lo que hizo de verdad quien respondió. La última vez que lo hice, cuatro reglas suponían más del 70% de los avisos y todas se resolvían con un acuse de recibo y ninguna acción. Esas se borraron, no se ajustaron. Después sustituí un muro de reglas basadas en causa, como disco al 80% o pod reiniciado, por alertas de tasa de consumo sobre el SLO, así avisamos cuando los usuarios están sufriendo a un ritmo que agotará el presupuesto de error, y dejamos que las causas aparezcan en los dashboards durante la investigación. Fijamos un objetivo de menos de dos avisos por turno y tratábamos superarlo como un defecto con su ticket, lo que mantenía la cosa honesta.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo estructurarías juntas las alertas de consumo rápido y lento?
- ¿Qué haces con una alerta ruidosa que de vez en cuando es real?
- ¿Cómo manejarías a un equipo que se resiste a borrar sus alertas?
Más preguntas para Site Reliability Engineer
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas