Pregunta de entrevista para Site Reliability Engineer

¿Qué es un presupuesto de error y qué debería hacer un equipo cuando se agota?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Un presupuesto de error es la falta de fiabilidad que tu SLO permite. Si el SLO es del 99.9% en 28 días, el presupuesto es el 0.1% de las peticiones, unos 40 minutos de caída total. Los equipos lo gastan en lanzamientos arriesgados, migraciones y experimentos. Cuando se agota, la política escrita suele congelar las entregas de funcionalidades y redirigir al equipo a trabajo de fiabilidad hasta que el presupuesto se recupera en la ventana móvil.

Por qué lo preguntan los entrevistadores

Esto separa a quien ha leído el libro de SRE de quien lo ha vivido. El entrevistador comprueba si tratas el presupuesto como una herramienta de decisión con una política asociada, y no como un dashboard que nadie mira. También quiere oír cómo gestionas la parte política, porque una congelación de entregas solo funciona si la dirección la aprobó de antemano y la vía de excepción está definida.

Cómo estructurar tu respuesta

  • Deriva el presupuesto aritméticamente del SLO para que sea concreto.
  • Di qué gasta el presupuesto: lanzamientos, incidentes, migraciones, dependencias.
  • Describe la política escrita que se activa cuando llega a cero.
  • Menciona las alertas de tasa de consumo como aviso temprano, no como autopsia.
  • Nombra la vía de excepción y quién la aprueba.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

El presupuesto no es más que el inverso del SLO. Con un 99.9% en 28 días teníamos unos 40 minutos de equivalente de caída total para gastar, y los gastábamos a propósito en cosas como una migración de base de datos o un despliegue arriesgado. Lo importante es la política, no el número. La nuestra decía que si quemábamos más de la mitad del presupuesto a mitad de ventana, los canarios se volvían más lentos y todo cambio necesitaba un segundo revisor, y si llegábamos a cero, las entregas de funcionalidades se paraban y el equipo trabajaba en fiabilidad hasta que la ventana móvil se recuperara. Eso lo aprobó la directora de producto antes de que hiciera falta, que es la única razón por la que aguantó la primera vez que lo invocamos. También teníamos alertas de tasa de consumo con varias ventanas, una rápida para un consumo de 14x en una hora y otra lenta para 6x en seis horas, así nos enterábamos durante el incidente y no a final de mes.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Quién puede saltarse una congelación de entregas y qué le cuesta eso al equipo?
  • ¿Cómo configurarías alertas de tasa de consumo con varias ventanas sobre un SLO de 28 días?
  • ¿Y si el presupuesto lo destroza una caída del proveedor de nube que no controlas?

Más preguntas para Site Reliability Engineer

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot