Las medias esconden la cola. Un servicio puede promediar 80ms mientras una petición de cada cien tarda cuatro segundos, y esas peticiones lentas suelen caer en tus usuarios más grandes. Un percentil describe la distribución real, así que el p99 te dice lo que experimentan de verdad tus usuarios peor servidos. Un matiz: los percentiles no se pueden promediar entre máquinas, así que agrégalos desde histogramas en lugar de promediar valores por instancia.
Por qué lo preguntan los entrevistadores
Es una prueba de cultura estadística disfrazada de pregunta de operaciones. Mucha gente sabe decir que la latencia de cola importa, pero luego propone promediar el p99 de diez instancias, que matemáticamente no significa nada. Los entrevistadores también quieren oír que una sola petición de usuario a menudo se abre en muchas llamadas de backend, así que una llamada lenta poco frecuente se convierte en una página lenta frecuente.
Cómo estructurar tu respuesta
- Empieza por el hecho de que las medias ocultan la distribución.
- Da un ejemplo concreto donde la media parece sana y los usuarios sufren.
- Explica el abanico de llamadas: muchas llamadas de backend por acción amplifican la cola.
- Añade el matiz de agregación sobre histogramas frente a promediar percentiles.
Ejemplo de respuesta
Porque la media es el único número que tiene garantizado no describir a nadie. Teníamos un endpoint con una media de unos 90ms y un goteo constante de quejas, y el p99 estaba justo por encima de tres segundos, todo ello clientes con cuentas grandes que caían en una consulta sin índice. La media nunca se movió porque esos usuarios eran el 1% del tráfico. También hay un efecto de abanico. Si una sola página hace treinta llamadas de backend, una llamada lenta de cada cien significa que una parte considerable de las cargas de página son lentas, así que la latencia de cola a nivel de servicio se convierte en latencia típica a nivel de usuario. Lo que señalaría es la agregación. No puedes promediar el p99 entre instancias y obtener un p99 real. Nosotros exportábamos histogramas de Prometheus y calculábamos el cuantil sobre el conjunto entero con histogram_quantile, lo que además nos permitía segmentar por endpoint y por nivel de cliente sin recalcular nada.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo calcularías un p99 correcto sobre cincuenta instancias?
- ¿Cuándo es más útil el p50 que el p99?
- ¿Cómo manejas las peticiones que expiran y nunca registran una latencia?
Más preguntas para Site Reliability Engineer
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas