Pregunta de entrevista para Site Reliability Engineer

¿Cuáles son las cuatro señales de oro y cuál instrumentarías primero en un servicio nuevo?

Qué evalúa el entrevistador, cómo estructurar tu respuesta y un ejemplo hablado que puedes adaptar.

Respuesta rápida

Latencia, tráfico, errores y saturación. La latencia es cuánto tardan las peticiones, separando las llamadas exitosas de las fallidas. El tráfico es la demanda, por ejemplo peticiones por segundo. Los errores son la tasa de peticiones fallidas, incluidas las que devuelven 200 con un cuerpo roto. La saturación es cómo de lleno está tu recurso más limitado. Instrumenta primero errores y latencia porque se traducen directamente en dolor para el usuario.

Por qué lo preguntan los entrevistadores

Es un filtro rápido para ver si tienes un modelo mental de observabilidad o solo una lista de herramientas. El desarrollo importa más que la memorización: los entrevistadores quieren oír que separas la latencia por éxito y por fallo (si no, los fallos rápidos maquillan tus números), que la saturación va del recurso limitado y no de un gráfico genérico de CPU, y que empiezas por las señales que los usuarios sienten.

Cómo estructurar tu respuesta

  • Enumera las cuatro con claridad antes de desarrollar ninguna.
  • Añade el matiz de que la latencia de las peticiones fallidas debe separarse.
  • Di qué recurso tratarías como señal de saturación y por qué.
  • Prioriza errores y latencia en un servicio nuevo y justifica el orden.

Ejemplo de respuesta

Ejemplo hablado, en primera persona

Latencia, tráfico, errores, saturación. En un servicio nuevo conectaría primero errores y latencia, porque son las dos que un usuario puede sentir, y me aseguraría de que los histogramas de latencia estén separados por resultado. Eso nos pilló una vez: nuestro p99 mejoró después de un despliegue malo, y era solo porque una parte de las peticiones fallaba en 12ms en lugar de tener éxito en 800ms. El tráfico va después, sobre todo porque da contexto a todas las demás señales y permite detectar una caída a cero, que es la alerta que la gente olvida escribir. La saturación es la que exige pensar de verdad. Para una API sin estado normalmente era nuestro pool de conexiones a base de datos y no la CPU, así que exportábamos el tiempo de espera del pool y las conexiones en uso. La CPU genérica de los nodos nunca nos dijo nada útil. Con esas cuatro en marcha, todo lo demás es un refinamiento y no un dashboard nuevo.

¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.

Mira cómo funciona

Preguntas de seguimiento que puedes esperar

  • ¿Cómo definirías la saturación para un worker basado en colas?
  • ¿Sobre cuál de las cuatro alertarías y cuáles dejarías solo en dashboards?
  • ¿Cómo detectas una petición que devuelve 200 pero funcionalmente es un error?

Más preguntas para Site Reliability Engineer

Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.

Predecir mis preguntas

Ensaya las preguntas difíciles antes de que te las hagan

Practica con un copiloto en vivo y entra preparado. Un Session Pass de $29 te lleva a través de la entrevista sin suscripción y sin ataduras.

Consigue GhostPilot