El autoescalado tarda minutos, así que descarta carga primero y escala después. Descarta cuando el cuello de botella es algo a lo que no puedes añadir capacidad rápido, como una base de datos, una dependencia con licencia o un servicio con arranques en frío lentos, o cuando las colas crecen más rápido de lo que podrías vaciarlas nunca. Tira primero el trabajo más barato y menos importante, devuelve 429 con Retry-After y protege las peticiones que llevan ingresos o seguridad.
Por qué lo preguntan los entrevistadores
El entrevistador está probando si entiendes las constantes de tiempo. Quien solo dice escalar no ha sentido el hueco entre que salta la alerta y que la capacidad nueva empieza a servir tráfico. Las buenas respuestas cubren la priorización de clases de tráfico, el peligro de escalar una capa sin estado hacia un cuello de botella con estado, y la degradación elegante como comportamiento diseñado y no como accidente.
Cómo estructurar tu respuesta
- Contrasta el tiempo de descartar (instantáneo) con el de escalar (minutos).
- Identifica primero el cuello de botella, porque escalar la capa equivocada lo empeora.
- Define clases de tráfico y cuáles se descartan primero.
- Especifica el mecanismo: 429 con Retry-After, límites de cola, modo degradado.
Ejemplo de respuesta
Descartar es instantáneo y escalar no, así que bajo sobrecarga real descarto primero y dejo que la capacidad se ponga al día. La pregunta más grande es cuál es de verdad el cuello de botella. Añadir más pods sin estado cuando la restricción son las conexiones a base de datos es genuinamente dañino, porque cada pod nuevo abre un pool y aceleras el colapso. Nos pasó exactamente eso durante una venta relámpago hasta que pusimos un proxy de conexiones delante y limitamos el total. Para descartar me gustan las clases de tráfico explícitas. Las llamadas de checkout y de pago son clase uno y nunca se descartan, la navegación con sesión iniciada es clase dos, y el rastreo anónimo más las llamadas no esenciales de recomendaciones son clase tres y se descartan primero. Lo aplicábamos en el borde con un limitador de concurrencia y devolvíamos 429 con una cabecera Retry-After para que los clientes bien educados se echaran atrás en vez de insistir. Combina eso con un modo degradado que sirva listados cacheados y sigues en pie para el tráfico que importa.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Cómo implementarías límites de concurrencia adaptativos en el borde?
- ¿Qué señal usarías para decidir cuándo empieza el descarte de carga?
- ¿Cómo evitas que el autoescalado empeore un cuello de botella de base de datos?
Más preguntas para Site Reliability Engineer
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas