Primero acota: todos los endpoints o uno, todos los usuarios o un tenant, y cuándo empezó exactamente. Alinea esa marca de tiempo con despliegues, cambios de flags y cambios de tráfico. Después baja con la telemetría que ya tienes: trazas para encontrar el span que creció, logs de consultas lentas, saturación del pool de conexiones, CPU y memoria del host. Mitiga primero, sea con un rollback o descartando carga, y busca la causa raíz después.
Por qué lo preguntan los entrevistadores
Depurar bajo presión es la mayor parte de la ingeniería sénior, y el entrevistador quiere método y no adivinanzas. Escucha preguntas de acotación antes que hipótesis, uso de la telemetría que ya deberías tener montada, correlación con cambios, y el criterio de mitigar antes de investigar. Quien empieza a adivinar causas de inmediato tiende a hacer lo mismo durante un incidente real.
Cómo estructurar tu respuesta
- Acota el problema antes de formar una teoría.
- Correlaciona la hora de inicio con despliegues y tráfico.
- Sigue la traza hasta el span más lento.
- Mitiga primero, persigue la causa raíz después.
Ejemplo de respuesta
Lo primero que quiero son fronteras, porque recortan el espacio de búsqueda rápido. ¿Es un endpoint o todos, una región, un tenant, y a qué hora empezó? Después alineo esa marca de tiempo con despliegues, cambios de feature flags y cambios de configuración, porque la mayor parte de las veces algo cambió y la respuesta está justo ahí. Si no cambió nada de nuestro lado, voy a las trazas y busco qué span creció, lo que me dice de inmediato si somos nosotros, la base de datos o una llamada aguas abajo. La base de datos es el sospechoso habitual: una consulta que iba bien con un millón de filas deja de ir bien con diez millones, o falta un índice, o el pool está saturado y el tiempo se va esperando una conexión en vez de ejecutando la consulta. Esa última es traicionera porque cada consulta sigue pareciendo rápida por separado. Y mientras hago todo eso, si hay una mitigación obvia como revertir el último despliegue, la tomo primero. A los clientes les importa la latencia, no mi explicación.
¿Tienes esta entrevista a la vuelta de la esquina? GhostPilot escucha tu llamada en vivo, detecta la pregunta en cuanto la hacen y pone una respuesta estructurada en tu pantalla en tiempo real. Pruébalo en tu próxima entrevista de práctica, o coge un Session Pass de $29, sin suscripción, para la de verdad.
Mira cómo funcionaPreguntas de seguimiento que puedes esperar
- ¿Y si las trazas muestran que el tiempo se va esperando una conexión?
- ¿Cómo distinguirías una consulta lenta de contención de locks?
- ¿Qué añadirías para que esto sea más rápido de diagnosticar la próxima vez?
Más preguntas para Ingeniero de software
Tu entrevistador hará su propia versión de esta. Pega la descripción real del puesto en el Question Predictor gratuito y obtén las 20 preguntas que ese puesto tiene más probabilidades de hacerte, con lo que cada una busca en realidad.
Predecir mis preguntas