Interviewfrage für Site Reliability Engineer

Warum alarmieren wir auf p99-Latenz statt auf Durchschnittslatenz?

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Durchschnitte verstecken den Tail. Ein Service kann im Schnitt bei 80ms liegen, während einer von hundert Requests vier Sekunden braucht, und diese langsamen Requests treffen meist deine schwersten Nutzer. Ein Perzentil beschreibt die echte Verteilung, p99 sagt dir also, was deine am schlechtesten bedienten User tatsächlich erleben. Ein Vorbehalt: Perzentile lassen sich nicht über Hosts mitteln, aggregier sie aus Histogrammen statt aus Werten pro Host.

Warum Interviewer das fragen

Das ist ein Statistik-Test im Ops-Kostüm. Viele Kandidaten können sagen, dass Tail-Latenz zählt, schlagen dann aber vor, p99 über zehn Instanzen zu mitteln, was mathematisch bedeutungslos ist. Interviewer wollen außerdem hören, dass ein einzelner User-Request oft in viele Backend-Aufrufe zerfällt, sodass ein seltener langsamer Aufruf zu einer häufig langsamen Seite wird.

So baust du deine Antwort auf

  • Fang damit an, dass Durchschnitte die Verteilung verschleiern.
  • Gib ein konkretes Beispiel, in dem der Mittelwert gesund aussieht und User leiden.
  • Erklär Fan-out: viele Backend-Aufrufe pro User-Aktion verstärken den Tail.
  • Ergänz den Aggregations-Vorbehalt zu Histogrammen gegen gemittelte Perzentile.

Beispielantwort

Gesprochenes Beispiel, erste Person

Weil der Durchschnitt die eine Zahl ist, die garantiert niemanden beschreibt. Wir hatten einen Endpoint mit rund 90ms im Schnitt und einem konstanten Strom an Beschwerden, und der p99 lag bei knapp über drei Sekunden, alles Kunden mit großen Accounts, die auf einen nicht indexierten Query-Pfad liefen. Der Durchschnitt hat sich nie bewegt, weil diese User 1% des Traffics waren. Dazu kommt der Fan-out-Effekt. Macht eine einzelne Seite dreißig Backend-Aufrufe, bedeutet ein langsamer Aufruf von hundert, dass ein spürbarer Teil der Seitenaufrufe langsam ist, aus Tail-Latenz auf Service-Ebene wird also typische Latenz auf User-Ebene. Worauf ich hinweisen würde, ist die Aggregation. Du kannst p99 nicht über Instanzen mitteln und einen echten p99 bekommen. Wir haben Prometheus-Histogramme exportiert und das Quantil über die gesamte Menge mit histogram_quantile berechnet, was uns zusätzlich erlaubt hat, nach Endpoint und Kundensegment zu schneiden, ohne irgendetwas neu zu berechnen.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Wie würdest du einen korrekten p99 über fünfzig Instanzen berechnen?
  • Wann ist p50 nützlicher als p99?
  • Wie gehst du mit Requests um, die in einen Timeout laufen und nie eine Latenz aufzeichnen?

Weitere Fragen für Site Reliability Engineer

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen