Metriken sagen dir, dass etwas kaputt ist und grob wo. Logs sagen dir, was innerhalb eines Prozesses passiert ist. Traces sagen dir, wo für einen einzelnen Request über Services hinweg die Zeit hingegangen ist. Greif zum Trace, wenn die Latenz hoch ist, aber kein einzelner Service ungesund aussieht, oder wenn ein Request viele Hops überquert. Metriken sind billig und aggregiert, Logs sind detailliert und teuer, Traces sind gesampelt und relational.
Warum Interviewer das fragen
Interviewer wollen wissen, ob du das günstigste Werkzeug wählst, das die Frage beantwortet, statt reflexhaft Terabytes an Logs zu greppen. Sie prüfen auch Kostenbewusstsein, denn Observability-Rechnungen erreichen oft die Höhe der Compute-Rechnungen, und ob du Sampling verstehst: Traces sind meist gesampelt, sie beantworten Wo-Fragen gut und Wie-oft-Fragen schlecht.
So baust du deine Antwort auf
- Gib die Rolle jedes der drei Signale in je einem Satz.
- Nenn das konkrete Symptom, das einen Trace zum richtigen ersten Schritt macht.
- Erwähn Korrelation: Trace- und Span-IDs in den Logs.
- Schließ mit den Trade-offs bei Kosten und Sampling.
Beispielantwort
Ich denke in drei Fragen. Metriken beantworten, ob und wie stark etwas kaputt ist, Logs beantworten, was in genau diesem Prozess passiert ist, und Traces beantworten, wo über den gesamten Request die Zeit hingegangen ist. Zum Trace greife ich in dem Moment, in dem die Gesamtlatenz hoch ist, aber jedes einzelne Service-Dashboard gut aussieht, denn dann steckt die Zeit fast immer in einem Hop, den niemand besitzt. Das ist uns mit einem Service-Mesh-Sidecar passiert, der Retries hinzugefügt hat, von denen wir nichts wussten. Der Trace hat es in etwa einer Minute offensichtlich gemacht, weil wir drei identische Spans unter einem Aufruf verschachtelt gesehen haben. Der praktische Klebstoff ist, Trace- und Span-IDs in jede Logzeile zu schreiben, damit du von einer aggregierten Metrik zu einem langsamen Exemplar-Trace und von dort zu den exakten Logzeilen dieses Requests springen kannst. Und ich würde Traces head-based mit niedriger Rate sampeln, dazu tail-based Sampling für Fehler und langsame Requests, denn alles aufzuheben ist die Rechnung nicht wert.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie würdest du eine Sampling-Strategie für Traces festlegen?
- Was ist ein Exemplar und wie verbindet es Metriken mit Traces?
- Wie propagierst du Kontext durch eine asynchrone Queue?
Weitere Fragen für Site Reliability Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen