Interviewfrage für Machine Learning Engineer

Warum nutzen Transformer Layer Normalization statt Batch Normalization?

Worauf der Interviewer abzielt, wie du deine Antwort aufbaust und ein gesprochenes Beispiel zum Anpassen.

Kurzantwort

Batch Norm normalisiert jedes Feature über den Batch, seine Statistiken hängen also von der Batch-Zusammensetzung und vom Sequenz-Padding ab, und es verhält sich zur Inferenzzeit anders, weil es dort laufende Durchschnitte nutzt. Layer Norm normalisiert über die Features eines einzelnen Tokens, unabhängig von Batch und Sequenzlänge, was es für variable Längen, kleine Batches und autoregressives Decoding stabil macht.

Warum Interviewer das fragen

Das trennt Leute, die wissen, welchen Layer man nimmt, von Leuten, die wissen warum. Der Interviewer prüft, ob du verstehst, über welche Achse jede Normalisierung arbeitet, und die praktischen Folgen: Batch-Abhängigkeit zur Inferenzzeit, Probleme mit Padding und kleinen Batches und die Diskrepanz zwischen Training und Test. Pre-Norm gegen Post-Norm und RMSNorm zu erwähnen ist ein starker Bonus.

So baust du deine Antwort auf

  • Sag, über welche Achse jede der beiden normalisiert.
  • Erklär, warum Batch-Statistiken bei variabler Sequenzlänge kaputtgehen.
  • Nenn die Diskrepanz zwischen Training und Inferenz bei Batch Norm.
  • Erwähn Pre-Norm-Platzierung und RMSNorm als modernen Default.

Beispielantwort

Gesprochenes Beispiel, erste Person

Sie normalisieren über verschiedene Achsen. Batch Norm nimmt ein einzelnes Feature und normalisiert es über alle Beispiele im Batch. Layer Norm nimmt ein einzelnes Beispiel, oder ein einzelnes Token, und normalisiert über dessen Features. Dieser Unterschied entscheidet alles Weitere. Bei Text hast du variable Sequenzlängen und Padding, die Batch-Statistiken werden also von Pad-Tokens verunreinigt und verschieben sich je nachdem, was zufällig zusammen im Batch lag. Batch Norm schleppt außerdem den Train-Inference-Mismatch mit, du trainierst auf Batch-Statistiken und servierst auf laufenden Durchschnitten, und beim autoregressiven Decoding generierst du oft ein Token nach dem anderen mit einem Batch von eins, wo Batch-Statistiken bedeutungslos sind. Layer Norm hat überhaupt keine Batch-Abhängigkeit, Training und Inferenz sind identisch und die Batch Size ist egal. Zur Platzierung: moderne Transformer setzen die Norm vor den Sublayer statt danach, weil Pre-Norm den Residual-Pfad sauber hält und dich tiefe Stacks ohne fragilen Warmup-Schedule trainieren lässt. Die meisten aktuellen Modelle sind außerdem auf RMSNorm umgestiegen, das die Mittelwertzentrierung weglässt und nur reskaliert, weil es billiger ist und ungefähr genauso gut funktioniert.

Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.

So funktioniert es

Nachfragen, mit denen du rechnen solltest

  • Was geht kaputt, wenn du Batch Norm mit einer Batch Size von eins nutzt?
  • Warum trainiert Pre-Norm stabiler als Post-Norm?
  • Was lässt RMSNorm weg, und warum ist das am Ende in Ordnung?

Weitere Fragen für Machine Learning Engineer

Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.

Meine Fragen vorhersagen

Üb die harten Fragen, bevor sie gestellt werden

Trainier mit einem Live-Copiloten und geh dann vorbereitet rein. Ein $29 Session Pass bringt dich durch das Vorstellungsgespräch, ohne Abo und ohne Bindung.

GhostPilot holen