Miss die Kosten pro Request und finde, wo sie sich konzentrieren, denn Traffic ist meist schief verteilt. Dann in grober Reihenfolge: wiederholte oder fast identische Requests cachen, kaskadieren, damit ein billiges Modell die leichte Mehrheit erledigt und nur unsichere Fälle eskaliert, Quantisierung plus kompilierte Runtime, passend dimensionierte Hardware mit ordentlichem Batching, und schließlich Arbeit streichen, die downstream niemand nutzt.
Warum Interviewer das fragen
Kosten sind inzwischen eine erstklassige Randbedingung, und Interviewer wollen wissen, ob du sie mit mehr als einem kleineren Modell angreifen kannst. Kaskadierung und Caching sind die Züge mit dem größten Hebel und die, die Kandidaten am häufigsten übersehen. Bei der Messung zu starten und bereit zu sein zu hinterfragen, ob jede Vorhersage überhaupt genutzt wird, zeigt, dass du an das System denkst und nicht nur an das Modell.
So baust du deine Antwort auf
- Starte bei den Kosten pro Request und wo sie sich konzentrieren.
- Schlag Caching und Deduplizierung als billigsten Gewinn vor.
- Erklär eine Kaskade: billiges Modell zuerst, bei Unsicherheit eskalieren.
- Dann Hardware, Batching und Quantisierung.
- Frag, ob jede Vorhersage tatsächlich genutzt wird.
Beispielantwort
Ich hole mir zuerst die Kosten pro Request und schneide sie auf, weil Traffic fast immer schief verteilt ist und eine kleine Klasse von Requests dazu neigt, das Budget zu fressen. Der billigste Gewinn ist dann meist Caching. Auf einem System war ein spürbarer Anteil der Requests innerhalb von Minuten exakte Wiederholungen, und ein kurzlebiger Cache mit normalisiertem Input als Key hat für einen Tag Arbeit einen Brocken Last entfernt. Als Nächstes Kaskadierung. Lass ein kleines billiges Modell auf allem laufen und eskaliere nur dann zum teuren, wenn das kleine unsicher ist. Wenn das kleine Modell siebzig Prozent des Traffics souverän erledigt, hast du die Kosten um den größten Teil dieses Anteils gesenkt und behältst die Genauigkeit auf den schweren Fällen, und die Eskalationsschwelle ist gegen ein Qualitätsbudget einstellbar. Danach kommt das Engineering: Quantisierung, eine kompilierte Runtime, Dynamic Batching, damit der Beschleuniger nicht leerläuft, und die Prüfung, ob wir auf Hardware sitzen, die für das Modell überdimensioniert ist. Die letzte Frage ist die unangenehme, nämlich ob jede Vorhersage überhaupt genutzt wird. Ich habe mal eine Pipeline gefunden, die nächtlich die gesamte Nutzerbasis gescort hat, obwohl die Oberfläche immer nur die obersten paar tausend angezeigt hat, und weniger Entities zu scoren war die größte Einzelersparnis.
Steht dieses Vorstellungsgespräch bald an? GhostPilot hört bei deinem Live-Call mit, erkennt die Frage in dem Moment, in dem sie gestellt wird, und bringt dir eine strukturierte Antwort in Echtzeit auf den Bildschirm. Probier es im nächsten Mock aus, oder hol dir einen $29 Session Pass, kein Abo, für den Ernstfall.
So funktioniert esNachfragen, mit denen du rechnen solltest
- Wie würdest du die Eskalationsschwelle in einer Kaskade setzen?
- Welche Qualitätsregression würdest du für fünfzig Prozent Kostensenkung akzeptieren?
- Wie schlüsselst du Kosten pro Request auf, wenn mehrere Modelle sich einen Cluster teilen?
Weitere Fragen für Machine Learning Engineer
Dein Interviewer stellt seine eigene Version davon. Kopier deine echte Stellenbeschreibung in den kostenlosen Question Predictor und bekomm die 20 Fragen, die diese Rolle am wahrscheinlichsten stellt, samt dem, worauf jede wirklich abzielt.
Meine Fragen vorhersagen