Warum steigt die GPU-Leistung zu Beginn einer lokalen Inferenzanfrage sprunghaft an?

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Die GPU-Leistungsaufnahme steigt beim Start einer Anfrage häufig sprunghaft an, weil das Hochfahren des Takts und das stark parallelisierte Prefill des Prompts gleichzeitig mehr Rechenleistung aktivieren als die Token-für-Token-Dekodierung.

Ein Heimserver kann leise im Leerlauf arbeiten, kurzzeitig nahe an die Leistungsgrenze seiner GPU springen und sich dann einpendeln, während das Modell Tokens streamt. Dieser Übergang umfasst Änderungen des Geräteleistungszustands, Speicherzuweisung, Kernel-Initialisierung und das Prefill des Prompts. Modellgröße, Prompt-Länge, Batch-Größe, Taktstrategie, Quantisierung, Messintervall und andere Beschleuniger-Workloads bestimmen Höhe und Dauer des beobachteten Ausschlags.

Die GPU verlässt den Leerlaufzustand, sobald Arbeit eintrifft

Moderne GPUs senken bei geringer Auslastung Takt und Spannung und erhöhen beides wieder, sobald Kernel und Speicherverkehr auftreten. Die erste Anfrage kann außerdem einen Gerätekontext erstellen, Bibliotheken initialisieren, Puffer zuweisen und Kernel laden, wodurch sich einmalige Aktivitäten im selben Startzeitfenster konzentrieren.

Leistungsspitzen beim Start von Anfragen charakterisiert Möglichkeiten zum Energiemanagement für LLM-Workloads und berichtet über Leistungsspitzen zu Beginn von Inferenzanfragen. Die Studie führt diese Spitzen auf die rechenintensive Prefill-Phase zurück und untersucht, wie die GPU-Frequenz Latenz und Leistungsaufnahme beeinflusst.

Eine Überwachungsmessung kann die Form des Ausschlags überzeichnen oder verbergen. Ein Ein-Sekunden-Mittelwert kann das Hochfahren des Takts, das Prefill und die frühe Dekodierung zu einem einzigen Punkt zusammenfassen, während eine langsame smarte Steckdose das GPU-Ereignis vollständig verfehlen oder nur die verzögerte Reaktion des Gesamtsystems melden kann.

Prefill nutzt parallele Rechenleistung anders als die Dekodierung

Beim Prefill werden die Prompt-Tokens gemeinsam verarbeitet, um den KV-Cache aufzubauen, wodurch Matrixmultiplikationen viele GPU-Kerne auslasten können. Bei der Dekodierung wird pro Sequenz jeweils ein Token verarbeitet. Sie ist häufig stärker durch Speicherbewegungen und sequenzielle Abhängigkeiten begrenzt, insbesondere bei Batch-Größe eins.

Phasenbezogene Leistungsmessung richtet GPU-, Knoten- und Systemmessungen für jede Anfrage an Prefill und Dekodierung aus. Die phasenbewusste Methode zeigt, warum ein einziger Gesamtenergieverbrauch nicht erklären kann, wann die Spitzenleistung auftritt oder welche Prompt- und Serving-Variablen sie verursacht haben.

Längere Prompts oder größere Batches können das Intervall hoher Auslastung verlängern, während Quantisierung und fusionierte Kernel sowohl den Rechen- als auch den Speicherbedarf verändern. Spitzenleistung in Watt, durchschnittliche Leistung in Watt und Joule pro abgeschlossenem Token beantworten unterschiedliche Fragen und sollten nicht gegeneinander ausgetauscht werden.

Leistungsgrenzen verändern die Spitze, beseitigen die Arbeit jedoch nicht

Eine niedrigere Leistungs- oder Frequenzgrenze kann die unmittelbare Spitze reduzieren, aber das Prefill kann länger dauern. Der Gesamtenergieverbrauch kann sinken, ähnlich bleiben oder steigen - abhängig von der Effizienz am gewählten Betriebspunkt und davon, ob die langsamere Anfrage andere wartende Aufgaben verzögert.

Phasenbewusste Frequenzsteuerung steuert die Frequenzen für Prefill und Dekodierung getrennt und schützt dabei Latenzziele. Die berichteten Energieeinsparungen zeigen, dass phasenbewusste Steuerung eine feste Strategie übertreffen kann. Das Ergebnis hängt jedoch von den Workload-Klassen und den Service-Level-Anforderungen ab.

Die kritische Fehlannahme besteht darin, eine kurze GPU-Spitze mit einer unsicheren Netzleistung gleichzusetzen. Das Netzteil sieht das gesamte System einschließlich CPU, Laufwerken, Lüftern und Umwandlungsverlusten, während Software-Sensoren die Chip-Leistung mit ihrer eigenen Abtastrate melden. Entscheidungen zur elektrischen Sicherheit erfordern Messungen auf Netzebene und eine Reserve für transiente Lasten.

-15% OFF

Leistungsmessungen an den Inferenzphasen ausrichten

Führe feste Prompts mit 32, 512, 2K und 8K Eingabe-Tokens bei konstanter Ausgabelänge aus und wiederhole den Test anschließend mit zwei Batch-Größen. Erfasse GPU-Leistung, Takt, Auslastung, Temperatur, Netzleistung des Hosts, Eintreffen der Anfrage, Modellbereitschaft, Beginn und Ende des Prefills, den ersten Token und den Abschluss der Dekodierung.

Nutze die Phasenunterscheidung beim Startverbrauch von Heimservern, um Spitzenleistung in Watt, Prefill-Joule, Dekodierungs-Joule, Joule pro Token, TTFT und die p95-Latenz zwischen Tokens zu berechnen. Wiederhole den Test einmal mit einer Leistungsgrenze und einmal nach einer langen Leerlaufphase.

Behalte eine Leistungsstrategie nur bei, wenn sie gleichzeitig die Reserve bei der Netzleistung, die Temperatur und die Latenz berücksichtigt. Wenn die Reduzierung der Spitze das Prefill so stark verlängert, dass Energieverbrauch oder Warteschlangenverzögerung steigen, solltest du die glattere Kurve als kosmetische Verbesserung und nicht als Effizienzgewinn betrachten.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.