Varför ökar GPU-effekten kraftigt i början av en lokal inferensförfrågan?

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

GPU-effekten stiger ofta kraftigt när en begäran startar, eftersom uppvarvning av klockfrekvensen och den mycket parallella förbearbetningen av prompten aktiverar mer beräkningskapacitet på en gång än avkodning token för token.

En hemmaserver kan vara tyst i viloläge, närma sig sin GPU-effektgräns under en kort period och sedan stabiliseras medan modellen strömmar ut token. Övergången omfattar ändringar i enhetens energiläge, minnesallokering, initiering av kärnor och förbearbetning av prompten. Modellstorlek, promptlängd, batchstorlek, klockpolicy, kvantisering, mätintervall och andra acceleratorbelastningar avgör höjden och varaktigheten hos den observerade effekttoppen.

GPU:n lämnar viloläget när arbetet anländer

Moderna GPU:er sänker klockfrekvens och spänning vid låg belastning och höjer dem sedan när kärnor och minnestrafik aktiveras. Den första begäran kan också skapa ett enhetskontext, initiera bibliotek, allokera buffertar och läsa in kärnor, vilket koncentrerar engångsaktivitet till samma startintervall.

effekttoppar när begäran startar karakteriserar möjligheter till energihantering för LLM-arbetsbelastningar och rapporterar effekttoppar i början av inferensbegäranden. Studien kopplar topparna till den beräkningsintensiva förbearbetningsfasen och undersöker hur GPU-frekvensen påverkar fördröjning och effekt.

Ett övervakningsprov kan överdriva eller dölja formen. Ett ensekundsmedelvärde kan slå ihop uppvarvning av klockan, förbearbetning och tidig avkodning till en enda punkt, medan en långsam smart kontakt kan missa GPU-händelsen helt eller bara rapportera den fördröjda responsen från hela systemet.

Förbearbetning använder parallell beräkning på ett annat sätt än avkodning

Förbearbetning behandlar promptens token tillsammans för att bygga KV-cachen, vilket blottlägger matrismultiplikationer som kan belasta många GPU-kärnor. Avkodning går framåt med en token per sekvens och begränsas ofta mer av minnesöverföring och sekventiella beroenden, särskilt vid batchstorlek ett.

fasanpassad effektmätning synkroniserar GPU-, nod- och systemeffektprover med förbearbetning och avkodning för varje begäran. Den fasmedvetna metoden visar varför en enda energisumma inte kan förklara när den högsta effekten uppstår eller vilka prompt- och serveringsvariabler som orsakade den.

Längre promptar eller större batcher kan förlänga intervallet med hög nyttjandegrad, medan kvantisering och sammanslagna kärnor förändrar både beräknings- och minnesbehovet. Toppeffekt i watt, genomsnittlig effekt i watt och joule per färdig token besvarar olika frågor och bör inte ersätta varandra.

Effektgränser omformar toppen snarare än tar bort arbetet

En lägre effekt- eller frekvensgräns kan minska den momentana toppen, men förbearbetningen kan ta längre tid. Den totala energin kan minska, förbli ungefär densamma eller öka beroende på effektiviteten vid den valda driftpunkten och på om den långsammare begäran fördröjer annat köat arbete.

fasmedveten frekvensstyrning styr frekvenser separat för förbearbetning och avkodning samtidigt som fördröjningsmålen skyddas. De rapporterade energibesparingarna visar att fasmedveten styrning kan överträffa en enda fast policy, men resultatet beror på arbetsbelastningsklasser och servicenivåkrav.

Felgränsen går vid att likställa en kortvarig GPU-topp med osäker väggansluten effekt. Nätaggregatet ser hela systemet, inklusive CPU, enheter, fläktar och omvandlingsförluster, medan programvarusensorer rapporterar chipets effekt med sin egen samplingsfrekvens. Beslut om elsäkerhet kräver mätning på väggnivå och marginal för transienter.

-15% OFF
Single board computer zimaboard2

Synkronisera effektprover med inferensfaserna

Kör fasta promptar med 32, 512, 2K och 8K indatatoken med konstant utdatalängd och upprepa sedan vid två batchstorlekar. Samla in GPU-effekt, klockfrekvenser, nyttjandegrad, temperatur, väggansluten effekt för värdsystemet, ankomsttid för begäran, modellens beredskap, start och slut för förbearbetning, första token och slutförd avkodning.

Använd fasskillnaden i hemmaserverns starteffekt för att beräkna toppeffekt i watt, joule för förbearbetning, joule för avkodning, joule per token, TTFT och p95-fördröjning mellan token. Upprepa en gång med en effektgräns och en gång efter en lång viloperiod.

Behåll en effektpolicy endast om den samtidigt respekterar marginalen för väggansluten effekt, temperaturen och fördröjningen. Om en sänkning av toppen förlänger förbearbetningen så mycket att energin eller köfördröjningen ökar, bör den jämnare grafen ses som en kosmetisk förbättring snarare än en effektivitetsvinst.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.