Perché la potenza della GPU aumenta bruscamente all’inizio di una richiesta di inferenza locale?

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

La potenza della GPU spesso aumenta bruscamente all'inizio di una richiesta, perché l'aumento della frequenza di clock e il prefill del prompt altamente parallelo attivano contemporaneamente una capacità di calcolo maggiore rispetto alla decodifica token per token.

Un home server può restare silenzioso in idle, avvicinarsi per un breve intervallo al limite di potenza della GPU e poi stabilizzarsi mentre il modello trasmette i token. La transizione combina cambiamenti dello stato di alimentazione del dispositivo, allocazione della memoria, inizializzazione dei kernel e prefill del prompt. Le dimensioni del modello, la lunghezza del prompt, la dimensione del batch, la politica del clock, la quantizzazione, l'intervallo di misurazione e altri carichi di lavoro dell'acceleratore determinano l'entità e la durata del picco osservato.

La GPU esce dallo stato di inattività quando arriva il carico di lavoro

Le GPU moderne riducono frequenza e tensione quando sono utilizzate poco, per poi aumentarle quando entrano in funzione i kernel e il traffico di memoria. La prima richiesta può inoltre creare un contesto del dispositivo, inizializzare le librerie, allocare i buffer e caricare i kernel, concentrando le attività iniziali nello stesso intervallo di avvio.

i picchi di potenza all'inizio della richiesta caratterizzano le opportunità di gestione energetica per i carichi di lavoro degli LLM e riportano picchi di potenza all'inizio delle richieste di inferenza. Lo studio collega questi picchi alla fase di prefill, ad alta intensità di calcolo, ed esamina il modo in cui la frequenza della GPU influisce su latenza e potenza.

Un campionamento del monitoraggio può esagerare o nascondere la forma del picco. Una media su un secondo può fondere aumento del clock, prefill e decodifica iniziale in un unico punto, mentre una presa smart lenta può non rilevare affatto l'evento della GPU o riportare soltanto la risposta ritardata dell'intero sistema.

Il prefill utilizza il calcolo parallelo in modo diverso dalla decodifica

Il prefill elabora insieme i token del prompt per creare la cache KV, esponendo moltiplicazioni di matrici che possono occupare molti core della GPU. La decodifica avanza di un token per sequenza ed è spesso più vincolata dal trasferimento dei dati e dalla dipendenza sequenziale, soprattutto con una dimensione del batch pari a uno.

la misurazione della potenza allineata alle fasi allinea i campioni di potenza della GPU, del nodo e del sistema alle fasi di prefill e decodifica per ogni richiesta. Il suo metodo consapevole delle fasi mostra perché un unico totale energetico non possa spiegare quando si verifica il picco di potenza o quali variabili del prompt e del servizio lo abbiano prodotto.

Prompt più lunghi o batch più grandi possono prolungare l'intervallo di utilizzo elevato, mentre la quantizzazione e i kernel fusi modificano sia il fabbisogno di calcolo sia quello di memoria. Watt di picco, watt medi e joule per token completato rispondono a domande diverse e non dovrebbero essere sostituiti l'uno con l'altro.

I limiti di potenza rimodellano il picco invece di eliminare il lavoro

Un limite inferiore di potenza o frequenza può ridurre il picco istantaneo, ma il prefill potrebbe richiedere più tempo. L'energia totale può diminuire, rimanere simile o aumentare a seconda dell'efficienza nel punto operativo selezionato e del fatto che la richiesta più lenta ritardi altre attività in coda.

il controllo della frequenza consapevole delle fasi controlla le frequenze separatamente per prefill e decodifica, proteggendo al contempo gli obiettivi di latenza. I risparmi energetici riportati dimostrano che il controllo consapevole delle fasi può superare una singola politica fissa, ma il risultato dipende dalle classi di carico di lavoro e dai vincoli del livello di servizio.

Il limite di sicurezza consiste nell'equiparare un breve picco della GPU a una potenza di rete pericolosa. L'alimentatore vede l'intero sistema, inclusi CPU, unità, ventole e perdite di conversione, mentre i sensori software riportano la potenza del chip con una propria frequenza di campionamento. Le decisioni sulla sicurezza elettrica richiedono misurazioni a livello della presa e un margine per i transitori.

-15% OFF

Allinea i campioni di potenza alle fasi dell'inferenza

Esegui prompt fissi da 32, 512, 2K e 8K token di input con una lunghezza di output costante, quindi ripeti il test con due dimensioni del batch. Acquisisci potenza della GPU, frequenze di clock, utilizzo, temperatura, potenza di rete dell'host, arrivo della richiesta, disponibilità del modello, inizio e fine del prefill, primo token e completamento della decodifica.

Usa la distinzione tra le fasi nell'articolo potenza di avvio dell'home server per calcolare watt di picco, joule del prefill, joule della decodifica, joule per token, TTFT e latenza inter-token p95. Ripeti il test una volta con un limite di potenza e una volta dopo un lungo intervallo di inattività.

Mantieni una politica energetica solo se rispetta contemporaneamente il margine di potenza di rete, la temperatura e la latenza. Se ridurre il picco prolunga il prefill al punto da aumentare l'energia o il ritardo in coda, considera il grafico più uniforme un miglioramento estetico anziché un guadagno di efficienza.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.