Pourquoi la consommation électrique du GPU augmente-t-elle au début d’une requête d’inférence locale ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

La puissance du GPU augmente souvent fortement au début d’une requête, car la montée en fréquence et le préremplissage hautement parallèle du prompt mobilisent simultanément davantage de ressources de calcul que le décodage jeton par jeton.

Un serveur domestique peut rester silencieux au repos, s’approcher brièvement de la limite de puissance de son GPU, puis se stabiliser pendant que le modèle diffuse les jetons. Cette transition combine des changements d’état de puissance du périphérique, l’allocation de mémoire, l’initialisation des noyaux et le préremplissage du prompt. La taille du modèle, la longueur du prompt, la taille du lot, la politique de fréquence, la quantification, l’intervalle de mesure et les autres charges de l’accélérateur déterminent la hauteur et la durée du pic observé.

Le GPU quitte son état de veille lorsque la charge arrive

Les GPU modernes réduisent leur fréquence et leur tension lorsqu’ils sont peu sollicités, puis les augmentent lorsque des noyaux et du trafic mémoire apparaissent. La première requête peut également créer un contexte de périphérique, initialiser des bibliothèques, allouer des tampons et charger des noyaux, concentrant ainsi les opérations ponctuelles autour du même instant de démarrage.

les pics de puissance au début des requêtes caractérisent les possibilités de gestion de la puissance pour les charges de travail LLM et signalent des pics de puissance au début des requêtes d’inférence. L’étude relie ces pics à la phase de préremplissage, intensive en calcul, et examine l’influence de la fréquence du GPU sur la latence et la puissance.

Un échantillon de surveillance peut exagérer ou masquer la forme du pic. Une moyenne sur une seconde peut regrouper la montée en fréquence, le préremplissage et le début du décodage en un seul point, tandis qu’une prise connectée lente peut manquer complètement l’événement du GPU ou ne signaler que la réponse différée de l’ensemble du système.

Le préremplissage utilise le calcul parallèle différemment du décodage

Le préremplissage traite simultanément les jetons du prompt afin de constituer le cache KV, ce qui expose des multiplications matricielles susceptibles d’occuper de nombreux cœurs du GPU. Le décodage avance d’un jeton par séquence et est souvent davantage limité par les mouvements de mémoire et les dépendances séquentielles, notamment avec une taille de lot de un.

la mesure de puissance synchronisée avec les phases aligne les échantillons de puissance du GPU, du nœud et du système sur les phases de préremplissage et de décodage de chaque requête. Sa méthode tenant compte des phases montre pourquoi un seul total d’énergie ne peut pas expliquer à quel moment survient la puissance maximale ni quelles variables du prompt et du service l’ont produite.

Des prompts plus longs ou des lots plus importants peuvent prolonger l’intervalle de forte utilisation, tandis que la quantification et les noyaux fusionnés modifient à la fois les besoins en calcul et en mémoire. Les watts de pointe, les watts moyens et les joules par jeton terminé répondent à des questions différentes et ne doivent pas être substitués les uns aux autres.

Les limites de puissance remodèlent le pic plutôt qu’elles ne suppriment le travail

Une limite de puissance ou de fréquence plus basse peut réduire le pic instantané, mais le préremplissage peut prendre plus de temps. L’énergie totale peut diminuer, rester similaire ou augmenter selon l’efficacité au point de fonctionnement choisi et selon que la requête ralentie retarde d’autres tâches en attente.

le contrôle de fréquence tenant compte des phases règle séparément les fréquences du préremplissage et du décodage tout en respectant les objectifs de latence. Les économies d’énergie rapportées montrent qu’un contrôle tenant compte des phases peut surpasser une politique unique fixe, mais le résultat dépend des catégories de charges de travail et des contraintes de niveau de service.

Le piège consiste à assimiler un bref pic du GPU à une puissance dangereuse au niveau de la prise. Le bloc d’alimentation voit l’ensemble du système, notamment le processeur, les disques, les ventilateurs et les pertes de conversion, tandis que les capteurs logiciels mesurent la puissance de la puce selon leur propre cadence. Les décisions relatives à la sécurité électrique nécessitent une mesure au niveau de la prise et une marge suffisante pour les transitoires.

-15% OFF

Synchronisez les échantillons de puissance avec les phases d’inférence

Exécutez des prompts fixes de 32, 512, 2K et 8K jetons d’entrée avec une longueur de sortie constante, puis répétez le test avec deux tailles de lot. Relevez la puissance du GPU, les fréquences, l’utilisation, la température, la puissance secteur du système hôte, l’arrivée de la requête, la disponibilité du modèle, le début et la fin du préremplissage, le premier jeton et la fin du décodage.

Utilisez la distinction entre les phases présentée dans la puissance au démarrage d’un serveur domestique pour calculer les watts de pointe, les joules du préremplissage, les joules du décodage, les joules par jeton, le TTFT et la latence interjeton p95. Répétez une fois avec une limite de puissance, puis une fois après une longue période d’inactivité.

Ne conservez une politique de puissance que si elle respecte simultanément la marge de puissance au niveau de la prise, la température et la latence. Si la réduction du pic prolonge suffisamment le préremplissage pour augmenter l’énergie ou le délai d’attente, considérez le graphique plus lisse comme une amélioration esthétique plutôt que comme un gain d’efficacité.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.