GPUの電力は、クロックの立ち上がりと高い並列性を持つプロンプトのプリフィルによって、トークンを1つずつデコードする場合よりも多くの演算が一度に有効になるため、リクエスト開始時に急上昇することがあります。
ホームサーバーは静かにアイドル状態で待機していても、短時間だけGPUの電力上限近くまで跳ね上がり、その後、モデルがトークンをストリーミングする間に落ち着くことがあります。この変化には、デバイスの電力状態の切り替え、メモリ割り当て、カーネルの初期化、プロンプト全体に対するプリフィルが組み合わさっています。観測されるスパイクの高さと持続時間は、モデルサイズ、プロンプト長、バッチサイズ、クロックポリシー、量子化、測定間隔、その他のアクセラレーター負荷によって決まります。
処理が到着するとGPUはアイドル状態を離れる
最新のGPUは、負荷が低いときにはクロックと電圧を下げ、カーネルやメモリアクセスが発生すると引き上げます。最初のリクエストでは、デバイスコンテキストの作成、ライブラリの初期化、バッファーの割り当て、カーネルの読み込みも行われるため、一度限りの処理が開始時の同じ時間帯に集中することがあります。
リクエスト開始時の電力スパイクでは、LLMワークロードにおける電力管理の機会を分析し、推論リクエストの開始時に発生する電力スパイクを報告しています。この研究は、これらのスパイクを計算負荷の高いプリフィル段階と関連付け、GPU周波数がレイテンシーと電力に与える影響を調べています。
モニタリングのサンプルによっては、波形が誇張されたり、隠れたりすることがあります。1秒間の平均値では、クロックの立ち上がり、プリフィル、デコード初期段階が1つの点にまとめられる場合があります。一方、応答の遅いスマートプラグではGPUのイベントを完全に見逃すか、遅れて現れるシステム全体の応答だけを報告することがあります。
プリフィルではデコードとは異なる形で並列演算を利用する
プリフィルでは、KVキャッシュを構築するためにプロンプトのトークンをまとめて処理し、多数のGPUコアを占有できる行列乗算を発生させます。デコードではシーケンスごとに1トークンずつ進むため、特にバッチサイズが1の場合、メモリ転送や逐次的な依存関係の制約を受けやすくなります。
フェーズに同期した電力測定では、リクエストごとにGPU、ノード、システムの電力サンプルをプリフィルおよびデコードと同期させます。このフェーズ認識型の手法は、1つのエネルギー総量だけではピーク電力がいつ発生したのか、またどのプロンプトやサービング変数がその原因だったのかを説明できない理由を示しています。
プロンプトが長くなったりバッチが大きくなったりすると、高い利用率が続く時間が延びる可能性があります。一方、量子化や融合カーネルは、演算量とメモリ需要の両方を変化させます。ピークワット、平均ワット、完了したトークンあたりのジュール値は、それぞれ異なる問いに答える指標であり、互いに置き換えて使用すべきではありません。
電力制限は処理をなくすのではなく、スパイクの形を変える
電力または周波数の上限を下げると瞬間的なピークは抑えられますが、プリフィルに時間がかかる可能性があります。総エネルギーは、選択した動作点での効率や、リクエストの遅延によってキュー内の他の処理まで遅れるかどうかに応じて、減少することも、ほぼ変わらないことも、増加することもあります。
フェーズ認識型の周波数制御では、レイテンシー目標を維持しながら、プリフィルとデコードで周波数を個別に制御します。報告されたエネルギー削減効果は、フェーズ認識型の制御が単一の固定ポリシーを上回る可能性を示していますが、結果はワークロードの種類とサービスレベルの制約に左右されます。
危険な壁面電力と短時間のGPUスパイクを同一視することが、判断を誤る境界です。PSUが受けるのはシステム全体の電力であり、CPU、ドライブ、ファン、変換損失も含まれます。一方、ソフトウェアセンサーはそれぞれ異なる周期でチップの電力を報告します。電気的な安全性を判断するには、壁面での測定と過渡的な余裕が必要です。
電力サンプルを推論フェーズに同期させる
入力トークン数を32、512、2K、8Kに固定し、出力長も一定にしたプロンプトを実行してから、2種類のバッチサイズで繰り返します。GPU電力、クロック、利用率、温度、ホストの壁面電力、リクエスト到着時刻、モデル準備完了時刻、プリフィルの開始と終了、初回トークン、デコード完了を記録します。
ホームサーバーの起動電力で説明されているフェーズの区別を使い、ピークワット、プリフィルのジュール値、デコードのジュール値、トークンあたりのジュール値、TTFT、トークン間レイテンシーのp95を算出します。電力制限を適用した場合と、長時間アイドル状態にした後の2回も繰り返します。
壁面電力の余裕、温度、レイテンシーを同時に満たす場合にのみ、電力ポリシーを維持します。ピークを下げた結果、プリフィルが長引いてエネルギーやキューの遅延が増えるなら、グラフが滑らかになっただけで効率が向上したわけではないと判断してください。
テック&AIハブ
もっと読む

複数のインデックスセグメントを同時にクエリすると、ベクトル検索のランキングが変わるのはなぜですか?
セグメントごとの候補数制限、近似グラフ、スコアのキャリブレーション、更新、統合によって、プライベートなベクトル検索のランキングがどのように変わるかを学びます。

メタデータを編集すると写真の重複排除グループが分割されるのはなぜですか?
完全一致ハッシュ、知覚ハッシュ、EXIFの向き、タイムスタンプ、しきい値、パイプラインのバージョンによって、プライベートな写真の重複グループが分割される仕組みをご覧ください。

残響のある部屋でローカル音声アシスタントが自分の発話に割り込まれるのはなぜですか?
音響エコーパス、残響、非線形スピーカー、ダブルトーク、バージインのしきい値によって、ローカル音声アシスタントが自分の声を聞いてしまう仕組みを学びましょう。

