Porque é que o consumo de energia da GPU aumenta bruscamente no início de um pedido de inferência local?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

A potência da GPU aumenta frequentemente no início de um pedido, porque o aumento da frequência e o prefill altamente paralelo do prompt ativam mais capacidade de processamento em simultâneo do que a descodificação token a token.

Um servidor doméstico pode permanecer silencioso em inatividade, aproximar-se do limite de potência da GPU durante um breve intervalo e depois estabilizar enquanto o modelo transmite tokens. A transição combina alterações ao estado de energia do dispositivo, alocação de memória, inicialização de kernels e prefill do prompt. O tamanho do modelo, o comprimento do prompt, o tamanho do lote, a política de frequência, a quantização, o intervalo de medição e outras cargas de trabalho do acelerador determinam a amplitude e a duração do pico observado.

A GPU Sai do Estado de Inatividade Quando Chega Trabalho

As GPUs modernas reduzem a frequência e a tensão quando são pouco utilizadas e aumentam-nas quando surgem kernels e tráfego de memória. O primeiro pedido também pode criar um contexto de dispositivo, inicializar bibliotecas, alocar buffers e carregar kernels, concentrando a atividade pontual na mesma janela de início.

picos de potência no início dos pedidos caracteriza as oportunidades de gestão de energia para cargas de trabalho de LLM e relata picos de potência no início dos pedidos de inferência. O estudo associa esses picos à fase de prefill, intensiva em computação, e analisa de que forma a frequência da GPU afeta a latência e a potência.

Uma amostra de monitorização pode exagerar ou ocultar a forma do pico. Uma média de um segundo pode juntar o aumento da frequência, o prefill e a descodificação inicial num único ponto, enquanto uma tomada inteligente lenta pode não detetar o evento da GPU ou registar apenas a resposta tardia de todo o sistema.

O Prefill Utiliza a Computação Paralela de Forma Diferente da Descodificação

O prefill processa os tokens do prompt em conjunto para criar a cache KV, expondo multiplicações de matrizes que podem ocupar muitos núcleos da GPU. A descodificação avança um token por sequência e é frequentemente mais limitada pelo movimento de dados e pela dependência sequencial, especialmente com um tamanho de lote de um.

medição de potência alinhada com as fases alinha as amostras de potência da GPU, do nó e do sistema com o prefill e a descodificação de cada pedido. O seu método sensível às fases mostra por que motivo um único total de energia não explica quando ocorre a potência de pico nem quais as variáveis do prompt e do serviço que a produziram.

Prompts mais longos ou lotes maiores podem prolongar o intervalo de elevada utilização, enquanto a quantização e os kernels fundidos alteram tanto a exigência computacional como a de memória. Os watts de pico, os watts médios e os joules por token concluído respondem a perguntas diferentes e não devem ser utilizados como substitutos uns dos outros.

Os Limites de Potência Reformulam o Pico em Vez de Eliminarem o Trabalho

Um limite inferior de potência ou de frequência pode reduzir o pico instantâneo, mas o prefill pode demorar mais tempo. A energia total pode diminuir, manter-se semelhante ou aumentar, dependendo da eficiência no ponto de funcionamento selecionado e de o pedido mais lento atrasar ou não outro trabalho em fila.

controlo de frequência sensível às fases controla as frequências separadamente para o prefill e a descodificação, protegendo simultaneamente os objetivos de latência. As poupanças de energia comunicadas demonstram que o controlo sensível às fases pode superar uma política fixa única, mas o resultado depende das classes de carga de trabalho e das restrições do nível de serviço.

O erro está em equiparar um breve pico da GPU a uma potência de parede insegura. A fonte de alimentação vê todo o sistema, incluindo CPU, unidades, ventoinhas e perdas de conversão, enquanto os sensores de software comunicam a potência do chip com a sua própria cadência. As decisões de segurança elétrica exigem medição ao nível da tomada e margem para transientes.

-15% OFF

Alinhe as Amostras de Potência com as Fases da Inferência

Execute prompts fixos com 32, 512, 2K e 8K tokens de entrada e um comprimento de saída constante e, em seguida, repita com dois tamanhos de lote. Registe a potência da GPU, as frequências, a utilização, a temperatura, a potência do sistema medida na tomada, a chegada do pedido, a prontidão do modelo, o início e o fim do prefill, o primeiro token e a conclusão da descodificação.

Utilize a distinção entre fases em potência de arranque do servidor doméstico para calcular os watts de pico, os joules do prefill, os joules da descodificação, os joules por token, o TTFT e a latência p95 entre tokens. Repita uma vez com um limite de potência e outra após um longo intervalo de inatividade.

Mantenha uma política de potência apenas se esta respeitar simultaneamente a margem de potência na tomada, a temperatura e a latência. Se reduzir o pico prolongar o prefill o suficiente para aumentar a energia ou o atraso na fila, encare o gráfico mais suave como uma melhoria estética, e não como um ganho de eficiência.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.