¿Por qué se dispara el consumo de energía de la GPU al inicio de una solicitud de inferencia local?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

La potencia de la GPU suele aumentar bruscamente al inicio de una solicitud porque el aumento de frecuencia y el prellenado de prompts altamente paralelizado activan más capacidad de cómputo a la vez que la decodificación token por token.

Un servidor doméstico puede permanecer inactivo y silencioso, acercarse a su límite de potencia de GPU durante un intervalo breve y luego estabilizarse mientras el modelo transmite tokens. La transición combina cambios en el estado de potencia del dispositivo, asignación de memoria, inicialización de kernels y prellenado del prompt. El tamaño del modelo, la longitud del prompt, el tamaño del lote, la política de frecuencia, la cuantización, el intervalo de medición y otras cargas de trabajo del acelerador determinan la magnitud y la duración del pico observado.

La GPU sale del estado inactivo cuando llega trabajo

Las GPU modernas reducen la frecuencia y el voltaje cuando tienen poco uso, y luego los aumentan cuando aparecen kernels y tráfico de memoria. La primera solicitud también puede crear un contexto del dispositivo, inicializar bibliotecas, asignar búferes y cargar kernels, concentrando la actividad inicial alrededor del mismo momento de inicio.

los picos de potencia al inicio de las solicitudes caracterizan las oportunidades de gestión de potencia para cargas de trabajo de LLM e informan sobre picos de potencia al comienzo de las solicitudes de inferencia. El estudio relaciona esos picos con la fase de prellenado, intensiva en cómputo, y examina cómo la frecuencia de la GPU afecta a la latencia y la potencia.

Una muestra de monitorización puede exagerar u ocultar la forma del pico. Un promedio de un segundo puede combinar el aumento de frecuencia, el prellenado y la decodificación inicial en un solo punto, mientras que un enchufe inteligente lento puede no detectar el evento de la GPU o informar únicamente sobre la respuesta retrasada de todo el sistema.

El prellenado utiliza el cómputo paralelo de forma distinta a la decodificación

El prellenado procesa conjuntamente los tokens del prompt para crear la caché KV, exponiendo multiplicaciones de matrices que pueden ocupar muchos núcleos de la GPU. La decodificación avanza un token por secuencia y suele estar más limitada por el movimiento de memoria y la dependencia secuencial, especialmente con un tamaño de lote de uno.

la medición de potencia alineada con las fases alinea las muestras de potencia de la GPU, el nodo y el sistema con el prellenado y la decodificación de cada solicitud. Su método basado en fases muestra por qué un único total de energía no puede explicar cuándo se produce la potencia máxima ni qué variables del prompt y del servicio la generaron.

Los prompts más largos o los lotes más grandes pueden prolongar el intervalo de alta utilización, mientras que la cuantización y los kernels fusionados modifican tanto la demanda de cómputo como la de memoria. Los vatios máximos, los vatios medios y los julios por token completado responden a preguntas diferentes y no deben sustituirse entre sí.

Los límites de potencia modifican el pico en lugar de eliminar el trabajo

Un límite de potencia o frecuencia más bajo puede reducir el pico instantáneo, pero el prellenado puede tardar más. La energía total puede disminuir, mantenerse similar o aumentar, según la eficiencia en el punto operativo seleccionado y según si la solicitud más lenta retrasa otras tareas en cola.

el control de frecuencia basado en fases controla las frecuencias por separado para el prellenado y la decodificación, al tiempo que protege los objetivos de latencia. Los ahorros de energía informados demuestran que el control basado en fases puede superar a una única política fija, pero el resultado depende de las clases de carga de trabajo y de las restricciones del nivel de servicio.

El límite problemático consiste en equiparar un breve pico de la GPU con una potencia peligrosa en la toma de corriente. La fuente de alimentación ve todo el sistema, incluidos la CPU, las unidades, los ventiladores y las pérdidas de conversión, mientras que los sensores de software informan sobre la potencia del chip con su propia cadencia. Las decisiones de seguridad eléctrica requieren mediciones en la toma de corriente y margen para transitorios.

-15% OFF

Alinea las muestras de potencia con las fases de inferencia

Ejecuta prompts fijos de 32, 512, 2K y 8K tokens de entrada con una longitud de salida constante y repite después con dos tamaños de lote. Captura la potencia de la GPU, las frecuencias, la utilización, la temperatura, la potencia del sistema medida en la toma de corriente, la llegada de la solicitud, la disponibilidad del modelo, el inicio y el final del prellenado, el primer token y la finalización de la decodificación.

Utiliza la distinción entre fases de la potencia de arranque del servidor doméstico para calcular los vatios máximos, los julios del prellenado, los julios de la decodificación, los julios por token, el TTFT y la latencia p95 entre tokens. Repite la prueba una vez con un límite de potencia y otra después de un intervalo prolongado de inactividad.

Conserva una política de potencia solo si respeta simultáneamente el margen de potencia en la toma de corriente, la temperatura y la latencia. Si reducir el pico prolonga el prellenado lo suficiente como para aumentar la energía o el retraso de la cola, considera el gráfico más uniforme una mejora estética y no una ganancia de eficiencia.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.