A latência da IA local pode oscilar com uma curva de ventoinha quando um arrefecimento retardado faz repetidamente os clocks do processador ultrapassarem e depois ficarem abaixo dos limites térmicos ou de potência.
A inferência converte energia elétrica em calor mais rapidamente do que o chassis e o dissipador conseguem dissipá-lo. Um controlador de ventoinha reage a uma leitura de temperatura atrasada, utilizando frequentemente níveis e histerese, enquanto o firmware do CPU ou GPU ajusta independentemente a tensão e a frequência. Se a carga de trabalho, a inércia térmica e os atrasos de controlo se alinharem, os pedidos alternam entre estados de boost, limitação, arrefecimento e boost.
A inferência aquece o dispositivo mais rapidamente do que o arrefecimento consegue responder
Um pico começa com clocks elevados enquanto o silício está frio, e a temperatura da junção sobe através do encapsulamento e do dissipador. Os sensores, as janelas de suavização, a consulta do controlador e o atraso no aumento da velocidade da ventoinha retardam o fluxo de ar, pelo que a resposta de arrefecimento fica atrás da carga de trabalho que a provocou.
Um estudo sobre a degradação térmica da inferência em dispositivos periféricos mede a degradação do desempenho durante o aquecimento prolongado. O resultado relaciona o estado térmico com a latência, mesmo quando o modelo e a entrada permanecem inalterados. Esta distinção continua visível durante os testes domésticos posteriores.
Os pedidos curtos podem terminar antes da limitação, enquanto os pedidos posteriores herdam o calor acumulado. Intervalos de inatividade podem reiniciar parcialmente o ciclo, fazendo com que o tráfego periódico pareça mais variável do que uma referência contínua. O resultado intermédio tem de permanecer inspecionável antes de a automatização avançar.
Os níveis da ventoinha e os limiares de DVFS formam ciclos de controlo acoplados
A curva da ventoinha mapeia a temperatura medida para a velocidade, enquanto o firmware mapeia a temperatura, a corrente e a potência para a frequência. Cada ciclo tem limiares e histerese; ultrapassá-los altera a velocidade de arrefecimento ou de computação em níveis discretos. Esse limite deve ser medido separadamente em condições de funcionamento realistas.
A investigação sobre a estabilidade do controlo da ventoinha mostra que medições de temperatura atrasadas e imperfeitas complicam o controlo estável da ventoinha. Um controlador que reage fortemente após um atraso pode exceder o necessário, arrefecer abaixo de um limiar inferior, abrandar a ventoinha e repetir o ciclo.
A latência acompanha os clocks efetivos e a frequência da memória, não diretamente as RPM da ventoinha. As alterações da ventoinha também podem coincidir com decisões relativas aos limites de potência, pelo que a correlação, por si só, não demonstra que o fluxo de ar, e não uma política de firmware partilhada, tenha causado a alteração do clock.
O enfileiramento pode amplificar uma pequena oscilação do clock
Quando a taxa de serviço diminui durante a limitação, os pedidos acumulam-se. A fila acrescenta tempo de espera a uma inferência já mais lenta; depois de o arrefecimento restaurar os clocks, o servidor esvazia o backlog e parece subitamente rápido de novo. A consequência prática surge quando várias fontes competem por um contexto limitado.
O sistema de gestão de inferência consciente da temperatura gere conjuntamente o comportamento térmico e o escalonamento da inferência, demonstrando que decisões conscientes da temperatura podem proteger a latência, em vez de tratarem o arrefecimento como uma preocupação independente das instalações. Esta dependência deve permanecer explícita na interface final.
O limite da análise é atribuir à curva da ventoinha qualquer latência periódica. Tarefas em segundo plano, formação de lotes, limpeza do armazenamento, consulta da rede, recolha de lixo ou horários de preços da eletricidade podem alinhar-se com o mesmo período. As métricas de frequência e de filas têm de estabelecer a ligação entre a temperatura e o tempo de resposta.
Sobreponha o ciclo de controlo térmico à latência dos pedidos
Reproduza pedidos idênticos a intervalos fixos, registando numa única linha temporal a chegada, o tempo em fila, o tempo de inferência, a taxa de tokens, os clocks do CPU e GPU, a potência do encapsulamento, os sensores de temperatura, os indicadores de limitação, o comando da ventoinha, as RPM reais e a temperatura ambiente.
Utilize os testes de imersão térmica para obter a referência de imersão térmica prolongada. Compare a curva normal com uma velocidade fixa e segura da ventoinha e com uma curva mais suave, preservando a carga de trabalho, os limites de potência, o estado do modelo e o chassis. O resultado deve, por isso, ser verificado face à evidência original.
Considere o ciclo de controlo causal quando a latência acompanha alterações dos clocks que seguem a temperatura e a resposta da ventoinha, e quando a oscilação diminui com uma política de arrefecimento estável. Ajuste a histerese ou o fluxo de ar sem desativar a proteção térmica; uma limitação persistente pode indicar uma capacidade de arrefecimento insuficiente.
Centro de Tecnologia e IA
Mais para Ler

Porque é que as alterações de ficheiros SMB chegam a um indexador incremental em rajadas?
Veja como o armazenamento em cache de escrita SMB, as concessões, CHANGE_NOTIFY, o transbordamento do buffer, a reconexão e o processamento em lotes do...

Porque é que o OCR não deteta texto ténue depois de um PDF ser recomprimido?
Saiba como a recompressão de PDF altera pixels ténues, por que razão os visualizadores podem ocultar essa perda e como testar a resolução, o...

Porque é que a indexação de multimédia aquece mais um NAS do que uma cópia de segurança sequencial?
Saiba por que motivo as operações de E/S em ficheiros pequenos, os codecs, as miniaturas, os metadados, as bases de dados e a inferência...

