Opóźnienia lokalnej sztucznej inteligencji mogą oscylować wraz z krzywą wentylatora, gdy opóźnione chłodzenie wielokrotnie powoduje przekraczanie przez zegary procesora progów temperatury lub mocy w górę i w dół.
Wnioskowanie przekształca energię elektryczną w ciepło szybciej, niż obudowa i radiator są w stanie je odprowadzić. Sterownik wentylatora reaguje na opóźniony odczyt temperatury, często wykorzystując stopnie i histerezę, podczas gdy oprogramowanie układowe procesora lub procesora graficznego niezależnie dostosowuje napięcie i częstotliwość. Jeśli obciążenie, bezwładność cieplna i opóźnienia sterowania odpowiednio się zgrają, żądania będą przełączać się między stanami zwiększonej częstotliwości, ograniczenia wydajności, chłodzenia i ponownego zwiększenia częstotliwości.
Wnioskowanie nagrzewa urządzenie szybciej, niż chłodzenie reaguje
Seria obliczeń rozpoczyna się przy wysokich częstotliwościach, gdy krzem jest chłodny, po czym temperatura złącza rośnie w układzie i radiatorze. Czujniki, okna wygładzania, odpytywanie sterownika i opóźnienie rozkręcania wentylatora opóźniają przepływ powietrza, dlatego reakcja chłodzenia pozostaje w tyle za obciążeniem, które ją wywołało.
Badanie pogorszenia wnioskowania wskutek temperatury na urządzeniach brzegowych mierzy spadek wydajności podczas długotrwałego nagrzewania. Wynik łączy stan termiczny z opóźnieniem, nawet gdy model i dane wejściowe pozostają niezmienione. To rozróżnienie pozostaje widoczne podczas późniejszych testów domowych.
Krótkie żądania mogą zakończyć się przed ograniczeniem wydajności, natomiast późniejsze żądania dziedziczą nagromadzone ciepło. Przerwy w bezczynności mogą częściowo zresetować cykl, przez co okresowy ruch wygląda na bardziej zmienny niż jeden ciągły test porównawczy. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja zacznie za nim podążać.
Stopnie regulacji wentylatora i progi DVFS tworzą sprzężone pętle sterowania
Krzywa wentylatora mapuje zmierzoną temperaturę na prędkość, natomiast oprogramowanie układowe mapuje temperaturę, natężenie prądu i moc na częstotliwość. Każda pętla ma progi i histerezę; ich przekroczenie zmienia chłodzenie lub szybkość obliczeń skokowo. Granicę tę należy mierzyć osobno w realistycznych warunkach pracy.
Badania nad stabilnością sterowania wentylatorem pokazują, że opóźnione i niedokładne pomiary temperatury utrudniają stabilne sterowanie wentylatorem. Sterownik, który po opóźnieniu reaguje zbyt mocno, może spowodować przekroczenie wartości, schłodzić urządzenie poniżej dolnego progu, zwolnić wentylator i powtarzać ten cykl.
Opóźnienie zależy od efektywnych częstotliwości taktowania i częstotliwości pamięci, a nie bezpośrednio od prędkości obrotowej wentylatora. Zmiany pracy wentylatora mogą również zbiegać się z decyzjami dotyczącymi limitu mocy, dlatego sama korelacja nie dowodzi, że za zmianę częstotliwości odpowiadał przepływ powietrza, a nie wspólna polityka oprogramowania układowego.
Kolejkowanie może spotęgować niewielkie oscylacje częstotliwości taktowania
Gdy szybkość obsługi spada podczas ograniczania wydajności, żądania zaczynają się kumulować. Kolejka dodaje czas oczekiwania do już wolniejszego wnioskowania; po przywróceniu częstotliwości przez schłodzenie serwer opróżnia zaległości i nagle znów wydaje się szybki. Praktyczne konsekwencje są widoczne, gdy kilka źródeł konkuruje o ograniczony kontekst.
System zarządzania wnioskowaniem uwzględniającego temperaturę wspólnie zarządza zachowaniem termicznym i harmonogramowaniem wnioskowania, pokazując, że decyzje uwzględniające temperaturę mogą chronić opóźnienia, zamiast traktować chłodzenie jako niezwiązane z tym zagadnienie infrastrukturalne. Zależność ta powinna pozostać wyraźna w końcowym interfejsie.
Granica błędu polega na obwinianiu krzywej wentylatora za każde okresowe opóźnienie. Zadania działające w tle, tworzenie partii, czyszczenie pamięci masowej, odpytywanie sieci, zbieranie śmieci lub harmonogramy cen energii mogą zgrywać się z tym samym okresem. Częstotliwość i metryki kolejki muszą połączyć temperaturę z czasem odpowiedzi.
Nałóż pętlę sterowania temperaturą na opóźnienie żądań
Odtwarzaj identyczne żądania w stałych odstępach, rejestrując na jednej osi czasu czas nadejścia, czas oczekiwania w kolejce, czas wnioskowania, szybkość generowania tokenów, częstotliwości taktowania procesora i procesora graficznego, moc układu, odczyty czujników temperatury, flagi ograniczania wydajności, polecenie wentylatora, rzeczywistą prędkość obrotową oraz temperaturę otoczenia.
Użyj testów długotrwałego nagrzewania do ustalenia dłuższego poziomu odniesienia. Porównaj zwykłą krzywą ze stałą, bezpieczną prędkością wentylatora oraz łagodniejszą krzywą, zachowując obciążenie, limity mocy, stan modelu i obudowę. Wynik należy zatem sprawdzić względem pierwotnych dowodów.
Uznaj pętlę sterowania za przyczynową, gdy opóźnienie podąża za zmianami częstotliwości, które następują po zmianach temperatury i reakcji wentylatora, a oscylacje słabną przy stabilnej polityce chłodzenia. Dostosuj histerezę lub przepływ powietrza bez wyłączania ochrony termicznej; utrzymujące się ograniczanie wydajności może wskazywać na niewystarczającą wydajność chłodzenia.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego zmiany plików SMB docierają do indeksatora przyrostowego seriami?
Zobacz, jak buforowanie zapisu SMB, dzierżawy, CHANGE_NOTIFY, przepełnienie bufora, ponowne połączenie i grupowanie zadań indeksatora przekształcają regularne edycje w skokowe zdarzenia pozyskiwania danych.

Dlaczego OCR pomija bladego tekstu po ponownej kompresji pliku PDF?
Dowiedz się, jak ponowna kompresja plików PDF zmienia ledwo widoczne piksele, dlaczego przeglądarki mogą ukrywać utratę jakości oraz jak testować rozdzielczość, kontrast, kodek i...

Dlaczego indeksowanie multimediów bardziej nagrzewa serwer NAS niż sekwencyjna kopia zapasowa?
Dowiedz się, dlaczego operacje wejścia/wyjścia na małych plikach, kodeki, miniatury, metadane, bazy danych i wnioskowanie AI generują więcej ciepła w całym urządzeniu niż kopiowanie...

