Sygnalizacja UPS koordynuje bezpieczne wyłączenie AI, przekształcając stan baterii w uporządkowaną sekwencję, która zatrzymuje pracę, zanim zgromadzona energia zostanie wyczerpana.
Domowy serwer AI może zapisywać embeddingi, aktualizować indeks wektorowy, nagrywać obraz z kamer i przechowywać stan modelu w chwili zaniku zasilania sieciowego. UPS zgłasza stan pracy na baterii i niski poziom baterii, ale to polityka określa, kiedy te sygnały stają się zdarzeniem wyłączenia. Musi pozostać wystarczający czas, aby aplikacje zakończyły pracę, systemy plików zatwierdziły dane, hosty się zatrzymały, a UPS odłączył obciążenie.
Stan zasilania staje się decyzją o wyłączeniu
UPS udostępnia stan zasilania sieciowego, poziom naładowania baterii, szacowany czas pracy i stan niskiego poziomu baterii przez USB, port szeregowy lub agenta sieciowego. Oprogramowanie monitorujące łączy te odczyty ze skonfigurowanymi progami, dzięki czemu krótką awarię można przeczekać, a przedłużająca się awaria uruchamia uporządkowane wyłączenie.
Network UPS Tools opisuje, jak stan krytyczny lub wymuszone wyłączenie informuje systemy podrzędne, aby odłączyły się i wyłączyły, zanim system główny odłączy zasilanie. Sygnał koordynuje hosty, ale sam nie wie, które zadania AI ani transakcje magazynu danych można bezpiecznie przerwać.
Szacunki czasu pracy zmieniają się wraz z obciążeniem, wiekiem baterii, temperaturą i kalibracją. Dlatego zachowawcza polityka rezerwuje margines czasowy zamiast czekać, aż wyświetlany procent baterii zbliży się do zera. To rozróżnienie pozostaje widoczne podczas późniejszych testów domowych.
Kolejność usług opróżnia zadania AI, zanim zatrzyma się magazyn danych
System operacyjny najpierw blokuje lub odrzuca nowe żądania wnioskowania, indeksowania i agentów, a następnie prosi aktywne usługi o zakończenie pracy lub utworzenie punktu kontrolnego w ramach określonych limitów czasu. Bazy danych i magazyny wektorowe opróżniają dzienniki oraz metadane, zanim ich bazowe systemy plików zostaną odmontowane.
Skoordynowana sekwencja wyłączenia NUT przekazuje flagę wymuszonego wyłączenia hostom podrzędnym, czeka na ich odłączenie, a następnie uruchamia lokalne polecenie wyłączenia. Ta kolejność ma znaczenie, gdy NAS udostępnia modele lub indeksy kilku węzłom obliczeniowym.
Model GPU można zwykle odrzucić i wczytać ponownie, natomiast trwające zatwierdzanie indeksu lub transakcja bazy danych mogą decydować o możliwości odzyskania danych. Kolejność wyłączania powinna priorytetowo traktować autorytatywny stan, zamiast zużywać pozostałą energię baterii na dokończenie jednorazowej generacji.
Zatrzymanie hosta i odłączenie obciążenia UPS zamykają różne okna awarii
Zatrzymanie systemu operacyjnego zatrzymuje oprogramowanie i synchronizuje dane na nośnikach, ale podłączony sprzęt może pozostać zasilany do chwili, gdy UPS wyłączy swoje gniazda. Odłączenie obciążenia zapobiega załamaniu napięcia rozładowanej baterii podczas częściowo zatrzymanego serwera i umożliwia kontrolowany restart po powrocie zasilania sieciowego.
NUT wyjaśnia, że system główny ustawia koordynację FSD, aby każdy monitorowany system podrzędny traktował ten stan jak jednoczesny stan pracy na baterii i niski poziom baterii. Dopiero po wyłączeniu klientów system główny powinien wykonać polecenie kończące odłączenie zasilania. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja pójdzie dalej.
Granica awarii pojawia się przy utracie komunikacji, niedokładnym szacowaniu czasu pracy lub przekroczeniu przez usługę limitu czasu względem pozostałej energii. UPS nie może ochronić niezatwierdzonego stanu, gdy sygnał dociera z opóźnieniem, demon jest nieosiągalny lub zależności wyłączania blokują się wzajemnie.
Przećwicz całą oś czasu od baterii do odłączenia zasilania
Zapisz na jednej monotonicznej osi czasu utratę zasilania sieciowego, wykrycie pracy na baterii, próg wyłączenia, zatrzymanie przyjmowania żądań, opróżnianie zadań, zatwierdzenie bazy danych, synchronizację systemu plików, zatrzymanie hosta, odłączenie obciążenia UPS i możliwość ponownego uruchomienia. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Powiąż punkty kontrolne magazynu danych z skoordynowanymi punktami kontrolnymi. Przetestuj krótką awarię, przekroczenie progu, nieosiągalny system podrzędny, zablokowanego pracownika AI, wyczerpany limit czasu, przywrócenie zasilania sieciowego podczas wyłączania oraz zimny restart po odłączeniu obciążenia. Praktyczne konsekwencje ujawniają się, gdy kilka źródeł konkuruje o ograniczony kontekst.
Test uznaj za zaliczony dopiero wtedy, gdy trwały stan odzyskuje się bez błędów, a UPS zachowuje zmierzony margines po najwolniejszym wyłączeniu. Czas trwania próby, a nie nominalny procent baterii, traktuj jako minimalną rezerwę dla polityki produkcyjnej. Ta zależność powinna pozostać jawna w końcowym interfejsie.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Czym jest dryf osadzeń i kiedy prywatny indeks wyszukiwania wymaga przebudowy?
Odkoduj dryf modelu, przetwarzania wstępnego, korpusu i zapytań; odróżnij monitorowanie od niezgodności oraz zdecyduj, kiedy prywatny indeks wymaga przebudowy.

Czym jest zgodność tokenizera i dlaczego może zakłócić przełączanie modeli?
Odkryj tożsamość słownictwa, znaczenie tokenów specjalnych, szablony czatu, buforowane tokeny, adaptery i kontrole zgodności przy lokalnym przełączaniu modeli.

Czym jest rezydencja modelu i kiedy lokalna usługa AI powinna przechowywać wagi w pamięci?
Poznaj rezydencję wag, poziomy pamięci podręcznej, zimne uruchomienia, eksmisję, multipleksowanie, presję pamięci oraz dowiedz się, kiedy domowa usługa AI powinna pozostać aktywna.

