Procedura wymiany dysku w domowym serwerze NAS zapewniająca stabilne identyfikatory urządzeń i weryfikację

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Bezpieczne podejście polega na traktowaniu numerów seryjnych macierzy i trwałych identyfikatorów, wymianie jednego potwierdzonego członka, a następnie weryfikacji odbudowy i pierwotnego obciążenia jako sekwencji obserwowalnych etapów, a nie pojedynczego polecenia.

W domowym serwerze NAS z systemem Linux, korzystającym z ZFS, mdraid lub Btrfs, praktyczne ryzyko polega na konieczności wymiany dysku NAS bez pomylenia zmieniających się oznaczeń urządzeń w systemie Linux. Zapisz bieżący stan i punkt odzyskiwania, zacznij od najmniej inwazyjnego sposobu rozróżnienia, interpretuj wyniki pozytywne i negatywne przed zmianą kolejnej zmiennej oraz zatrzymaj się, gdy pamięć masowa stanie się niestabilna lub gdy jedyna możliwa do odzyskania kopia byłaby narażona. Poniższa procedura kończy się dopiero wtedy, gdy pierwotne obciążenie zakończy się powodzeniem lub gdy dowody osiągną granicę wymagającą eskalacji.

Utwórz mapę wymiany numeru seryjnego na zatokę

Zapisz stan macierzy lub puli, topologię urządzeń, informacje SMART, gniazdo obudowy, numer seryjny, WWN oraz dowiązanie symboliczne /dev/disk/by-id dla każdego członka. Oznaczenia urządzeń w systemie Linux mogą zmienić się po ponownym uruchomieniu lub podłączeniu urządzenia podczas pracy, dlatego /dev/sdX jest obserwacją dla bieżącego uruchomienia, a nie trwałą tożsamością używaną w rejestrze wymiany.

Praktyczny przewodnik po domowym serwerze ZFS pokazuje wymianę z użyciem trwałej ścieżki by-id i monitorowanie procesu resilver zamiast polegania na tymczasowym oznaczeniu urządzenia. Ta sama zasada identyfikacji dotyczy mdraid i Btrfs, mimo że używane przez nie polecenia wymiany są różne.

Dopasuj uszkodzonego członka w oprogramowaniu do fizycznej etykiety dwukrotnie: raz przed przełączeniem w tryb offline i ponownie przed wyjęciem sprzętu. Zatrzymaj się, jeśli brakuje przekazywania numeru seryjnego, dwa gniazda zgłaszają tę samą tożsamość mostka lub pula nie może tolerować przejścia kolejnego członka w tryb offline.

Przygotuj zamiennik bez przedwczesnego zmniejszania nadmiarowości

Potwierdź, że nowy dysk ma co najmniej taką samą liczbę użytecznych sektorów, oczekiwany format sektorów i przechodzi podstawowe testy kondycji poza macierzą, jeśli jest to możliwe. Zapisz jego numer seryjny i ścieżkę by-id przed włożeniem. W przypadku członków zaszyfrowanych lub rozruchowych zachowaj również układ partycji, klucze i metadane rozruchowe wymagane przez daną platformę.

Skorzystaj z omówienia ZimaSpace dotyczącego różnych rozmiarów sektorów w lustrze ZFS, gdy zamiennik zgłasza inny logiczny lub fizyczny rozmiar sektora. Pojemność podana na obudowie to za mało; o prawidłowości wymiany decydują rzeczywisty rozmiar, oczekiwania dotyczące ashift lub wyrównania, tablica partycji oraz zasady platformy NAS.

Wymieniaj tylko jedno urządzenie naraz. Jeśli stary dysk jest nadal czytelny, a platforma obsługuje dołączenie przed odłączeniem, może to zachować nadmiarowość; w przeciwnym razie przełącz potwierdzonego członka w tryb offline, wyłącz zasilanie, gdy obudowa nie obsługuje bezpiecznej wymiany podczas pracy, i natychmiast oznacz wyjęty dysk.

Uruchom odbudowę właściwą dla platformy i monitoruj ją

Użyj tożsamości członka puli lub macierzy pokazanej przez własne polecenie stanu, w połączeniu z nową trwałą ścieżką by-id. Nie wklejaj ogólnego polecenia bez zweryfikowania topologii: wymiana w lustrze ZFS, dodanie członka mdraid i wymiana urządzenia Btrfs mają różne maszyny stanów i różne konsekwencje awarii.

Obserwuj postęp, błędy odczytu, naprawy sum kontrolnych, zmiany SMART, temperaturę i resetowania kontrolera. Jedna niezależna relacja z wymiany podkreśla znaczenie zapisania numeru seryjnego uszkodzonego dysku i oczekiwania na zakończenie procesu resilver przed wymianą kolejnego członka.

Jeśli nowy dysk zniknie, liczba błędów na działającym członku wzrośnie lub odbudowa będzie się wielokrotnie rozpoczynać od nowa, zatrzymaj nieistotne obciążenie i zachowaj logi. Nie wyjmuj kolejnego dysku, nie kasuj błędów ani nie wymuszaj ukończenia, dopóki nie zostanie ustalone, który komponent zawodzi i jaki jest obecny poziom nadmiarowości.

Zweryfikuj naprawiony NAS przed wycofaniem starego dysku

Ukończony pasek postępu jest konieczny, ale niewystarczający. Potwierdź, że pula lub macierz jest sprawna, każdy zamierzony członek korzysta z oczekiwanej trwałej tożsamości, żadna partycja nie jest zbyt mała oraz że zaplanowane montowania, udziały, kontenery i kopie zapasowe działają po dwóch ponownych uruchomieniach.

Po rekonstrukcji uruchom kontrolę integralności lub scrub właściwy dla platformy, zgodnie z bezpieczną procedurą, a następnie przywróć reprezentatywny plik i odtwórz obciążenie, które ujawniło usterkę. Sprawdź, czy liczniki błędów pozostają stabilne podczas długotrwałych odczytów i zapisów.

Trzymaj stary dysk w trybie offline i oznaczony, dopóki nowy członek nie przejdzie normalnego obciążenia i cyklu tworzenia kopii zapasowej. Odzyskiwanie jest zakończone, gdy topologia, kontrole danych, kondycja urządzeń i ścieżki aplikacji przejdą pomyślnie; eskaluj problem, jeśli tożsamość pozostaje niejednoznaczna lub którykolwiek działający członek zacznie generować nowe błędy podczas rekonstrukcji.

Wsparcie i wskazówki

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.