Bezpieczne podejście polega na traktowaniu numerów seryjnych macierzy i trwałych identyfikatorów, wymianie jednego potwierdzonego członka, a następnie weryfikacji odbudowy i pierwotnego obciążenia jako sekwencji obserwowalnych etapów, a nie pojedynczego polecenia.
W domowym serwerze NAS z systemem Linux, korzystającym z ZFS, mdraid lub Btrfs, praktyczne ryzyko polega na konieczności wymiany dysku NAS bez pomylenia zmieniających się oznaczeń urządzeń w systemie Linux. Zapisz bieżący stan i punkt odzyskiwania, zacznij od najmniej inwazyjnego sposobu rozróżnienia, interpretuj wyniki pozytywne i negatywne przed zmianą kolejnej zmiennej oraz zatrzymaj się, gdy pamięć masowa stanie się niestabilna lub gdy jedyna możliwa do odzyskania kopia byłaby narażona. Poniższa procedura kończy się dopiero wtedy, gdy pierwotne obciążenie zakończy się powodzeniem lub gdy dowody osiągną granicę wymagającą eskalacji.
Utwórz mapę wymiany numeru seryjnego na zatokę
Zapisz stan macierzy lub puli, topologię urządzeń, informacje SMART, gniazdo obudowy, numer seryjny, WWN oraz dowiązanie symboliczne /dev/disk/by-id dla każdego członka. Oznaczenia urządzeń w systemie Linux mogą zmienić się po ponownym uruchomieniu lub podłączeniu urządzenia podczas pracy, dlatego /dev/sdX jest obserwacją dla bieżącego uruchomienia, a nie trwałą tożsamością używaną w rejestrze wymiany.
Praktyczny przewodnik po domowym serwerze ZFS pokazuje wymianę z użyciem trwałej ścieżki by-id i monitorowanie procesu resilver zamiast polegania na tymczasowym oznaczeniu urządzenia. Ta sama zasada identyfikacji dotyczy mdraid i Btrfs, mimo że używane przez nie polecenia wymiany są różne.
Dopasuj uszkodzonego członka w oprogramowaniu do fizycznej etykiety dwukrotnie: raz przed przełączeniem w tryb offline i ponownie przed wyjęciem sprzętu. Zatrzymaj się, jeśli brakuje przekazywania numeru seryjnego, dwa gniazda zgłaszają tę samą tożsamość mostka lub pula nie może tolerować przejścia kolejnego członka w tryb offline.
Przygotuj zamiennik bez przedwczesnego zmniejszania nadmiarowości
Potwierdź, że nowy dysk ma co najmniej taką samą liczbę użytecznych sektorów, oczekiwany format sektorów i przechodzi podstawowe testy kondycji poza macierzą, jeśli jest to możliwe. Zapisz jego numer seryjny i ścieżkę by-id przed włożeniem. W przypadku członków zaszyfrowanych lub rozruchowych zachowaj również układ partycji, klucze i metadane rozruchowe wymagane przez daną platformę.
Skorzystaj z omówienia ZimaSpace dotyczącego różnych rozmiarów sektorów w lustrze ZFS, gdy zamiennik zgłasza inny logiczny lub fizyczny rozmiar sektora. Pojemność podana na obudowie to za mało; o prawidłowości wymiany decydują rzeczywisty rozmiar, oczekiwania dotyczące ashift lub wyrównania, tablica partycji oraz zasady platformy NAS.
Wymieniaj tylko jedno urządzenie naraz. Jeśli stary dysk jest nadal czytelny, a platforma obsługuje dołączenie przed odłączeniem, może to zachować nadmiarowość; w przeciwnym razie przełącz potwierdzonego członka w tryb offline, wyłącz zasilanie, gdy obudowa nie obsługuje bezpiecznej wymiany podczas pracy, i natychmiast oznacz wyjęty dysk.
Uruchom odbudowę właściwą dla platformy i monitoruj ją
Użyj tożsamości członka puli lub macierzy pokazanej przez własne polecenie stanu, w połączeniu z nową trwałą ścieżką by-id. Nie wklejaj ogólnego polecenia bez zweryfikowania topologii: wymiana w lustrze ZFS, dodanie członka mdraid i wymiana urządzenia Btrfs mają różne maszyny stanów i różne konsekwencje awarii.
Obserwuj postęp, błędy odczytu, naprawy sum kontrolnych, zmiany SMART, temperaturę i resetowania kontrolera. Jedna niezależna relacja z wymiany podkreśla znaczenie zapisania numeru seryjnego uszkodzonego dysku i oczekiwania na zakończenie procesu resilver przed wymianą kolejnego członka.
Jeśli nowy dysk zniknie, liczba błędów na działającym członku wzrośnie lub odbudowa będzie się wielokrotnie rozpoczynać od nowa, zatrzymaj nieistotne obciążenie i zachowaj logi. Nie wyjmuj kolejnego dysku, nie kasuj błędów ani nie wymuszaj ukończenia, dopóki nie zostanie ustalone, który komponent zawodzi i jaki jest obecny poziom nadmiarowości.
Zweryfikuj naprawiony NAS przed wycofaniem starego dysku
Ukończony pasek postępu jest konieczny, ale niewystarczający. Potwierdź, że pula lub macierz jest sprawna, każdy zamierzony członek korzysta z oczekiwanej trwałej tożsamości, żadna partycja nie jest zbyt mała oraz że zaplanowane montowania, udziały, kontenery i kopie zapasowe działają po dwóch ponownych uruchomieniach.
Po rekonstrukcji uruchom kontrolę integralności lub scrub właściwy dla platformy, zgodnie z bezpieczną procedurą, a następnie przywróć reprezentatywny plik i odtwórz obciążenie, które ujawniło usterkę. Sprawdź, czy liczniki błędów pozostają stabilne podczas długotrwałych odczytów i zapisów.
Trzymaj stary dysk w trybie offline i oznaczony, dopóki nowy członek nie przejdzie normalnego obciążenia i cyklu tworzenia kopii zapasowej. Odzyskiwanie jest zakończone, gdy topologia, kontrole danych, kondycja urządzeń i ścieżki aplikacji przejdą pomyślnie; eskaluj problem, jeśli tożsamość pozostaje niejednoznaczna lub którykolwiek działający członek zacznie generować nowe błędy podczas rekonstrukcji.
Wsparcie i wskazówki
Więcej do przeczytania

Przewodnik migracji Borg Backup dotyczący przenoszenia repozytorium na nową pamięć masową
Przenieś repozytorium Borg jako jeden spójny obiekt: zatrzymaj procesy zapisujące, zachowaj klucze i tożsamość, zweryfikuj przywracanie, a następnie zaktualizuj klientów, zachowując źródło.

Proces konserwacji repozytorium Restic: sprawdzanie, przycinanie, kompresowanie i testowanie przywracania
Restic nie ma osobnej komendy compact: prune wykonuje przepakowywanie. Chroń blokady i wolne miejsce, sprawdź ponownie po zakończeniu, a na koniec wykonaj odizolowane przywracanie.

Przewodnik odzyskiwania kopii zapasowej Time Machine z serwera NAS w przypadku uszkodzonej lub porzuconej historii kopii zapasowych
Zachowaj stary pakiet. Przed wyborem naprawy lub nowego łańcucha rozdziel dostęp do NAS, tożsamość miejsca docelowego, uszkodzenia obrazu i porzuconą historię.

