Niepokój powinny wzbudzić ponowne błędy sum kontrolnych po zapisaniu i wyzerowaniu starego stanu bazowego, a nie sam fakt, że licznik jest różny od zera.
ZFS może naprawić uszkodzony blok, gdy nadmiarowość zapewnia prawidłową kopię, ale naprawa nie wyjaśnia, dlaczego dotarły nieprawidłowe dane. Zapisz zpool status -v i odpowiednie logi systemowe, zweryfikuj kopie zapasowe, a następnie na podstawie powtarzalności, wzorca urządzeń, których dotyczy problem, oraz pomyślnie zakończonego scrubowania zdecyduj, czy zdarzenie było odosobnione, czy usterka nadal występuje.
Zapisz informacje o tym, co ZFS skorygował, zanim cokolwiek wyzerujesz
Zapisz pełny stan puli, znacznik czasu scrubowania, liczbę błędów dla każdego urządzenia oraz listę ewentualnych błędów trwałych. W tym samym czasie zarejestruj także komunikaty jądra dotyczące resetów połączenia, przekroczeń czasu poleceń, usterek kontrolera, błędów maszynowych i nieoczekiwanych zdarzeń zasilania.
Szczegółowe wyjaśnienie społeczności dotyczące naprawionych liczników błędów sum kontrolnych ZFS i ich możliwych przyczyn odróżnia skorygowane bloki od usterki kabla, zasilania, kontrolera, pamięci lub dysku, która mogła je spowodować. Naprawa nie potwierdza sprawności ścieżki sprzętowej.
Przed obciążeniem puli upewnij się, że istnieje inna użyteczna kopia ważnych danych. Zerowanie liczników jest dopuszczalne dopiero po zapisaniu dowodów, ponieważ kolejna decyzja zależy od tego, czy pojawią się rzeczywiście nowe błędy.
Ustal próg decyzji na podstawie powtarzalności i zakresu problemu
Po zapisaniu stanu bazowego wyzeruj liczniki i uruchom jedno scrubowanie w okresie stabilnego zasilania i temperatury. Jeśli scrubowanie zakończy się bez błędów, a podczas normalnego użytkowania nie pojawią się nowe problemy, monitoruj sytuację zamiast wymieniać sprzęt na podstawie jednego historycznego zdarzenia.
Jeśli ten sam dysk uzyska nowe błędy sum kontrolnych, sprawdź jego ścieżkę danych i zasilania, historię SMART, statystyki połączenia oraz port kontrolera. Jeśli błędy pojawią się jednocześnie na kilku dyskach, w pierwszej kolejności sprawdź wspólne elementy, takie jak HBA, backplane, zasilacz, okablowanie, pamięć lub stabilność systemu.
Każdy trwały błąd danych, powtarzający się błąd wejścia/wyjścia, zawieszenie puli lub szybko rosnący licznik zwiększa pilność działania. Wstrzymaj nieistotne zapisy, odśwież kopię zapasową i odizoluj podejrzaną warstwę, zanim kolejne scrubowanie dodatkowo ją obciąży.
Zmieniaj jedną warstwę i potwierdź rezultat
Przy wyłączonym systemie ponownie podłącz lub wymień podejrzany kabel danych albo zasilający, ewentualnie przenieś urządzenie do sprawdzonego portu. Nie wymieniaj kilku warstw jednocześnie, bo w takim przypadku pomyślny rezultat nie wskaże, który element zmienił wynik.
W przypadku wzorca dotyczącego konkretnego urządzenia uruchom test producenta dysku lub kontrolowany odczyt po przeanalizowaniu historii SMART. W przypadku wzorca obejmującego wiele urządzeń sprawdź pamięć i stabilność zasilania oraz skontroluj ścieżkę kontrolera, zanim założysz jednoczesną awarię kilku dysków.
Przewodnik po systemach operacyjnych serwerów domowych pomaga ustalić, gdzie w popularnych platformach NAS i Linux znajdują się informacje o stanie puli, logi jądra i narzędzia do zarządzania kontrolerem.
Zweryfikuj odzyskanie sprawności przy oryginalnym obciążeniu
Po odizolowanej naprawie uruchom pełne scrubowanie, a następnie powtórz obciążenie, które wcześniej ujawniło problem. O odzyskaniu sprawności można mówić, gdy scrubowanie zakończy się bez nowych błędów sum kontrolnych, odczytu lub zapisu, a liczniki pozostaną niezmienione po ponownym uruchomieniu i w kolejnym reprezentatywnym okresie obciążenia.
Wymień dysk, gdy dowody problemu podążają za nim po przeniesieniu do sprawdzonej ścieżki, wyniki SMART lub autotestów również się pogarszają albo po wyeliminowaniu problemów z okablowaniem i zasilaniem nadal pojawiają się nowe błędy. Wymień lub napraw wspólną warstwę, gdy błędy pozostają związane z portem, obudową, kontrolerem lub zdarzeniem zasilania.
Natychmiast eskaluj problem w przypadku błędów trwałych, obniżonego stanu puli bez odpowiedniej nadmiarowości lub niepewności co do tego, która kopia jest źródłem prawdy. Skorygowane zdarzenie jest ostrzeżeniem wymagającym diagnozy; powtarzalna, świeża korekta jest dowodem, że diagnozy nie można odkładać.
FAQ
Czy zpool clear naprawia przyczynę? Nie. Resetuje zapisane liczniki po zapisaniu dowodów; tylko pomyślnie zakończone scrubowanie i stabilne późniejsze obciążenie pokazują, że podstawowa ścieżka nie generuje już błędnych danych.
Czy można zignorować jeden skorygowany błąd sumy kontrolnej? Potraktuj go jako zarejestrowane ostrzeżenie. Jeśli nie powtórzy się po wyzerowaniu stanu bazowego i pomyślnym scrubowaniu, monitorowanie może być proporcjonalnym działaniem; powtarzalność lub powiązane błędy wejścia/wyjścia wymagają odizolowania problemu.
Czy prawidłowy raport SMART wyklucza problem z dyskiem? Nie. SMART może nie wykryć usterek kabla, kontrolera, zasilania ani niektórych usterek urządzenia, dlatego należy połączyć go z analizą zakresu problemu w ZFS, logami systemowymi, kontrolowanymi zamianami oraz scrubowaniem po naprawie.
Wsparcie i wskazówki
Więcej do przeczytania

Jaka jasność wyświetlacza pomaga zmniejszyć zmęczenie oczu podczas długiego przeglądania plików na serwerze NAS?
Nie ma uniwersalnego poziomu jasności wyrażonego w procentach; dopasuj biały ekran do pomieszczenia, ogranicz odblaski, zachowaj czytelność tekstu i zweryfikuj ustawienia podczas przeglądu z...

Jak zmniejszyć napięcie szyi, gdy konsola serwera domowego jest zamontowana zbyt nisko
Przenieś rutynowe zadania z niskiej konsoli lub bezpiecznie podnieś ekran, pozostawiając klawiaturę niżej, a następnie ponownie przetestuj rzeczywistą sesję administratora.

Dlaczego moje oczy męczą się po nocnym monitorowaniu jasnego panelu serwera?
Zmęczenie podczas korzystania z pulpitu nocą często wynika z połączenia niedopasowanej jasności, odblasków, długotrwałego skupienia i rzadszego mrugania; zmień jeden czynnik i bezpiecznie przetestuj...

