Jeśli błędy I/O nadal rosną podczas rekonstrukcji NAS, zmniejsz zapisy i traktuj działającego członka lub ścieżkę połączenia jako niestabilne. Postęp procentowy nie oznacza, że rosnące błędy odczytu można bezpiecznie ignorować.
Natychmiastowym celem jest zachowanie czytelnych danych i ustalenie, czy błędy to awarie nośnika, resetowanie łącza czy uszkodzony cel. Zapisz logi i numery seryjne, potwierdź status kopii zapasowej i unikaj wielokrotnego restartowania rekonstrukcji, gdy zestaw źródłowy się pogarsza.
Rosnące błędy mają pierwszeństwo przed paskiem postępu
Procent rekonstrukcji odpowiada na pytanie, jak dużo celu zostało przetworzone. Nie odpowiada jednak, czy każdy odczyt ze źródła zakończył się sukcesem. Porównuj skumulowane liczniki odczytu, zapisu, sum kontrolnych, nośnika i przekroczenia czasu polecenia w regularnych odstępach.
Gdy rekonstrukcja postępuje, a błędy rosną, macierz może odtwarzać większość bloków, ale zawodzić w określonych obszarach. Jeden nieudany odczyt ze źródła może mieć większe znaczenie niż tysiące udanych, gdy poziom RAID nie ma już kopii dla tego bloku.
Zidentyfikuj, które urządzenie generuje błędy
Przypisz każdy identyfikator z logu do fizycznego numeru seryjnego. Określ, czy błędy pochodzą od starego, działającego członka, nowego celu, czy wspólnej ścieżki kontrolera. Błąd zapisu na celu i błąd odczytu ze źródła wymagają różnych decyzji.
Dane o stanie dysku pomagają ustalić priorytety w dochodzeniu. Operacyjne wykorzystanie przez Backblaze pięciu atrybutów ostrzegawczych SMART skupia uwagę na wskaźnikach przeniesionych, niekorygowalnych, przekroczenia czasu, oczekujących i offline-niekorygowalnych, zamiast polegać na pojedynczej ogólnej ocenie stanu.
Oddziel błędy nośnika od błędów łącza
Oczekujące lub niekorygowalne sektory wskazują na nośnik nieczytelny. Wzrost UDMA CRC, resetowanie transportu i powtarzające się odłączania częściej wskazują na problem z kablem, płytą tylną, mostkiem, zasilaniem lub ścieżką kontrolera. Oba mogą przerwać rekonstrukcję, ale wymiana dysków nie rozwiąże problemu wspólnego łącza.
Wyjaśnienie liczby błędów UDMA CRC rozróżnia błędy transferu interfejsu od uszkodzeń talerza. Zapisz surową liczbę, popraw jedną zmienną połączenia i sprawdź, czy licznik nadal rośnie.
Nie uruchamiaj ponownie odbudowy, która zawodzi
Każde pełne ponowne uruchomienie ponownie odczytuje przetrwałych członków i może obciążać te same słabe obszary bez uzyskania lepszego wyniku. Jeśli operacja wielokrotnie przerywa się w pobliżu tego samego adresu lub drugi dysk odłącza się, zatrzymaj rutynowe próby naprawy.
Odbudowa zablokowana przez błędy źródła pokazuje podstawowe ograniczenie: gdy jedyne dobre źródło ma nieodwracalny błąd odczytu, macierz nie ma innego miejsca, z którego mogłaby pobrać brakujące dane. Opcje wymuszenia nie mogą odtworzyć nieznanej zawartości.
Wybierz między kontynuacją, kopiowaniem a obrazowaniem
| Stan | Preferowany kierunek | Dlaczego |
|---|---|---|
| Błędy stabilne, odbudowa postępuje | Monitoruj przy zmniejszonym obciążeniu | Odzyskiwanie może zakończyć się normalnie |
| Błędy łącza rosną, nośnik stabilny | Stabilizuj ścieżkę kabla/kieszeni/kontrolera | Usterka może być poza dyskiem |
| Błędy nośnika źródłowego rosną | Najpierw skopiuj krytyczne czytelne dane | Pozostała redundancja słabnie |
| Powtarzające się przerwanie w tym samym zakresie | Zatrzymaj ślepe próby odbudowy | Trwały obszar nieczytelny |
| Drugi członek odłącza się lub ulega awarii | Rozważ proces obrazowania/odzyskiwania | Macierz może przekraczać tolerancję błędów |
Jeśli dane są nie do zastąpienia, a kopia zapasowa nie została zweryfikowana, obrazowanie czytelnych członków może być bezpieczniejsze niż pozwalanie na kolejną automatyczną odbudowę. Proces odzyskiwania zorientowany na awarię drugiego dysku podczas odbudowy podkreśla zatrzymanie prób naprawy obciążonych zapisem, gdy zestaw przetrwały jest niestabilny.
Zmniejsz pracę na pierwszym planie bez ukrywania incydentu
Zatrzymaj kopie zapasowe, indeksowanie mediów, pobieranie, maszyny wirtualne i inne niepotrzebne zapisy. Zachowaj tylko usługi niezbędne do kopiowania krytycznych danych lub monitorowania macierzy. Obniżenie obciążenia może zmniejszyć kolejkę i ułatwić interpretację czasu wystąpienia błędów.
Nie czyść logów, nie resetuj liczników SMART ani nie uruchamiaj ponownie wielokrotnie przed zarejestrowaniem dowodów. Restart może zmienić nazwy urządzeń i usunąć sekwencję pokazującą, który członek zawiódł jako pierwszy.
Co zarejestrować przed wyłączeniem zasilania
- Stan macierzy, poziom RAID, role członków, cel rekonstrukcji i dokładne liczniki postępu
- Każdy model dysku, numer seryjny, zatoka, port kontrolera i aktualny identyfikator urządzenia
- Zdarzenia jądra lub kontrolera obejmujące pierwszą awarię aż do najnowszego błędu I/O
- Surowe wartości SMART dotyczące nośnika, limitów czasowych, temperatury i błędów interfejsu
- Lista nieczytelnych plików lub zakresów bloków oraz status najnowszej zweryfikowanej kopii zapasowej
Ten zapis wspiera kontrolowany test kabla, wymianę dysku, klonowanie lub profesjonalne odzyskiwanie bez zgadywania, który członek zawierał najświeższe dane.
Wymagaj stabilnego monitoringu po każdej interwencji
Po wymianie kabla, przeniesieniu potwierdzonego dysku o danym numerze seryjnym lub zmniejszeniu obciążenia, zresetuj tylko odpowiednią linię bazową porównania i obserwuj, czy problem się powtarza. Tymczasowa poprawa nie jest dowodem, że podstawowa usterka zniknęła.
Macierz powinna zakończyć odzyskiwanie, powrócić do pełnego członkostwa i przejść późniejszą kontrolę integralności bez nowych błędów I/O. Dopóki wszystkie trzy warunki nie są spełnione pod normalnym, reprezentatywnym obciążeniem, bezpiecznie utrzymuj incydent otwarty i zachowaj zarejestrowane logi.
Najczęściej zadawane pytania
Czy mogę pozwolić na dokończenie rekonstrukcji, jeśli pojawi się tylko kilka błędów?
Tylko gdy błędy są zrozumiałe, stabilne, a dane zostały zarchiwizowane. Rosnąca liczba błędów odczytu źródła lub powtarzające się resetowania to sygnał eskalacji, nawet gdy procent docelowy nadal rośnie.
Czy powinienem wymienić dysk z najwyższym licznikiem SMART?
Nie automatycznie. Potwierdź, czy błędy dotyczą dysku o danym numerze seryjnym, czy pozostają przy jego zatoce i ścieżce połączenia. Wymiana niewłaściwego członka podczas pracy w stanie degradacji może zniszczyć pozostałe ważne źródło.
Czy ukończona rekonstrukcja może nadal zawierać uszkodzone pliki?
Tak. Niektóre implementacje mogą zakończyć się, raportując nieodwracalne sektory lub uszkodzone pliki. Zawsze sprawdzaj końcowy raport błędów i wykonaj kontrolę integralności po powrocie macierzy do stabilnego stanu.
Warunek zatrzymania
Gdy podczas rekonstrukcji rośnie liczba błędów I/O, chroń czytelne dane, zanim dążysz do ukończenia. Kontynuuj tylko po potwierdzeniu, że zestaw źródłowy i ścieżka połączenia są wystarczająco stabilne, aby dostarczyć każdy pozostały blok.
Wsparcie i wskazówki
Więcej do przeczytania

Dlaczego macierz RAID staje się nieaktywna po utracie zasilania?
Nieaktywna macierz często oznacza, że znaleziono metadane, ale system nie miał wystarczającej pewności ani członków, aby bezpiecznie ją uruchomić po nieprawidłowym zamknięciu.

Jakie są ryzyka związane z wymuszaniem ponownego podłączenia brakującego członka RAID?
Opcje wymuszania mogą ominąć kontrole bezpieczeństwa dotyczące przestarzałych metadanych, niezsynchronizowanej parzystości, brakujących zapisów lub aktywnych pul; przed ich użyciem sprawdź i zachowaj dowody.

Jak odróżnić uszkodzony kabel SATA od uszkodzonego dysku NAS
Śledź, czy błędy dotyczą dysku, czy pozostają na ścieżce SATA, i oddziel liczniki transportu od dowodów stanu nośnika przed wymianą sprzętu.

