Odbudowa RAID w toku, ale rośnie liczba błędów I/O: co zrobić?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Jeśli błędy I/O nadal rosną podczas rekonstrukcji NAS, zmniejsz zapisy i traktuj działającego członka lub ścieżkę połączenia jako niestabilne. Postęp procentowy nie oznacza, że rosnące błędy odczytu można bezpiecznie ignorować.

Natychmiastowym celem jest zachowanie czytelnych danych i ustalenie, czy błędy to awarie nośnika, resetowanie łącza czy uszkodzony cel. Zapisz logi i numery seryjne, potwierdź status kopii zapasowej i unikaj wielokrotnego restartowania rekonstrukcji, gdy zestaw źródłowy się pogarsza.

Rosnące błędy mają pierwszeństwo przed paskiem postępu

Procent rekonstrukcji odpowiada na pytanie, jak dużo celu zostało przetworzone. Nie odpowiada jednak, czy każdy odczyt ze źródła zakończył się sukcesem. Porównuj skumulowane liczniki odczytu, zapisu, sum kontrolnych, nośnika i przekroczenia czasu polecenia w regularnych odstępach.

Gdy rekonstrukcja postępuje, a błędy rosną, macierz może odtwarzać większość bloków, ale zawodzić w określonych obszarach. Jeden nieudany odczyt ze źródła może mieć większe znaczenie niż tysiące udanych, gdy poziom RAID nie ma już kopii dla tego bloku.

Zidentyfikuj, które urządzenie generuje błędy

Przypisz każdy identyfikator z logu do fizycznego numeru seryjnego. Określ, czy błędy pochodzą od starego, działającego członka, nowego celu, czy wspólnej ścieżki kontrolera. Błąd zapisu na celu i błąd odczytu ze źródła wymagają różnych decyzji.

Dane o stanie dysku pomagają ustalić priorytety w dochodzeniu. Operacyjne wykorzystanie przez Backblaze pięciu atrybutów ostrzegawczych SMART skupia uwagę na wskaźnikach przeniesionych, niekorygowalnych, przekroczenia czasu, oczekujących i offline-niekorygowalnych, zamiast polegać na pojedynczej ogólnej ocenie stanu.

Oddziel błędy nośnika od błędów łącza

Oczekujące lub niekorygowalne sektory wskazują na nośnik nieczytelny. Wzrost UDMA CRC, resetowanie transportu i powtarzające się odłączania częściej wskazują na problem z kablem, płytą tylną, mostkiem, zasilaniem lub ścieżką kontrolera. Oba mogą przerwać rekonstrukcję, ale wymiana dysków nie rozwiąże problemu wspólnego łącza.

Wyjaśnienie liczby błędów UDMA CRC rozróżnia błędy transferu interfejsu od uszkodzeń talerza. Zapisz surową liczbę, popraw jedną zmienną połączenia i sprawdź, czy licznik nadal rośnie.

Nie uruchamiaj ponownie odbudowy, która zawodzi

Każde pełne ponowne uruchomienie ponownie odczytuje przetrwałych członków i może obciążać te same słabe obszary bez uzyskania lepszego wyniku. Jeśli operacja wielokrotnie przerywa się w pobliżu tego samego adresu lub drugi dysk odłącza się, zatrzymaj rutynowe próby naprawy.

Odbudowa zablokowana przez błędy źródła pokazuje podstawowe ograniczenie: gdy jedyne dobre źródło ma nieodwracalny błąd odczytu, macierz nie ma innego miejsca, z którego mogłaby pobrać brakujące dane. Opcje wymuszenia nie mogą odtworzyć nieznanej zawartości.

Wybierz między kontynuacją, kopiowaniem a obrazowaniem

Stan Preferowany kierunek Dlaczego
Błędy stabilne, odbudowa postępuje Monitoruj przy zmniejszonym obciążeniu Odzyskiwanie może zakończyć się normalnie
Błędy łącza rosną, nośnik stabilny Stabilizuj ścieżkę kabla/kieszeni/kontrolera Usterka może być poza dyskiem
Błędy nośnika źródłowego rosną Najpierw skopiuj krytyczne czytelne dane Pozostała redundancja słabnie
Powtarzające się przerwanie w tym samym zakresie Zatrzymaj ślepe próby odbudowy Trwały obszar nieczytelny
Drugi członek odłącza się lub ulega awarii Rozważ proces obrazowania/odzyskiwania Macierz może przekraczać tolerancję błędów

Jeśli dane są nie do zastąpienia, a kopia zapasowa nie została zweryfikowana, obrazowanie czytelnych członków może być bezpieczniejsze niż pozwalanie na kolejną automatyczną odbudowę. Proces odzyskiwania zorientowany na awarię drugiego dysku podczas odbudowy podkreśla zatrzymanie prób naprawy obciążonych zapisem, gdy zestaw przetrwały jest niestabilny.

Zmniejsz pracę na pierwszym planie bez ukrywania incydentu

Zatrzymaj kopie zapasowe, indeksowanie mediów, pobieranie, maszyny wirtualne i inne niepotrzebne zapisy. Zachowaj tylko usługi niezbędne do kopiowania krytycznych danych lub monitorowania macierzy. Obniżenie obciążenia może zmniejszyć kolejkę i ułatwić interpretację czasu wystąpienia błędów.

Nie czyść logów, nie resetuj liczników SMART ani nie uruchamiaj ponownie wielokrotnie przed zarejestrowaniem dowodów. Restart może zmienić nazwy urządzeń i usunąć sekwencję pokazującą, który członek zawiódł jako pierwszy.

Co zarejestrować przed wyłączeniem zasilania

  • Stan macierzy, poziom RAID, role członków, cel rekonstrukcji i dokładne liczniki postępu
  • Każdy model dysku, numer seryjny, zatoka, port kontrolera i aktualny identyfikator urządzenia
  • Zdarzenia jądra lub kontrolera obejmujące pierwszą awarię aż do najnowszego błędu I/O
  • Surowe wartości SMART dotyczące nośnika, limitów czasowych, temperatury i błędów interfejsu
  • Lista nieczytelnych plików lub zakresów bloków oraz status najnowszej zweryfikowanej kopii zapasowej

Ten zapis wspiera kontrolowany test kabla, wymianę dysku, klonowanie lub profesjonalne odzyskiwanie bez zgadywania, który członek zawierał najświeższe dane.

Wymagaj stabilnego monitoringu po każdej interwencji

Po wymianie kabla, przeniesieniu potwierdzonego dysku o danym numerze seryjnym lub zmniejszeniu obciążenia, zresetuj tylko odpowiednią linię bazową porównania i obserwuj, czy problem się powtarza. Tymczasowa poprawa nie jest dowodem, że podstawowa usterka zniknęła.

Macierz powinna zakończyć odzyskiwanie, powrócić do pełnego członkostwa i przejść późniejszą kontrolę integralności bez nowych błędów I/O. Dopóki wszystkie trzy warunki nie są spełnione pod normalnym, reprezentatywnym obciążeniem, bezpiecznie utrzymuj incydent otwarty i zachowaj zarejestrowane logi.

Najczęściej zadawane pytania

Czy mogę pozwolić na dokończenie rekonstrukcji, jeśli pojawi się tylko kilka błędów?

Tylko gdy błędy są zrozumiałe, stabilne, a dane zostały zarchiwizowane. Rosnąca liczba błędów odczytu źródła lub powtarzające się resetowania to sygnał eskalacji, nawet gdy procent docelowy nadal rośnie.

Czy powinienem wymienić dysk z najwyższym licznikiem SMART?

Nie automatycznie. Potwierdź, czy błędy dotyczą dysku o danym numerze seryjnym, czy pozostają przy jego zatoce i ścieżce połączenia. Wymiana niewłaściwego członka podczas pracy w stanie degradacji może zniszczyć pozostałe ważne źródło.

Czy ukończona rekonstrukcja może nadal zawierać uszkodzone pliki?

Tak. Niektóre implementacje mogą zakończyć się, raportując nieodwracalne sektory lub uszkodzone pliki. Zawsze sprawdzaj końcowy raport błędów i wykonaj kontrolę integralności po powrocie macierzy do stabilnego stanu.

Warunek zatrzymania

Gdy podczas rekonstrukcji rośnie liczba błędów I/O, chroń czytelne dane, zanim dążysz do ukończenia. Kontynuuj tylko po potwierdzeniu, że zestaw źródłowy i ścieżka połączenia są wystarczająco stabilne, aby dostarczyć każdy pozostały blok.

Wsparcie i wskazówki

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.