Uznaj odbudowę RAID za zatrzymaną tylko wtedy, gdy liczba przetworzonych bloków przestaje rosnąć podczas powtarzanych kontroli, a logi nie wykazują świadomej pauzy, ograniczenia priorytetu, kolejki fazy ani możliwego do odzyskania ponownego próbowania. Sam upływ czasu nie wystarcza.
Duże macierze mogą spędzać godziny w wolnym obszarze, gwałtownie zmieniać prędkość pod obciążeniem aplikacji lub zatrzymywać się między rekonstrukcją a weryfikacją. Ustal ruch za pomocą liczników i logów przed interwencją, ponieważ zatrzymanie lub ponowne składanie macierzy może być bardziej ryzykowne niż czekanie.
Używaj Różnicy Postępu, a nie pojedynczego procentu
Zapisuj dokładną liczbę przetworzonych bloków, procent, prędkość i szacowany czas zakończenia w stałych odstępach czasu. Odbudowa postępuje, gdy liczba bloków rośnie, nawet jeśli zaokrąglony procent pozostaje bez zmian. W macierzach wieloterabajtowych jedna dziesiąta procenta może oznaczać dużą ilość pracy.
Sprawdzaj kontroler lub system operacyjny za każdym razem z tego samego interfejsu. Różne panele mogą buforować status lub raportować różne fazy. Pasek postępu, który wydaje się zablokowany, podczas gdy liczniki bloków rosną, to problem monitorowania, a nie zatrzymana odbudowa.
Oszacuj Lokalną Bazę Referencyjną zamiast Uniwersalnego Limit Czasu
Nie ma jednej bezpiecznej liczby godzin. Czas odbudowy zależy od użytej pojemności, układu RAID, prędkości dysków, błędów, polityki kontrolera, obciążenia w tle oraz tego, czy implementacja kopiuje wszystkie bloki, czy tylko przydzielone obszary.
Wykorzystaj pierwszą stabilną godzinę do oszacowania przybliżonego zakresu, a następnie porównaj późniejsze interwały. Bardzo wolna prędkość resynchronizacji mdadm może wynikać z obciążenia, wyrównania, zachowania łącza lub problemów z dyskiem; prawidłowa diagnoza wymaga więcej niż tylko zwiększenia limitu prędkości.
Szukaj Świadomej Pauzy lub Nowej Fazy
Niektóre systemy ograniczają odzyskiwanie, aby chronić operacje I/O na pierwszym planie, wstrzymują skanowanie podczas resilveringu, czekają na przypisanie zapasowego dysku lub przechodzą z odbudowy do inicjalizacji parzystości lub weryfikacji spójności. Etykieta może pozostać „odbudowa” nawet gdy aktywne zadanie się zmienia.
Sprawdź zaplanowaną konserwację, ustawienia zasilania, limity temperatury, priorytet odbudowy i ruch aplikacji. Jeśli prędkość rośnie, gdy obciążenie pierwszoplanowe spada, macierz jest ograniczona zasobami, a nie zablokowana.
Powtarzające się błędy odczytu powodują rzeczywiste zatrzymanie
Dysk źródłowy może długo próbować odczytać słaby sektor, powodując spadek przepustowości w pobliżu tego samego zakresu bloków. Jeśli kontroler ostatecznie zgłosi nieodwracalny błąd odczytu, odbudowa może zostać przerwana, ponieważ nadmiarowość nie może odtworzyć tego obszaru.
Odbudowa zatrzymana przez błędy odczytu pokazuje, dlaczego ostatni udany blok i błąd jądra zaraz po nim są ważne. Nie restartuj wielokrotnie odzyskiwania, które zawodzi pod tym samym adresem bez ochrony danych i sprawdzenia źródłowego dysku.
Prędkość zero z aktywnością w logu może oznaczać ponowne próby
Wyświetlana prędkość zero może wystąpić podczas ponownych prób poleceń, resetów urządzenia, odzyskiwania błędów, aktualizacji metadanych lub tymczasowej pauzy. Obserwuj czas zajętości dysku, głębokość kolejki, zdarzenia kontrolera i komunikaty jądra. Powtarzające się resetowania lub przekroczenia czasu nie są oznaką zdrowego postępu.
Odzyskiwanie, które się wielokrotnie przerywa, pokazuje też, że nie każde zatrzymanie ma oczywistą awarię SMART. Zarejestruj dokładny punkt i wszystkie logi zamiast zakładać, że nowy dysk lub wyższa prędkość rozwiążą problem.
Użyj praktycznej tabeli decyzji o zatrzymaniu
| Obserwacja w dwóch lub więcej przedziałach czasowych | Interpretacja | Działanie |
|---|---|---|
| Przetworzone bloki rosną | Wolno, ale postępuje | Kontynuuj monitorowanie |
| Procent niezmieniony, liczba bloków rośnie | Wyświetl zaokrąglenie | Czekaj |
| Bloki niezmienione, zadanie mówi o pauzie | Celowe wstrzymanie | Znajdź powód pauzy lub polityki |
| Bloki niezmienione, powtarzające się próby/zerowania | Problem sprzętowy lub ścieżki | Zmniejsz zapisy; sprawdź źródło i połączenie |
| Zatrzymuje się na tym samym bloku po restarcie | Trwały obszar nieczytelny | Chroń dane; zatrzymaj ślepe ponowne próby |
| 99,9% z aktywną fazą kontynuacji | Finalizacja lub prace związane z metadanymi | Zweryfikuj etykietę operacji i logi |
Wymagaj dowodów z co najmniej dwóch niezależnych sygnałów, zanim uznasz odbudowę za zatrzymaną: brak ruchu liczników plus błąd, stan przerwania lub trwały identyczny punkt zatrzymania.
Co zrobić przed ponownym uruchomieniem czegokolwiek
- Zapisz szczegóły macierzy, numery seryjne członków, liczniki przetworzonych bloków oraz pełny dziennik zdarzeń.
- Zredukuj nieistotne operacje I/O aplikacji i potwierdź, że dyski docelowe i źródłowe są nadal wykrywane.
- Sprawdź wskaźniki SMART nośnika oraz liczniki resetów łącza lub CRC na każdym aktywnym źródle.
- Potwierdź, że nie ma stanu wstrzymania, limitu temperatury, polityki priorytetu ani oczekującej fazy weryfikacji.
- Przekaż do kopii zapasowej, obrazowania lub odzyskiwania, gdy ten sam nieczytelny zakres zatrzymuje powtarzane próby.
Nie używaj poleceń stop, assemble, force-online ani metadata-clear, dopóki nie poznasz stanu macierzy i dokładnej implementacji.
Porównaj postęp podczas spokojnego okresu
Przydatny test zatrzymania wymaga kontrolowanego okna obserwacji. Wstrzymaj duże transfery i zaplanowane zadania, a następnie zanotuj liczniki na początku i końcu interwału. To oddziela konkurencję pierwszoplanową od procesu odzyskiwania, który nie może samodzielnie postępować.
Jeśli postęp wznawia się po spadku obciążenia, wybierz niższy priorytet konserwacji lub spokojniejszy harmonogram. Jeśli liczniki pozostają stałe, a ten sam błąd się powtarza, dalsze czekanie bez dochodzenia nie wnosi wiele informacji.
FAQ
Czy 99,9 procent przez godzinę to automatycznie zatrzymanie?
Nie. Końcowe aktualizacje metadanych lub faza weryfikacji mogą zająć czas. Potwierdź, czy przetwarzane bloki, zapisy na urządzeniu lub stan operacji nadal się zmieniają, zanim podejmiesz interwencję.
Czy powinienem podnieść limit prędkości odbudowy?
Tylko po udowodnieniu, że dyski są zdrowe, a polityka I/O pierwszoplanowego jest wąskim gardłem. Wyższy limit może pogorszyć opóźnienia aplikacji i zwiększyć obciążenie dysku źródłowego na granicy wydajności.
Kiedy powinienem przestać czekać?
Przestań traktować to jako normalne, gdy liczniki pozostają niezmienione podczas powtarzanych kontroli, a logi pokazują przerwanie, powtarzające się resetowanie urządzenia, nieodwracalny błąd odczytu lub awarię w tym samym zakresie bloków.
Definicja zatrzymania pracy
Odbudowa zatrzymuje się, gdy prace mierzalne ustały, a system nie potrafi wyjaśnić przerwy jako polityki, obciążenia lub nowej fazy. Używaj liczników i dowodów błędów, a nie niepokoju czy czasu zegarowego.
Wsparcie i wskazówki
Więcej do przeczytania

Dlaczego macierz RAID staje się nieaktywna po utracie zasilania?
Nieaktywna macierz często oznacza, że znaleziono metadane, ale system nie miał wystarczającej pewności ani członków, aby bezpiecznie ją uruchomić po nieprawidłowym zamknięciu.

Jakie są ryzyka związane z wymuszaniem ponownego podłączenia brakującego członka RAID?
Opcje wymuszania mogą ominąć kontrole bezpieczeństwa dotyczące przestarzałych metadanych, niezsynchronizowanej parzystości, brakujących zapisów lub aktywnych pul; przed ich użyciem sprawdź i zachowaj dowody.

Jak odróżnić uszkodzony kabel SATA od uszkodzonego dysku NAS
Śledź, czy błędy dotyczą dysku, czy pozostają na ścieżce SATA, i oddziel liczniki transportu od dowodów stanu nośnika przed wymianą sprzętu.

