Rozwiązanie społecznościowe

Stan ochrony RAID5 w ZimaOS: czysty czy odbudowywany?

A four-disk RAID5 showed Protecting after creation; mdstat showed [UUUU], and the user verified sync_action=idle and array_state=clean.

RAID5 z komunikatem „Ochrona” niekoniecznie utknął ani nie jest automatycznie odbudowywany. W opisanym przypadku plik /proc/mdstat wskazywał obecność wszystkich czterech członków jako [UUUU], podczas gdy sync_action zwracał idle, a array_stateclean. Jest to prawidłowy stan mdraid.

Etykieta „Ochrona” może więc oznaczać sposób prezentowania stanu ochrony/parzystości przez ZimaOS, a nie trwającą odbudowę. Przed przerwaniem działania macierzy sprawdź jej stan na niższym poziomie.

Najpierw odczytaj /proc/mdstat

cat /proc/mdstat

W przypadku czterodyskowej macierzy RAID5 zapis [UUUU] oznacza, że wszystkie cztery oczekiwane gniazda członków są aktywne. Brakujący znak podkreślenia, np. [UU_U], wskazuje na brakującego lub uszkodzonego członka.

Sprawdź, czy trwa synchronizacja

cat /sys/block/md0/md/sync_action

Użytkownik w opisanym przypadku otrzymał wartość idle, co potwierdziło, że w tym momencie nie trwała synchronizacja, odzyskiwanie ani kontrola.

Sprawdź stan macierzy md

cat /sys/block/md0/md/array_state

Wartość clean oznacza, że md uznaje macierz za spójną i niezmienioną.

Dowiedz się, czym jest mapa zamiarów zapisu

Wynik opisany w źródle zawierał mapę bitową. Mapa zamiarów zapisu śledzi obszary zmienione podczas działania macierzy i może ograniczyć zakres odzyskiwania po nieprawidłowym zamknięciu systemu. Sama jej obecność nie oznacza błędu.

Porównaj z bieżącym działaniem RAID w ZimaOS

Aktualny przewodnik ZimaOS po RAID informuje, że RAID5 automatycznie włącza parzystość, a inicjalizacja może być kontynuowana, gdy macierz pozostaje użyteczna.

Kiedy komunikat „Ochrona” wymaga sprawdzenia

Przeprowadź diagnostykę, jeśli /proc/mdstat wskazuje odbudowę lub synchronizację, brakuje co najmniej jednego członka, występują powtarzające się błędy wejścia/wyjścia, interfejs pokazuje stan Degraded albo array_state nie ma wartości clean, mimo że tego oczekujesz.

Nie zatrzymuj macierzy tylko po to, aby usunąć etykietę

Jeśli macierz jest w stanie clean, jest bezczynna i kompletna, zatrzymanie mdraid może spowodować niepotrzebne ryzyko. Sam komunikat „Ochrona” nie jest powodem do ponownego utworzenia puli.

Twórz kopie zapasowe nawet wtedy, gdy RAID działa prawidłowo

RAID5 chroni przed awarią jednego dysku, ale nie przed usunięciem danych, złośliwym oprogramowaniem, awarią kontrolera ani katastrofą. Zawsze przechowuj niezależną kopię zapasową.

Ten przewodnik planowania kopii zapasowych opisuje tę drugą warstwę ochrony.

Komunikat „Ochrona” może pojawić się po utworzeniu lub rozszerzeniu macierzy

Opisana macierz została niedawno utworzona, a następnie zapełniona kilkoma terabajtami danych. ZimaOS może nadal wyświetlać etykietę wskazującą na ochronę, nawet gdy sam mdraid nie zgłasza aktywnej synchronizacji. Stan md na niższym poziomie jest więc wiarygodniejszym sygnałem diagnostycznym.

Sprawdź ukryte błędy wejścia/wyjścia

dmesg | grep -Ei 'md0|nvme|error|timeout|reset' | tail -100

Jeśli macierz jest w stanie clean, ale jądro rejestruje powtarzające się resetowania NVMe lub błędy wejścia/wyjścia, zbadaj problematyczny dysk albo ścieżkę PCIe, zamiast uznawać ten stan za wyłącznie kosmetyczny.

Zapisz prawidłowy stan bazowy

Gdy macierz działa prawidłowo, zapisz kopię /proc/mdstat, array_state oraz numerów seryjnych członków. Jeśli później przejdzie w stan Degraded, będziesz mieć znany, prawidłowy punkt odniesienia do porównania.

FAQ

Czy komunikat „Ochrona” oznacza, że RAID jest odbudowywany?

Niekoniecznie. W opisanym przypadku sync_action miał wartość idle, a macierz była w stanie clean.

Co oznacza [UUUU]?

Wszyscy czterej oczekiwani członkowie mdraid są aktywni.

Czy należy zaczekać przed kopiowaniem danych?

Jeśli rzeczywiście trwa inicjalizacja lub synchronizacja, wydajność może być niższa; sprawdź /proc/mdstat, zamiast polegać wyłącznie na etykiecie.

Kiedy RAID5 jest niesprawny?

Brakujących członków, stanu Degraded, błędów wejścia/wyjścia, niepomyślnej diagnostyki SMART lub aktywnego odzyskiwania po nieoczekiwanym odłączeniu nie należy ignorować.