Wolumen NAS, który staje się tylko do odczytu po niebezpiecznym wyłączeniu, zwykle chroni uszkodzone metadane lub reaguje na błędy I/O pamięci masowej — a nie po prostu zmienia uprawnienia.
Jeśli twoje udziały nadal się otwierają, ale przesyłanie, bazy danych aplikacji lub skanowanie mediów zawodzi, powstrzymaj się od wymuszonego ponownego montowania w trybie odczytu i zapisu. Najbezpieczniejszą drogą jest zachowanie czytelnych danych, zidentyfikowanie, czy blokada występuje na poziomie udziału, systemu plików, puli czy dysku, a następnie użycie metody naprawy przeznaczonej dla tej warstwy pamięci masowej.
Najpierw zamroź zmiany i chroń czytelne dane
Traktuj tryb tylko do odczytu jako ostrzeżenie, a nie samą usterkę. Wstrzymaj zadania synchronizacji, kontenery, indeksowanie mediów, pobieranie i rotację kopii zapasowych, aby powtarzające się próby nie zacierały pierwotnych błędów ani nie obciążały słabego dysku.
Jeśli ważne pliki pozostają czytelne, skopiuj najcenniejsze dane na oddzielne, zdrowe nośniki przed próbą naprawy. W jednym zgłoszonym przypadku system plików tylko do odczytu po awarii zasilania powrócił po tymczasowych próbach naprawy, co pokazuje, dlaczego nawrót należy traktować jako nierozwiązany.
- Wstrzymaj usługi i zapisy klientów.
- Skopiuj krytyczne czytelne pliki w inne miejsce.
- Zachowaj ekrany statusu pamięci masowej i logi zdarzeń.
- Zapisz układ puli i typ systemu plików.
- Rozpocznij kontrole bez zmiany macierzy.
Ten porządek zachowuje zarówno dane, jak i dowody. Restart, wymuszone złożenie, naprawa lub ponowne montowanie mogą zmienić stan, który musisz zdiagnozować, więc nie wykonuj ich jako pierwszego eksperymentu.
Co właściwie stało się tylko do odczytu?
Nieudane przesłanie nie dowodzi, że cały wolumen jest tylko do odczytu. Udział, zbiór danych, katalog aplikacji, system plików, pula pamięci masowej lub urządzenie fizyczne mogą blokować zapisy, a każda warstwa wymaga innej naprawy.
Porównaj awarię z panelu NAS i z więcej niż jednego klienta. Poniższy wzór oddziela problem z dostępem od zdarzenia ochrony pamięci masowej, zanim dotkniesz dysków lub uruchomisz narzędzie do naprawy systemu plików.
| Widoczny rezultat | Prawdopodobna warstwa | Pierwsza bezpieczna kontrola | Następne działanie |
|---|---|---|---|
| Jeden użytkownik nie może zapisać, ale inny może | Konto, ACL lub uprawnienia udziału | Porównaj dostęp użytkownika i grupy | Popraw dostęp bez naprawy pamięci masowej |
| Jedna aplikacja lub udział nie działa, podczas gdy inne zapisują | Zbiór danych, udział lub aplikacja | Sprawdź ścieżkę i limit usługi | Napraw izolowaną warstwę usług |
| Każdy lokalny i sieciowy zapis kończy się niepowodzeniem | System plików lub wolumen | Potwierdź stan montowania i wolumenu | Przeczytaj logi przed naprawą |
| Pula jest zdegradowana, zawieszona lub brakuje urządzenia | RAID, pula, kontroler lub dysk | Sprawdź status członka i błędu | Najpierw ustabilizuj dolną warstwę |
Jeśli sam NAS może utworzyć plik testowy, ale klienci nie, pozostań na warstwie systemu plików. Jeśli lokalne zapisy również zawodzą, a panel raportuje wolumin tylko do odczytu, kontynuuj analizę dzienników i stanu puli.
Przeczytaj dzienniki zanim znikną
Pierwszym użytecznym dowodem jest zdarzenie bezpośrednio przed tym, jak wolumin stał się tylko do odczytu. Przejrzyj dziennik zdarzeń systemowych, historię menedżera magazynu i komunikaty jądra dla dotkniętego i poprzedniego rozruchu.
Niektóre systemy plików zatrzymują zapisy po wykryciu błędu. W przypadku, gdy system nagle stał się tylko do odczytu, osoby reagujące ostrzegały, że nowe wpisy dziennika mogą nie zostać zapisane na dysku. Zapisz aktualne komunikaty jądra przed ponownym uruchomieniem, jeśli to możliwe.
Zapisz wpisy zawierające błędy systemu plików, przerwania dziennika, błędy sum kontrolnych, resetowanie urządzeń, przekroczenia czasu lub błędy I/O odczytu/zapisu. Zapisz identyfikator urządzenia i znacznik czasu; powtarzające się błędy na tym samym członku są ważniejsze niż ogólne powiadomienie o „nieczystym wyłączeniu”.
Sprawdź pulę lub RAID przed systemem plików
System plików znajduje się na warstwie puli, zestawu RAID, woluminu logicznego, kontrolera i dysków. Jeśli ta niższa warstwa jest niekompletna lub niestabilna, naprawa systemu plików może odczytać niespójne dane lub zwiększyć obciążenie w najgorszym momencie.
W przypadku Linux software RAID, brudna i zdegradowana macierz RAID 5 lub RAID 6 może nieść ryzyko niewykrywalnej korupcji; zasada brudnej, zdegradowanej macierzy wyjaśnia, dlaczego automatyczne uruchomienie może zostać odrzucone. Nie wymuszaj montażu tylko po to, by usunąć ostrzeżenie z panelu.
Sprawdź, czy każdy członek jest obecny, czy przebudowa lub resilver jest aktywny oraz czy liczniki odczytu, zapisu lub sum kontrolnych rosną. Zapisz kolejność członków i dokładny status bez wymuszania montażu, wymiany dysku lub uruchamiania skanowania. Ustabilizuj pulę przed sprawdzeniem systemu plików nad nią.
Sprawdź stan dysku, okablowanie i zasilanie
Sprawdź każdy dysk HDD, SSD i NVMe, w tym urządzenia cache i metadane. Użyj strony zdrowia NAS, aby zbadać stan SMART lub NVMe, ostatnie autotesty, temperatury, błędy nośnika oraz czy któreś urządzenie zniknęło po wyłączeniu.
Nie polegaj wyłącznie na jednym zielonym oznaczeniu „zdrowy”. Koreluj wyniki zdrowia z błędami I/O jądra, resetami urządzeń oraz czasem zmiany stanu woluminu. Pozytywne podsumowanie nie wyjaśnia błędu zarejestrowanego gdzie indziej na ścieżce magazynowania.
Wyłącz NAS poprawnie przed ponownym podłączeniem dostępnego połączenia danych lub zasilania i zmieniaj tylko jedną zmienną na raz. Jeśli kilka dysków znika jednocześnie lub błędy pojawiają się po porcie, a nie po dysku, przestań obwiniać pojedyncze dyski i zbadaj wspólną ścieżkę.
Dopasuj narzędzie naprawcze do systemu plików
Ext4 i XFS: Naprawa offline za pomocą natywnych narzędzi
Ext4 używa e2fsck, a XFS xfs_repair; żadnego z nich nie należy stosować na zamontowanym woluminie lub niepewnej ścieżce urządzenia. Jeśli NAS nie może bezpiecznie odmontować woluminu, użyj jego procedury konserwacji lub obsługiwanego środowiska odzyskiwania.
Praktyczny przewodnik rozwiązywania problemów z systemem plików oddziela kontrole rodziny ext od naprawy XFS i umieszcza kontrole na odmontowanym systemie plików. Zachowaj kopię zapasową, zidentyfikuj dokładne urządzenie i zacznij od natywnego trybu bez modyfikacji systemu plików, jeśli jest dostępny.
Btrfs: Preferuj kontrole tylko do odczytu i korzystaj z porad ekspertów
Btrfs rozdziela skanowanie, kontrolę strukturalną i naprawę. Skanowanie weryfikuje sumy kontrolne i może użyć dobrej repliki, podczas gdy kontrola strukturalna bada obiekty systemu plików; żadna z nich nie powinna być traktowana jako uniwersalny przełącznik umożliwiający zapis na uszkodzonym woluminie.
Oficjalne ostrzeżenie Btrfs check zaleca najpierw odmontowanie i wyraźnie ostrzega przed używaniem --repair bez doświadczenia. Zacznij od odzyskiwania czytelnych danych i kontroli bez modyfikacji, a następnie postępuj zgodnie z udokumentowaną ścieżką odzyskiwania dostawcy NAS.
ZFS: Ustabilizuj pulę przed skanowaniem
ZFS nie używa tradycyjnego procesu fsck. Najpierw odczytaj status puli, zachowaj krytyczne pliki i rozwiąż problemy z brakującymi lub uszkodzonymi urządzeniami, zanim dodasz obciążenie I/O związane ze skanowaniem.
Otwarte ZFS skanowanie puli weryfikuje sumy kontrolne bloków i może naprawić z dobrych replik, ale jest intensywne pod względem I/O i nie może stworzyć ważnej kopii, gdy nadmiarowość jest wyczerpana. Uruchamiaj je dopiero po ustabilizowaniu się puli i zabezpieczeniu krytycznych danych.
Kiedy przywracać zapisy — a kiedy zatrzymać
Przywróć usługę odczytu i zapisu dopiero po ustabilizowaniu się puli, zakończeniu odpowiedniej kontroli offline lub natywnej naprawy oraz gdy świeże logi nie wykazują powtarzających się błędów I/O lub metadanych. Następnie uruchom jedną usługę o niskim ryzyku i przetestuj plik tymczasowy, zanim wznowisz normalne obciążenia.
Jeśli wymuszone ponowne montowanie się nie powiedzie lub wolumen natychmiast wraca do trybu tylko do odczytu, zaakceptuj ten wynik jako nowe dowody. Powtarzanie tej samej komendy nie usuwa przyczyny; tylko zwiększa zapisy, ciepło i presję na odzyskiwanie.
Przerwij samodzielną naprawę, gdy brakuje wielu członków puli, liczniki błędów ciągle rosną, dysk stuka lub wielokrotnie się rozłącza, sumy kontrolne są nieodwracalne lub jedyna czytelna kopia jest krytyczna. Zachowaj logi i kolejność urządzeń, utrzymuj system wyłączony, jeśli sprzęt jest niestabilny, i skontaktuj się z wykwalifikowanym serwisem odzyskiwania danych lub wsparciem platformy.
Zapobiegaj kolejnemu niebezpiecznemu wyłączeniu
Używaj UPS, który może automatycznie sygnalizować NAS do zamknięcia, a nie tylko baterii z nieużywanymi portami komunikacyjnymi. Ta lista kontrolna zasilania NAS obejmuje komunikację przy zamykaniu, kontrole po awarii i dlaczego stabilne zasilanie jest ważne podczas odzyskiwania.
Przechowuj kopie zapasowe poza aktywną pulą. RAID może zachować dostępność po awarii niektórych dysków, ale działa po wystąpieniu uszkodzenia na żywo i nie zapewnia wcześniejszej czystej wersji; rozróżnienie między RAID a odzyskiwaniem z kopii zapasowej jest najważniejsze, gdy naprawa się nie powiodła.
Na koniec włącz alerty dysku, puli i UPS; zaplanuj odpowiednie do systemu plików kontrole lub skanowania; i okresowo testuj małe przywracanie. Udane uruchomienie jest przydatne, ale zweryfikowana ścieżka odzyskiwania to to, co zmienia następne wyłączenie z kryzysu w kontrolowane zdarzenie.
FAQ
Czy restart może naprawić wolumen NAS tylko do odczytu?
Restart może zakończyć odtwarzanie dziennika lub wyczyścić tymczasowy stan usługi, ale nie jest dowodem na zdrowie magazynu danych. Najpierw sprawdź zapisane logi i status puli, zwłaszcza jeśli wolumen już więcej niż raz przeszedł w tryb tylko do odczytu.
Czy mogę wymusić ponowne montowanie do odczytu i zapisu na tyle długo, by skopiować pliki?
Preferuj kopiowanie z istniejącego stanu tylko do odczytu. Wymuszone montowanie z możliwością zapisu może wywołać nowe aktualizacje metadanych i może od razu się nie powieść, jeśli jądro nadal wykrywa błędy. Używaj tego tylko w ramach specyficznego dla systemu plików planu odzyskiwania po zabezpieczeniu najlepszej dostępnej kopii.
Co jeśli SMART przechodzi, ale logi nadal pokazują błędy I/O?
Traktuj logi jako nierozstrzygnięte dowody. Usterka może dotyczyć interfejsu, kabla, backplane’u, kontrolera, ścieżki zasilania lub problemu z dyskiem, który nie jest podsumowany przez ogólny wynik SMART. Izoluj po jednym komponencie i zatrzymaj się, jeśli błędy nadal występują.
Najbezpieczniejsza pierwsza kontrola to ta, która zachowuje opcje: chroni czytelne dane, identyfikuje zablokowaną warstwę i pozwala zweryfikowanym dowodom — a nie wymuszonemu ponownemu montowaniu — zdecydować o kolejnym kroku.
Wsparcie i wskazówki
Więcej do przeczytania

Dlaczego macierz RAID staje się nieaktywna po utracie zasilania?
Nieaktywna macierz często oznacza, że znaleziono metadane, ale system nie miał wystarczającej pewności ani członków, aby bezpiecznie ją uruchomić po nieprawidłowym zamknięciu.

Jakie są ryzyka związane z wymuszaniem ponownego podłączenia brakującego członka RAID?
Opcje wymuszania mogą ominąć kontrole bezpieczeństwa dotyczące przestarzałych metadanych, niezsynchronizowanej parzystości, brakujących zapisów lub aktywnych pul; przed ich użyciem sprawdź i zachowaj dowody.

Jak odróżnić uszkodzony kabel SATA od uszkodzonego dysku NAS
Śledź, czy błędy dotyczą dysku, czy pozostają na ścieżce SATA, i oddziel liczniki transportu od dowodów stanu nośnika przed wymianą sprzętu.

