Dlaczego odbudowa RAID rozpoczyna się ponownie po odłączeniu dysku

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Odbudowa może się wznowić po kolejnym odłączeniu dysku, ponieważ zestaw zaufanych członków tablicy zmienił się ponownie. Kontroler może odrzucić częściowy postęp i wygenerować redundancję od nowego punktu spójności.

Krótka przerwa w połączeniu nie jest nieszkodliwa podczas pracy w stanie degradacji. Poprawną reakcją jest zidentyfikowanie, który członek o danym numerze seryjnym zniknął, zachowanie logów, potwierdzenie, że tablica nadal ma wystarczającą liczbę ważnych kopii oraz zaprzestanie eksperymentów z kablami lub gniazdami, dopóki nie zostanie zrozumiany obecny stan odzyskiwania.

Drugie odłączenie tworzy nowe zdarzenie odzyskiwania

Odbudowa opiera się na określonym zestawie źródłowych członków i docelowym dysku. Jeśli inny źródłowy członek zniknie, nawet na krótko, tablica nie może już zakładać, że każdy blok już zapisany na docelowym dysku odpowiada aktualnemu zestawowi danych. Zapisy mogły też być kontynuowane podczas nieobecności tego członka.

Kontrolery radzą sobie z tym różnie. Niektóre wznawiają pracę z bitmapy lub punktu kontrolnego; inne rozpoczynają pełną rekonstrukcję. Dyskusja o odbudowie po ponownym podłączeniu dysku pokazuje, dlaczego usunięcie członka zmienia stan odporności na awarie, nawet gdy dysk nadal zawiera większość starych danych.

Brudne metadane mogą sprawić, że stary członek będzie wyglądał na przestarzały

Członkowie RAID zazwyczaj przechowują metadane tablicy, które identyfikują ich rolę i historię zdarzeń. Gdy dysk znika podczas kontynuacji zapisu, jego zawartość staje się starsza niż aktywna tablica. Ponowne podłączenie nie usuwa tych pominiętych zapisów, więc kontroler musi pogodzić lub nadpisać przestarzałe obszary.

Tymczasowo usunięty członek RAID może zostać rozpoznany na podstawie metadanych, ale implementacja decyduje, czy może dołączyć bezpośrednio, czy wymaga synchronizacji. Nie zakładaj, że powrót do tego samego gniazda zachowuje zaufanie.

Dlaczego postęp może wrócić do zera

Procent często opisuje aktualny przebieg odzyskiwania, a nie trwały rejestr wszystkich kiedykolwiek skopiowanych bloków. Jeśli członek źródłowy zmieni stan, cel zostanie przypisany ponownie lub kontroler zmontuje macierz na nowo, wyświetlana operacja może zacząć się od zera, nawet jeśli niektóre bloki docelowe już pasują.

W przypadku RAID programowego nowe zdarzenie degradacji może wymagać pełnej resynchronizacji. Udokumentowana druga pełna odbudowa RAID1 pokazuje, że gdy macierz md przechodzi w stan zdegradowany, może synchronizować cały członek zamiast ufać wcześniejszemu częściowemu stanowi.

Nie wyjmuj kolejnego dysku, aby przetestować teorię

Podczas odbudowy każdy pozostały członek jest częścią jedynej ścieżki do odtworzenia brakujących danych. Wyjęcie kolejnego członka do identyfikacji może przekroczyć tolerancję błędów poziomu RAID lub stworzyć konkurencyjne wersje danych. Lokalizuj dyski według numeru seryjnego i wskaźników obudowy, nie przez próbne wyjmowanie.

Zatrzymaj eksperymenty z hot-swap, dopóki macierz nie będzie zdrowa lub skopiowana do bezpiecznego magazynu. Jeśli podejrzewasz kabel lub zatokę, najpierw zbierz dziennik zdarzeń i zaplanuj pojedynczą kontrolowaną zmianę przy wyciszonym systemie, gdy sprzęt nie obsługuje wyraźnie serwisu online.

Sprawdź, czy odbudowa naprawdę się rozpoczęła na nowo

Porównaj więcej niż procent. Zapisz nazwę operacji, docelowy numer seryjny, liczbę członków źródłowych, numer zdarzenia lub generacji, przetworzone bloki, aktualną prędkość i szacowany czas zakończenia. Kontroler może przełączyć się z odbudowy na inicjalizację parzystości, weryfikację lub tło sprawdzania spójności.

Pole Ta sama operacja Nowe zdarzenie odzyskiwania
Docelowy numer seryjny Nie zmieniony Inny lub przeklasyfikowany
Przetworzone bloki Kontynuacja wzrostu Powrót do początku
Zestaw członków Stabilny Inny dysk nieobecny lub ponownie dodany
Komunikat dziennika Wznów lub kontynuuj Przerwij, uruchom ponownie, zmontuj ponownie, nowa odbudowa
Stan macierzy Zdegradowany/odbudowa Bardziej zdegradowany, obcy lub w trakcie odzyskiwania

Jeśli zestaw członków uległ zmianie, traktuj nowy procent jako nowe zdarzenie. Jeśli tylko interfejs został zresetowany, a liczniki nadal działają, może to być problem z wyświetlaniem, a nie utrata postępu.

Kiedy ponowne uruchomienie jest mniej ważne niż odłączenie dysku

Planowany restart niekoniecznie unieważnia odbudowę zarządzaną przez kontroler. Wiele kontrolerów zachowuje wystarczający stan, aby bezpiecznie wznowić pracę. Poważniejszym zdarzeniem jest utrata kolejnego dysku źródłowego lub wprowadzenie obcej konfiguracji podczas lub po restarcie.

Restart podczas odbudowy może być możliwy do odzyskania, ale bezpieczne wnioski zależą od statusu kontrolera po uruchomieniu. Nigdy nie inicjuj ani nie importuj obcej konfiguracji tylko dlatego, że procent się zresetował.

Co zrobić natychmiast

  1. Wstrzymaj nieistotne zapisy i przechwyć logi macierzy, obudowy oraz systemu operacyjnego.
  2. Zmapuj każdego aktywnego, brakującego, odbudowującego się i zapasowego członka do fizycznego numeru seryjnego.
  3. Potwierdź, że poziom RAID nadal ma wystarczającą liczbę ważnych członków źródłowych do odtworzenia danych.
  4. Sprawdź liczniki SMART i błędów łącza na dysku, który się rozłączył, oraz na jego ścieżce połączenia.
  5. Pozwól na jedno stabilne odbudowanie bez dodatkowych eksperymentów z kablami, zatokami, restartami czy obciążeniem.

Jeśli inne źródło zgłasza nieczytelne sektory lub powtarzające się rozłączenia, priorytetowo traktuj kopiowanie niezastąpionych danych lub obrazowanie członków zamiast wielokrotnego wymuszania odbudowy.

Najczęściej zadawane pytania

Czy ponowne podłączenie tego samego dysku zawsze restartuje odbudowę?

Nie. Niektóre kontrolery mogą dołączyć go ponownie lub wznowić z bitmapy. Inne traktują członka jako przestarzałego i rozpoczynają synchronizację od nowa. Dziennik zdarzeń i dane generacji członka decydują, która sytuacja miała miejsce.

Czy reset procentu oznacza, że nowy dysk został ponownie wymazany?

Niekoniecznie. Może to oznaczać, że kontroler rozpoczął nową fazę lub zmienił typ operacji. Nie wyciągaj wniosków o utracie danych tylko na podstawie procentu; sprawdź tożsamość celu i komunikaty zdarzeń.

Czy mogę nadal korzystać z aplikacji podczas ponownej odbudowy?

Możliwe jest lekkie użycie, ale zmniejsz niepotrzebne zapisy i zadania wrażliwe na opóźnienia. Macierz już wykazała drugie zdarzenie utraty łączności, więc stabilność i ochrona danych mają pierwszeństwo przed normalną przepustowością.

Praktyczna odpowiedź

Odbudowa rozpoczyna się ponownie, ponieważ założenia dotyczące spójności zmieniły się po rozłączeniu innego członka. Ustabilizuj ścieżkę sprzętową, zweryfikuj zestaw źródłowy i pozwól na jedno nieprzerwane odzyskiwanie zamiast testowania macierzy podczas degradacji.

Wsparcie i wskazówki

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.