Dysk SSD SATA może zniknąć po ciepłym ponownym uruchomieniu, gdy kontroler lub łącze pozostają w nieprawidłowym stanie, który można usunąć dopiero przez całkowite odłączenie zasilania.
Standardowe ponowne uruchomienie resetuje oprogramowanie, ale może nie odłączyć zasilania podtrzymującego od dysku SSD, kontrolera, backplane’u ani portu płyty głównej. Jeśli łącze nie przejdzie do stanu gotowości, dysk może zniknąć, zanim w grę wejdą partycje, systemy plików, pule lub aplikacje. Całkowite wyłączenie zmienia obraz sytuacji, ponieważ wymusza głębszą inicjalizację kontrolera i łącza. Najpierw ustal, na której najniższej warstwie urządzenie przestaje być widoczne, zamiast od razu przebudowywać pamięć masową lub wymieniać system plików.
Ustal, czy dysk SSD znika w BIOS-ie, kontrolerze SATA czy tylko w systemie operacyjnym
Zapisz, czy dysk SSD jest widoczny w BIOS-ie lub UEFI, w widoku kontrolera systemu operacyjnego, na liście urządzeń blokowych, w tablicy partycji i w zamontowanym systemie plików przed ciepłym ponownym uruchomieniem i po nim.
Przewodnik Linux libATA opisuje, jak sterownik czeka, aż łącze SATA osiągnie stan gotowości, i może uznać urządzenie za nieobecne, gdy gotowość nie zostanie osiągnięta. Jego model odzyskiwania łącza SATA wyjaśnia, dlaczego dysk może zniknąć, zanim system dotrze do warstwy systemu plików.
Jeśli BIOS również traci dysk SSD, skup się na oprogramowaniu układowym, zasilaniu portu, inicjalizacji łącza, kablu i kontrolerze dysku. Jeśli BIOS go widzi, ale system operacyjny nie, zachowaj logi systemowe i sprawdź wykrywanie przez sterownik oraz tryb kontrolera.
Porównaj ciepłe ponowne uruchomienie, pełne wyłączenie i odłączenie zasilania
Przetestuj zwykłe ponowne uruchomienie, wyłączenie systemu operacyjnego z natychmiastowym włączeniem oraz wyłączenie z odłączeniem zasilania na czas wystarczający do rozładowania linii zasilania podtrzymującego. Powtórz każdy scenariusz co najmniej dwa razy.
Widok urządzeń PCI wyznacza wyraźną granicę między obecnością kontrolera a wykrywaniem pamięci masowej. Narzędzie lspci może potwierdzić, czy sam kontroler AHCI lub SATA zmienił stan po ponownym uruchomieniu, nawet gdy urządzenie blokowe SSD jest nieobecne.
Jeśli dysk wraca dopiero po całkowitym odłączeniu zasilania, najbardziej prawdopodobne przyczyny to zachowany stan kontrolera, niepełny reset warstwy fizycznej SATA, stan oprogramowania układowego SSD lub interakcja z zarządzaniem energią. Taki schemat rzadziej wskazuje na zwykły problem z montowaniem lub partycjami.
Sprawdź pierwsze błędy łącza SATA i resetowania
Zapisz dziennik jądra lub zdarzeń systemowych z nieudanego ciepłego ponownego uruchomienia przed wykonaniem zimnego rozruchu. Szukaj komunikatów o utracie łącza, nieudanych operacjach COMRESET, przekroczeniach czasu oczekiwania na gotowość urządzenia, nieudanych poleceniach IDENTIFY lub powtarzających się resetach portu.
Aktywne zarządzanie energią łącza SATA może przełączać łącze w stany niskiego poboru energii, z którymi niektóre połączenia kontrolera i SSD radzą sobie źle. ArchWiki ostrzega, że agresywne zarządzanie energią łącza może powodować poważne problemy na niezgodnych urządzeniach.
Pierwszy błąd jest cenniejszy niż późniejsze komunikaty informujące o niedostępności systemu plików lub puli. Zachowaj numer portu i model dysku, aby każdy kolejny test kabla, gniazda i oprogramowania układowego można było powiązać z tą samą ścieżką.
Sprawdź kabel SATA, złącze zasilania i liczniki błędów interfejsu
Przy całkowicie wyłączonym serwerze ponownie podłącz kabel danych SATA i złącze zasilania. Sprawdź luźne zatrzaski, ostre zagięcia, rozdzielacze, złącza backplane’u i adaptery.
Wskazówki dotyczące rozwiązywania problemów z pamięcią masową w Unraid informują, że rosnąca liczba błędów UDMA CRC powinna skłonić do sprawdzenia kabli danych, kabli zasilających, połączeń kontrolera i portów, a nie do natychmiastowej naprawy systemu plików.
Historyczna liczba błędów CRC nie dowodzi, że obecny kabel nadal jest uszkodzony. Zapisz wartość surową, wykonaj jeden kontrolowany cykl ponownego uruchomienia i sprawdź, czy licznik wzrósł.
Sprawdź SMART dysku SSD, dzienniki błędów i stan oprogramowania układowego
Gdy dysk jest widoczny, zapisz jego model, numer seryjny, wersję oprogramowania układowego, liczbę cykli zasilania, liczbę niebezpiecznych wyłączeń, błędy interfejsu i dostępne dzienniki błędów urządzenia.
Dokumentacja smartctl opisuje atrybuty SMART i dzienniki błędów, które pomagają odróżnić problemy ze stanem pamięci flash od awarii transportu lub kontrolera.
Aktualizację oprogramowania układowego SSD wykonuj dopiero po sprawdzeniu kopii zapasowych, zgodności modelu i instrukcji odzyskiwania producenta. Zmieniaj jednorazowo tylko jedną warstwę oprogramowania układowego, aby można było zidentyfikować skuteczną poprawkę.
Używaj ponownego skanowania tylko jako diagnostyki
Gdy kontroler pozostaje obecny, ale dysku brakuje, po zatrzymaniu wszystkich aktywnych operacji wejścia-wyjścia wykonaj jedno obsługiwane ponowne skanowanie pamięci masowej. Zapisz, czy dysk SSD wróci bez cyklu odłączania zasilania.
Firma Microsoft dokumentuje, że polecenie rescan wyszukuje nowo wykryte dyski, dzięki czemu pomaga odróżnić opóźnione wykrywanie przez system operacyjny od dysku nieobecnego na poziomie kontrolera.
Pomyślne ponowne skanowanie nie jest trwałym rozwiązaniem. Pokazuje, że kontroler i SSD mogą się komunikować po kolejnej próbie wykrywania, więc dalszych przyczyn należy szukać w oprogramowaniu układowym, sterowniku, trybie kontrolera lub inicjalizacji łącza.
Odizoluj dysk, port i kontroler przed wymianą
Po wykonaniu kopii zapasowej danych przenieś dysk SSD do sprawnego portu SATA, używając sprawnego kabla, albo przetestuj sprawny dysk na oryginalnej ścieżce. W każdym cyklu zmieniaj tylko jeden element.
Przewodnik ZimaSpace dotyczący odróżniania usterek kabla SATA od awarii dysku przedstawia powiązaną procedurę izolowania problemów ze ścieżkami pamięci masowej, które zawodzą sporadycznie.
Problem można uznać za rozwiązany, gdy dysk SSD pozostaje widoczny podczas wielokrotnych ciepłych ponownych uruchomień, zimnych rozruchów, okresów bezczynności i długotrwałego odczytu, bez pojawiania się nowych błędów łącza. Przestań używać dysku do przechowywania podstawowych danych, jeśli nadal znika na sprawnych portach i kablach lub zgłasza nasilające się błędy urządzenia.
Wsparcie i wskazówki
Więcej do przeczytania

Czy Plex może współdzielić kartę graficzną z innym kontenerem Dockera?
Plex i inny kontener często mogą korzystać z tego samego układu GPU, ale należy przetestować obsługę sterowników, mapowanie urządzeń, obciążenie silnika wideo, pamięć oraz...

Jak ustalić, czy błąd Plex pochodzi od klienta, czy od serwera
Odtwórz ten sam przypadek na innym kliencie, porównaj ścieżkę sesji, a następnie zbierz dowody z serwera dopiero wtedy, gdy zakres analizy wskaże, gdzie faktycznie...

Jak skonfigurować pamięć podręczną Plex i tymczasową pamięć na transkodowane pliki
Chroń trwały stan Plex, umieszczając tymczasowe pliki transkodowania na odpowiedniej pamięci lokalnej, a następnie zweryfikuj czyszczenie, ilość wolnego miejsca i zachowanie podczas ponownego uruchamiania.

