Eine SATA-SSD kann nach einem Warmstart verschwinden, wenn der Controller oder die Verbindung in einem fehlerhaften Zustand verbleibt, den nur eine vollständige Trennung von der Stromversorgung behebt.
Ein normaler Neustart setzt die Software zurück, entfernt jedoch möglicherweise nicht die Standby-Spannung von der SSD, dem Controller, der Backplane oder dem Motherboard-Port. Wenn die Verbindung nicht betriebsbereit wird, kann das Laufwerk verschwinden, bevor Partitionen, Dateisysteme, Pools oder Anwendungen betroffen sind. Ein vollständiges Herunterfahren verändert die Diagnose, da es eine umfassendere Initialisierung von Controller und Verbindung erzwingt. Ermitteln Sie zunächst die niedrigste Ebene, auf der das Gerät verloren geht, anstatt sofort den Speicher neu aufzubauen oder das Dateisystem zu ersetzen.
Ermitteln, ob BIOS, SATA-Controller oder nur das Betriebssystem die SSD verliert
Notieren Sie, ob die SSD vor und nach einem Warmstart im BIOS oder UEFI, in der Controller-Ansicht des Betriebssystems, in der Liste der Blockgeräte, in der Partitionstabelle und im eingebundenen Dateisystem erscheint.
Der Linux-libATA-Leitfaden beschreibt, wie der Treiber darauf wartet, dass eine SATA-Verbindung betriebsbereit wird, und ein Gerät als nicht vorhanden behandeln kann, wenn dies fehlschlägt. Das Modell zur Wiederherstellung von SATA-Verbindungen erklärt, warum ein Laufwerk verschwinden kann, bevor die Dateisystemebene erreicht wird.
Wenn das BIOS die SSD ebenfalls verliert, konzentrieren Sie sich auf Firmware, Port-Stromversorgung, Verbindungsinitialisierung, Kabel und Laufwerkscontroller. Wenn das BIOS sie erkennt, das Betriebssystem jedoch nicht, sichern Sie die Betriebssystemprotokolle und prüfen Sie die Treibererkennung sowie den Controllermodus.
Warmstart, vollständiges Herunterfahren und Trennung von der Stromversorgung vergleichen
Testen Sie einen normalen Neustart, ein Herunterfahren des Betriebssystems mit sofortigem Wiedereinschalten und ein Herunterfahren mit anschließend getrennter Stromversorgung, bis die Standby-Spannungen ausreichend abgefallen sind. Wiederholen Sie jeden Zustand mindestens zweimal.
Die Ansicht der PCI-Geräte bildet eine klare Grenze zwischen der Anwesenheit des Controllers und der Speichererkennung. Das lspci-Dienstprogramm kann bestätigen, ob sich der AHCI- oder SATA-Controller zwischen den Neustarts verändert hat, selbst wenn das SSD-Blockgerät fehlt.
Wenn nur eine vollständige Trennung von der Stromversorgung das Laufwerk wiederherstellt, sind ein beibehaltener Controllerzustand, eine unvollständige Zurücksetzung des SATA-PHY, ein Firmwarezustand der SSD oder eine Wechselwirkung mit der Energieverwaltung die wahrscheinlichsten Ursachen. Dieses Muster passt weniger zu einem gewöhnlichen Einbindungs- oder Partitionsproblem.
Ersten SATA-Verbindungs- und Zurücksetzungsfehler untersuchen
Speichern Sie das Kernel- oder Systemereignisprotokoll des fehlgeschlagenen Warmstarts, bevor Sie einen Kaltstart durchführen. Suchen Sie nach Meldungen über eine unterbrochene Verbindung, fehlgeschlagene COMRESET-Vorgänge, Zeitüberschreitungen bei der Gerätebereitschaft, fehlgeschlagene IDENTIFY-Befehle oder wiederholte Port-Zurücksetzungen.
Das aktive SATA-Verbindungs-Energiemanagement kann die Verbindung in Energiesparzustände versetzen, mit denen manche Kombinationen aus Controller und SSD schlecht umgehen. ArchWiki warnt davor, dass aggressives Verbindungs-Energiemanagement bei inkompatiblen Geräten ernsthafte Probleme verursachen kann.
Der erste Fehler ist aussagekräftiger als spätere Meldungen, dass das Dateisystem oder der Pool nicht verfügbar ist. Bewahren Sie die Portnummer und das Laufwerksmodell auf, damit jeder spätere Kabel-, Steckplatz- und Firmwaretest demselben Pfad zugeordnet werden kann.
SATA-Kabel, Stromanschluss und Schnittstellen-Fehlerzähler prüfen
Stecken Sie das SATA-Datenkabel und den Stromanschluss bei vollständig ausgeschaltetem Server erneut ein. Prüfen Sie verriegelnde Laschen, scharfe Biegungen, Splitter, Backplane-Anschlüsse und Adapter auf Beschädigungen oder schlechten Sitz.
Die Anleitung zur Speicherfehlerbehebung von Unraid besagt, dass steigende UDMA-CRC-Fehler Prüfungen der Daten- und Stromkabel, der Controller-Verbindungen und der Ports auslösen sollten, statt sofort das Dateisystem zu reparieren.
Ein historischer CRC-Zähler beweist nicht, dass das aktuelle Kabel weiterhin fehlerhaft ist. Notieren Sie den Rohwert, führen Sie einen kontrollierten Neustartzyklus durch und prüfen Sie, ob der Zähler ansteigt.
SMART, Fehlerprotokolle und Firmwarezustand der SSD prüfen
Erfassen Sie Modell, Seriennummer, Firmwareversion, Anzahl der Einschaltvorgänge, Anzahl unsicherer Abschaltungen, Schnittstellenfehler und verfügbare Gerätefehlerprotokolle der SSD, solange das Laufwerk sichtbar ist.
Die Referenz zu smartctl beschreibt SMART-Attribute und Fehlerprotokolle, die dabei helfen, Probleme mit dem Flash-Speicher von Fehlern bei Übertragung oder Controller zu unterscheiden.
Führen Sie ein SSD-Firmwareupdate erst durch, nachdem Sie Backups, Modellkompatibilität und die Wiederherstellungsanweisungen des Herstellers überprüft haben. Ändern Sie pro Testzyklus nur eine Firmwareebene, damit eine erfolgreiche Lösung eindeutig erkannt werden kann.
Eine erneute Erkennung nur als Diagnose verwenden
Wenn der Controller weiterhin vorhanden ist, die Festplatte jedoch fehlt, führen Sie nach dem Stoppen aller aktiven Ein-/Ausgabevorgänge einen unterstützten Speichersuchlauf durch. Notieren Sie, ob die SSD ohne Aus- und Einschalten der Stromversorgung wieder erscheint.
Microsoft dokumentiert, dass der rescan-Befehl von DiskPart neu erkannte Datenträger findet. Dadurch lässt sich eine verzögerte Erkennung durch das Betriebssystem von einem Laufwerk unterscheiden, das auf Controllerebene fehlt.
Eine erfolgreiche erneute Erkennung ist keine dauerhafte Lösung. Sie zeigt, dass Controller und SSD nach einem weiteren Erkennungsversuch kommunizieren können. Die weitere Untersuchung sollte sich daher auf Firmware, Treiber, Controllermodus oder Verbindungsinitialisierung konzentrieren.
Laufwerk, Port und Controller vor einem Austausch isolieren
Verschieben Sie die SSD nach einer Datensicherung an einen nachweislich funktionierenden SATA-Port und verwenden Sie ein nachweislich funktionierendes Kabel. Alternativ testen Sie ein nachweislich funktionierendes Laufwerk am ursprünglichen Pfad. Ändern Sie pro Zyklus nur eine Komponente.
Der ZimaSpace-Leitfaden zur Unterscheidung von Fehlern an SATA-Kabel und Laufwerk bietet den passenden Isolationsablauf für Speicherpfade mit intermittierenden Ausfällen.
Das Problem ist behoben, wenn die SSD bei wiederholten Warmstarts, Kaltstarts, Ruhephasen und anhaltenden Lesevorgängen ohne neue Verbindungsfehler sichtbar bleibt. Verwenden Sie das Laufwerk nicht mehr für primäre Daten, wenn es an nachweislich funktionierenden Ports und Kabeln weiterhin verschwindet oder zunehmend mehr Gerätefehler meldet.
Support & Tipps
Mehr zum Lesen

Kann Plex eine GPU mit einem anderen Docker-Container gemeinsam nutzen?
Plex und ein weiterer Container können häufig auf dieselbe GPU zugreifen, aber du musst die Treiberunterstützung, die Gerätezuordnung, die Auslastung der Video-Engine, den Speicher...

So erkennst du, ob ein Plex-Fehler vom Client oder vom Server verursacht wird
Reproduziere dasselbe Element auf einem anderen Client, vergleiche den Sitzungspfad und sammle Serverbelege erst, nachdem der Geltungsbereich dir gezeigt hat, wo der Fehler tatsächlich...

So konfigurierst du den Plex-Cache und den temporären Transcodierungs-Speicher
Schütze den persistenten Plex-Zustand, indem du temporäre Transcodierungsdateien auf geeignetem lokalem Speicher ablegst, und überprüfe anschließend die Bereinigung, den freien Speicherplatz und das Verhalten...

