Beunruhigend wird es, wenn die Prüfsummenfehler zurückkehren, nachdem Sie die alte Ausgangsbasis erfasst und gelöscht haben - nicht einfach deshalb, weil ein Zähler ungleich null ist.
ZFS kann einen fehlerhaften Block reparieren, wenn die Redundanz eine gültige Kopie bereitstellt. Die Reparatur erklärt jedoch nicht, warum die falschen Daten eingetroffen sind. Speichern Sie zpool status -v und relevante Systemprotokolle, überprüfen Sie die Backups und nutzen Sie anschließend das Wiederauftreten, das Muster der betroffenen Geräte und einen fehlerfreien Scrub, um zu entscheiden, ob das Ereignis isoliert war oder der Fehler weiterhin aktiv ist.
Erfassen Sie, was ZFS korrigiert hat, bevor Sie etwas löschen
Speichern Sie den vollständigen Pool-Status, den Zeitstempel des Scrubs, die Fehlerzähler pro Gerät und jede Liste dauerhafter Fehler. Erfassen Sie außerdem zeitgleich Kernel-Meldungen zu Verbindungs-Resets, Befehls-Timeouts, Controllerfehlern, Machine-Check-Fehlern und unerwarteten Stromereignissen.
Eine ausführliche Erklärung aus der Community zu reparierten ZFS-Prüfsummenzählern und ihren möglichen Ursachen unterscheidet korrigierte Blöcke von dem Kabel-, Stromversorgungs-, Controller-, Speicher- oder Laufwerksfehler, der sie möglicherweise verursacht hat. Die Reparatur bestätigt nicht, dass der Hardwarepfad fehlerfrei ist.
Stellen Sie sicher, dass eine weitere nutzbare Kopie wichtiger Daten vorhanden ist, bevor Sie den Pool belasten. Das Löschen der Zähler ist erst dann vertretbar, wenn die Beweise gesichert sind, da die nächste Entscheidung davon abhängt, ob tatsächlich neue Fehler auftreten.
Nutzen Sie Wiederauftreten und Umfang als Entscheidungsschwelle
Nachdem die Ausgangsbasis gespeichert wurde, löschen Sie die Zähler und führen Sie während eines Zeitfensters mit stabiler Stromversorgung und Temperatur einen Scrub durch. Wenn der Scrub fehlerfrei abgeschlossen wird und bei normaler Nutzung keine neuen Fehler auftreten, sollten Sie den Zustand überwachen, statt aufgrund eines einzelnen historischen Ereignisses Hardware auszutauschen.
Wenn dieselbe Festplatte neue Prüfsummenfehler verzeichnet, überprüfen Sie ihren Daten- und Stromversorgungspfad, die SMART-Historie, die Verbindungsstatistiken und den Controller-Port. Wenn mehrere Festplatten gleichzeitig Fehler verzeichnen, konzentrieren Sie sich zunächst auf gemeinsam genutzte Komponenten wie HBA, Backplane, Netzteil, Verkabelung, Arbeitsspeicher oder die Systemstabilität.
Jeder dauerhafte Datenfehler, wiederholte E/A-Fehler, ein angehaltener Pool oder schnell ansteigende Zähler erhöhen die Dringlichkeit. Stoppen Sie nicht unbedingt erforderliche Schreibvorgänge, aktualisieren Sie das Backup und isolieren Sie die verdächtige Ebene, bevor ein weiterer Scrub zusätzliche Last erzeugt.
Ändern Sie eine Ebene und weisen Sie das Ergebnis nach
Fahren Sie das System herunter und setzen Sie das verdächtige Daten- oder Stromkabel neu ein, ersetzen Sie es oder verbinden Sie das Gerät mit einem nachweislich fehlerfreien Port. Tauschen Sie nicht mehrere Ebenen gleichzeitig aus, da ein fehlerfreies Ergebnis sonst nicht erkennen lässt, welche Komponente die Änderung bewirkt hat.
Bei einem gerätespezifischen Muster führen Sie nach der Prüfung der SMART-Historie den Test des Laufwerksherstellers oder einen kontrollierten Lesevorgang durch. Bei einem Muster mit mehreren Geräten testen Sie Speicher und Stromversorgungsstabilität und überprüfen Sie den Controllerpfad, bevor Sie annehmen, dass mehrere Laufwerke gleichzeitig ausgefallen sind.
Der Leitfaden zu Betriebssystemen für Heimserver hilft dabei, herauszufinden, wo Pool-Zustand, Kernel-Protokolle und die Controller-Verwaltung auf gängigen NAS- und Linux-Plattformen zu finden sind.
Überprüfen Sie die Wiederherstellung unter der ursprünglichen Arbeitslast
Führen Sie nach der isolierten Reparatur einen vollständigen Scrub durch und wiederholen Sie anschließend die Arbeitslast, bei der das Problem zuvor aufgetreten ist. Eine Wiederherstellung bedeutet, dass der Scrub ohne neue Prüf-, Lese- oder Schreibfehler abgeschlossen wird und die Zähler während eines Neustarts sowie eines weiteren repräsentativen Arbeitslastzeitraums unverändert bleiben.
Ersetzen Sie ein Laufwerk, wenn die Beweise ihm über einen nachweislich fehlerfreien Pfad folgen, SMART oder Selbsttests ebenfalls schlechtere Ergebnisse zeigen oder es nach dem Ausschluss von Verkabelungs- und Stromversorgungsproblemen neue Fehler erzeugt. Ersetzen oder warten Sie die gemeinsam genutzte Ebene, wenn die Fehler bei einem Port, Gehäuse, Controller oder Stromereignis bleiben.
Leiten Sie sofort weitere Maßnahmen ein, wenn dauerhafte Fehler, ein beeinträchtigter Pool ohne ausreichende Redundanz oder Unsicherheit darüber vorliegen, welche Kopie maßgeblich ist. Ein korrigiertes Ereignis ist eine Diagnosewarnung; eine wiederholbare neue Korrektur ist ein Beleg dafür, dass die Diagnose nicht aufgeschoben werden kann.
FAQ
Behebt zpool clear die Ursache? Nein. Der Befehl setzt die aufgezeichneten Zähler zurück, nachdem Sie die Beweise gesichert haben. Nur ein fehlerfreier Scrub und eine stabile nachfolgende Arbeitslast zeigen, dass der zugrunde liegende Pfad keine fehlerhaften Daten mehr erzeugt.
Kann ein einzelner korrigierter Prüfsummenfehler ignoriert werden? Betrachten Sie ihn als aufgezeichnete Warnung. Wenn er nach dem Löschen der Ausgangsbasis und einem fehlerfreien Scrub nicht wieder auftritt, kann eine Überwachung angemessen sein. Ein erneutes Auftreten oder damit verbundene E/A-Fehler erfordern jedoch eine Isolierung.
Entlastet ein unauffälliger SMART-Bericht das Laufwerk? Nein. SMART kann Kabel-, Controller- und Stromversorgungsfehler sowie einige Gerätefehler übersehen. Kombinieren Sie die Ergebnisse daher mit dem ZFS-Umfang, Systemprotokollen, kontrollierten Tauschvorgängen und Scrubs nach der Reparatur.
Support & Tipps
Mehr zum Lesen

Welche Display-Helligkeit hilft, die Ermüdung der Augen bei langen NAS-Dateiprüfungen zu reduzieren?
Es gibt keinen universellen Helligkeitsprozentsatz. Passen Sie einen weißen Bildschirm an den Raum an, reduzieren Sie Blendung, sorgen Sie für gut lesbaren Text und...

So reduzieren Sie die Nackenbelastung, wenn eine Home-Server-Konsole zu niedrig montiert ist
Verlagern Sie Routinearbeiten von der niedrigen Konsole weg oder erhöhen Sie das Sichtziel sicher, während die Tastatur niedriger bleibt, und testen Sie anschließend eine...

Warum fühlen sich meine Augen müde an, nachdem ich nachts ein helles Server-Dashboard überwacht habe?
Nächtliche Ermüdung durch Dashboards ist oft eine Kombination aus nicht abgestimmter Helligkeit, Blendung, anhaltender Konzentration und seltenerem Blinzeln. Passen Sie einen Faktor an und...

