Preoccupati quando gli errori di checksum ricompaiono dopo aver registrato e azzerato la baseline precedente, non semplicemente perché un contatore è diverso da zero.
ZFS può riparare un blocco danneggiato quando la ridondanza fornisce una copia valida, ma la riparazione non spiega perché siano arrivati dati errati. Salva zpool status -v e i log di sistema pertinenti, verifica i backup, poi usa la ricorrenza, lo schema dei dispositivi interessati e uno scrub completato senza errori per decidere se l'evento è stato isolato o se il guasto è ancora attivo.
Registra ciò che ZFS ha corretto prima di cancellare qualsiasi dato
Salva lo stato completo del pool, il timestamp dello scrub, i conteggi degli errori per dispositivo e l'eventuale elenco degli errori permanenti. Acquisisci inoltre, nello stesso momento, i messaggi del kernel relativi a reset del collegamento, timeout dei comandi, guasti del controller, errori hardware e interruzioni di alimentazione impreviste.
Una spiegazione dettagliata della community sugli errori di checksum corretti da ZFS e sulle loro possibili cause distingue i blocchi corretti dal guasto al cavo, all'alimentazione, al controller, alla memoria o al disco che potrebbe averli prodotti. La riparazione non certifica l'integrità del percorso hardware.
Verifica che esista un'altra copia utilizzabile dei dati importanti prima di sottoporre il pool a ulteriori sollecitazioni. Azzerare i contatori è accettabile solo dopo aver salvato le prove, perché la decisione successiva dipende dal fatto che compaiano o meno errori realmente nuovi.
Usa la ricorrenza e l'ambito come soglia decisionale
Dopo aver salvato la baseline, azzera i contatori ed esegui uno scrub durante una finestra con alimentazione e temperatura stabili. Se lo scrub termina senza errori e l'uso normale non produce nuovi errori, monitora invece di sostituire l'hardware sulla base di un singolo evento storico.
Se lo stesso disco registra nuovi errori di checksum, controlla il percorso dati e quello di alimentazione, la cronologia SMART, le statistiche del collegamento e la porta del controller. Se diversi dischi registrano errori contemporaneamente, dai priorità ai componenti condivisi, come HBA, backplane, alimentatore, cablaggio, memoria o stabilità del sistema.
Qualsiasi errore permanente dei dati, errore I/O ripetuto, sospensione del pool o conteggio in rapido aumento aumenta l'urgenza. Interrompi le scritture non essenziali, aggiorna il backup e isola il livello sospetto prima che un altro scrub aggiunga ulteriore carico.
Cambia un solo livello e dimostra il risultato
Con il sistema spento, reinserisci o sostituisci il cavo dati o di alimentazione sospetto, oppure sposta il dispositivo su una porta sicuramente funzionante. Non sostituire più livelli contemporaneamente, altrimenti il risultato positivo non permetterà di identificare quale componente abbia cambiato l'esito.
Per uno schema specifico del dispositivo, esegui il test del produttore dell'unità o una lettura controllata dopo aver esaminato la cronologia SMART. Per uno schema che coinvolge più dispositivi, verifica la memoria e la stabilità dell'alimentazione e controlla il percorso del controller prima di presumere che diversi dischi si siano guastati simultaneamente.
La guida ai sistemi operativi per home server aiuta a individuare dove si trovano lo stato del pool, i log del kernel e la gestione del controller nelle piattaforme NAS e Linux più comuni.
Verifica il ripristino con il carico di lavoro originale
Esegui uno scrub completo dopo la riparazione isolata, quindi ripeti il carico di lavoro che aveva precedentemente fatto emergere il problema. Il ripristino è dimostrato quando lo scrub termina senza nuovi errori di checksum, lettura o scrittura e i contatori rimangono invariati dopo un riavvio e un'altra finestra di carico rappresentativa.
Sostituisci un'unità quando le prove la seguono attraverso un percorso sicuramente funzionante, quando anche SMART o gli autotest mostrano un peggioramento oppure quando produce nuovi errori dopo aver escluso cablaggio e alimentazione. Sostituisci o ripara il livello condiviso quando gli errori rimangono associati a una porta, a un enclosure, a un controller o a un evento di alimentazione.
Richiedi assistenza immediatamente in caso di errori permanenti, pool degradato senza ridondanza adeguata o incertezza su quale copia sia autorevole. Un evento corretto è un avvertimento da diagnosticare; una correzione nuova e ripetibile è la prova che la diagnosi non può essere rimandata.
Domande frequenti
zpool clear risolve la causa? No. Reimposta i contatori registrati dopo aver salvato le prove; solo uno scrub completato senza errori e un carico di lavoro successivo stabile dimostrano che il percorso sottostante non sta più producendo dati errati.
Si può ignorare un singolo errore di checksum corretto? Consideralo un avvertimento registrato. Se non si ripresenta dopo aver azzerato la baseline e aver eseguito uno scrub senza errori, il monitoraggio può essere proporzionato; la ricorrenza o i guasti I/O correlati richiedono un isolamento.
Un report SMART integro assolve il disco? No. SMART può non rilevare guasti al cavo, al controller, all'alimentazione e alcuni guasti del dispositivo; perciò va combinato con l'ambito ZFS, i log di sistema, sostituzioni controllate e scrub successivi alla riparazione.
Supporto e consigli
Altro da leggere

Quale luminosità dello schermo aiuta a ridurre l’affaticamento degli occhi durante lunghe revisioni di file sul NAS?
Non esiste una percentuale di luminosità universale; adatta una schermata bianca all’ambiente, controlla i riflessi, mantieni il testo leggibile e verifica durante una revisione...

Come ridurre l'affaticamento del collo quando la console di un home server è montata troppo in basso
Sposta le attività di routine dalla console bassa oppure alza in sicurezza il target visivo, mantenendo la tastiera più in basso e ripetendo il...

Perché i miei occhi si sentono stanchi dopo aver monitorato di notte una dashboard luminosa del server?
L’affaticamento durante l’uso notturno della dashboard spesso combina una luminosità non adeguata, riflessi, concentrazione prolungata e una riduzione dell’ammiccamento; regola un fattore alla volta...

