L’approccio sicuro consiste nel trattare i seriali della mappa e gli ID persistenti, sostituire un solo membro confermato, quindi verificare la ricostruzione e il carico di lavoro originale come una sequenza di controlli osservabili, non come un singolo comando.
Su un NAS domestico Linux che utilizza ZFS, mdraid o Btrfs, il rischio pratico consiste nel dover sostituire un’unità NAS senza confondere le lettere dei dispositivi Linux, che possono cambiare. Registra l’identità attuale e il punto di ripristino, inizia con il discriminatore meno invasivo, interpreta i risultati positivi e negativi prima di modificare un’altra variabile e fermati quando lo storage diventa instabile o l’unica copia recuperabile verrebbe esposta. Il flusso di lavoro seguente termina solo quando il carico di lavoro originale ha esito positivo oppure le prove raggiungono una soglia di escalation.
Crea una mappa di sostituzione da seriale a alloggiamento
Salva lo stato dell’array o del pool, la topologia dei dispositivi, l’identità SMART, lo slot dell’enclosure, il numero di serie, il WWN e il collegamento simbolico /dev/disk/by-id per ogni membro. Le lettere dei dispositivi Linux possono cambiare dopo un riavvio o un hot-plug, quindi /dev/sdX è un’osservazione relativa a questo avvio, non l’identità durevole da usare nel record di sostituzione.
Una guida pratica per un home server ZFS dimostra la sostituzione con un percorso persistente by-id e il monitoraggio del resilvering, invece di affidarsi a una lettera temporanea del dispositivo. Lo stesso principio di identità si applica a mdraid e Btrfs, anche se i relativi comandi di sostituzione differiscono.
Abbina due volte il membro guasto nel software all’etichetta fisica: una volta prima di portarlo offline e di nuovo prima di rimuovere l’hardware. Fermati se manca il passthrough del seriale, se due slot riportano la stessa identità del bridge o se il pool non può tollerare che un altro membro vada offline.
Prepara la sostituzione senza ridurre subito la ridondanza
Conferma che la nuova unità abbia almeno la stessa quantità di settori utilizzabili, il formato dei settori previsto e superi i controlli di base dello stato di salute al di fuori dell’array, quando possibile. Registra il seriale e il percorso by-id prima dell’inserimento. Per i membri cifrati o avviabili, conserva anche il layout delle partizioni, le chiavi e i metadati di avvio richiesti dalla piattaforma.
Consulta la discussione di ZimaSpace sulle diverse dimensioni dei settori in un mirror ZFS quando una sostituzione segnala una dimensione diversa dei settori logici o fisici. La capacità indicata sull’unità non è sufficiente: sono le dimensioni effettive, le aspettative relative ad ashift o all’allineamento, la tabella delle partizioni e le regole della piattaforma NAS a determinare se la sostituzione è valida.
Sostituisci un solo dispositivo alla volta. Se il vecchio disco è ancora leggibile e la piattaforma supporta il collegamento prima del distacco, ciò può preservare la ridondanza; in caso contrario, porta offline il membro confermato, spegni il sistema quando lo chassis non supporta l’hot swap e applica immediatamente un’etichetta all’unità rimossa.
Avvia e monitora la ricostruzione specifica della piattaforma
Usa l’identità del membro del pool o dell’array mostrata dal relativo comando di stato, associata al nuovo percorso persistente by-id. Non incollare un comando generico senza verificare la topologia: la sostituzione di un mirror ZFS, l’aggiunta di un membro mdraid e la sostituzione di un dispositivo Btrfs hanno macchine a stati e semantiche di errore diverse.
Controlla l’avanzamento, gli errori di lettura, le correzioni dei checksum, le variazioni SMART, la temperatura e i riavvii del controller. Un resoconto indipendente sulla sostituzione sottolinea l’importanza di registrare il seriale del disco guasto e attendere il completamento del resilvering prima di sostituire il membro successivo.
Se il nuovo disco scompare, gli errori aumentano su un membro superstite o la ricostruzione si riavvia ripetutamente, interrompi i carichi non essenziali e conserva i log. Non rimuovere un altro disco, cancellare gli errori o forzare il completamento finché non sono stati compresi il componente guasto e il livello di ridondanza attuale.
Verifica il NAS riparato prima di dismettere il vecchio disco
Una barra di avanzamento completata è necessaria, ma non sufficiente. Conferma che il pool o l’array sia integro, che ogni membro previsto utilizzi l’identità persistente corretta, che nessuna partizione sia ancora sottodimensionata e che mount pianificati, condivisioni, container e backup superino due riavvii.
Esegui il controllo di integrità o lo scrub della piattaforma dopo la ricostruzione, seguendo il relativo flusso di lavoro sicuro, quindi ripristina un file rappresentativo e riproduci il carico di lavoro che ha rivelato il guasto. Verifica che i contatori degli errori rimangano stabili durante letture e scritture prolungate.
Mantieni il vecchio disco offline e contrassegnato finché il nuovo membro non avrà superato un normale carico di lavoro e un ciclo di backup. Il ripristino è completo quando topologia, dati, stato dei dispositivi e percorsi delle applicazioni superano tutti le verifiche; avvia un’escalation se l’identità rimane ambigua o se un membro superstite sviluppa nuovi errori durante la ricostruzione.
Supporto e consigli
Altro da leggere

Guida alla migrazione di Borg Backup per spostare un repository su un nuovo spazio di archiviazione
Sposta un repository Borg come un unico oggetto coerente: interrompi le scritture, preserva le chiavi e l'identità, verifica i ripristini, quindi aggiorna i client...

Flusso di manutenzione del repository Restic: verifica, potatura, compattazione e test di ripristino
Restic non ha un comando compact separato: prune esegue il repacking. Proteggi i lock e lo spazio libero, ricontrolla in seguito e concludi con...

Guida al ripristino del NAS di Time Machine per cronologie di backup danneggiate o abbandonate
Conserva il vecchio bundle. Separa l’accesso al NAS, l’identità della destinazione, i danni all’immagine e la cronologia abbandonata prima di scegliere se riparare o...

