Si les erreurs d’E/S continuent d’augmenter pendant une reconstruction NAS, réduisez les écritures et considérez le membre survivant ou le chemin de connexion comme instable. Un pourcentage en progression ne rend pas les échecs de lecture croissants sûrs à ignorer.
L’objectif immédiat est de préserver les données lisibles et d’identifier si les erreurs sont dues à des défaillances du support, des réinitialisations de lien ou une cible défectueuse. Sauvegardez les journaux et numéros de série, confirmez l’état des sauvegardes et évitez de relancer la reconstruction à répétition pendant que l’ensemble source se détériore.
Les erreurs croissantes priment sur la barre de progression
Un pourcentage de reconstruction indique la part du disque cible traitée. Il ne dit pas si chaque lecture source a réussi. Comparez régulièrement les compteurs cumulés de lecture, écriture, somme de contrôle, support et timeout de commande.
Lorsque la reconstruction progresse mais que les erreurs augmentent aussi, le RAID peut reconstruire la plupart des blocs tout en échouant sur des zones spécifiques. Une seule lecture source échouée peut avoir plus d’importance que des milliers de lectures réussies lorsque le niveau RAID n’a plus de copie restante pour ce bloc.
Identifier quel appareil produit les erreurs
Associez chaque identifiant de journal à un numéro de série physique. Déterminez si les erreurs proviennent de l’ancien membre survivant, de la nouvelle cible ou d’un chemin de contrôleur partagé. Une erreur d’écriture sur la cible et une erreur de lecture sur la source nécessitent des décisions différentes.
Les données sur la santé du disque aident à prioriser l’enquête. L’utilisation opérationnelle par Backblaze de cinq attributs d’alerte SMART concentre l’attention sur les indicateurs de secteurs réalloués, irrécupérables, en timeout, en attente et hors ligne irrécupérables, plutôt que de se fier à une seule étiquette globale de santé.
Séparer les erreurs de support des erreurs de lien
Les secteurs en attente ou irrécupérables indiquent un support illisible. La croissance des erreurs UDMA CRC, les réinitialisations de transport et les détachements répétés indiquent plus souvent un problème de câble, de backplane, de pont, d’alimentation ou de chemin de contrôleur. Les deux peuvent interrompre la reconstruction, mais changer les disques ne résoudra pas un problème de lien partagé.
Une explication du compte d'erreurs UDMA CRC distingue les erreurs de transfert d'interface des dommages sur le plateau. Enregistrez le compte brut, corrigez une variable de connexion, et vérifiez si le compteur continue d'augmenter.
Ne continuez pas à redémarrer une reconstruction défaillante
Chaque redémarrage complet relit les membres survivants et peut solliciter les mêmes régions faibles sans produire un meilleur résultat. Si l'opération échoue à plusieurs reprises près de la même adresse ou si un second disque tombe en panne, arrêtez les tentatives de réparation de routine.
Une reconstruction bloquée par des erreurs source illustre la limite centrale : lorsque la seule source bonne a une lecture irrécupérable, le groupe n'a nulle part ailleurs où obtenir les données manquantes. Les options forcées ne peuvent pas recréer un contenu inconnu.
Choisissez entre continuer, copier et imager
| Condition | Direction préférée | Pourquoi |
|---|---|---|
| Erreurs stables, reconstruction en cours | Surveillez avec une charge réduite | La récupération peut se terminer normalement |
| Les erreurs de liaison augmentent, média stable | Stabilisez le chemin câble/baie/contrôleur | La panne peut être hors du disque |
| Les erreurs sur le média source augmentent | Copiez d'abord les données critiques lisibles | La redondance restante s'affaiblit |
| Abandon répété à la même plage | Arrêtez les tentatives de reconstruction aveugles | Zone illisible persistante |
| Déconnexion ou défaillance du second membre | Envisagez un flux de travail d'imagerie/récupération | Le groupe peut dépasser la tolérance aux pannes |
Si les données sont irremplaçables et que la sauvegarde n'est pas vérifiée, imager les membres lisibles peut être plus sûr que de permettre une autre reconstruction automatique. Un flux de travail orienté récupération lors d'une défaillance du second disque pendant la reconstruction met l'accent sur l'arrêt des tentatives de réparation intensives en écriture lorsque l'ensemble survivant est instable.
Réduire le travail au premier plan sans masquer l'incident
Arrêtez les sauvegardes, l'indexation des médias, les téléchargements, les machines virtuelles et autres écritures évitables. Ne conservez que les services nécessaires pour copier les données critiques ou surveiller le groupe. Réduire la charge de travail peut diminuer la mise en file d'attente et faciliter l'interprétation du moment des erreurs.
Ne supprimez pas les journaux, ne réinitialisez pas les compteurs SMART et ne redémarrez pas plusieurs fois avant de capturer les preuves. Un redémarrage peut changer les noms des périphériques et effacer la séquence montrant quel membre a échoué en premier.
Que capturer avant de couper l'alimentation
- État de l'ensemble, niveau RAID, rôles des membres, cible de reconstruction et compteurs de progression exacts
- Chaque modèle de disque, numéro de série, baie, port de contrôleur et identifiant de périphérique actuel
- Événements du noyau ou du contrôleur couvrant la première défaillance jusqu'à la dernière erreur d'E/S
- Valeurs brutes SMART du média, délai d'attente, température et erreurs d'interface
- Liste des fichiers ou plages de blocs illisibles et état de la dernière sauvegarde vérifiée
Ce dossier permet un test contrôlé de câble, un remplacement de disque, un clonage ou une récupération professionnelle sans deviner quel membre contenait les données les plus récentes.
Exiger un suivi stable après toute intervention
Après avoir remplacé un câble, déplacé un disque au numéro de série confirmé ou réduit la charge, réinitialisez uniquement la base de comparaison pertinente et surveillez la réapparition. Une amélioration temporaire ne prouve pas que la faute sous-jacente a disparu.
L'ensemble doit terminer la récupération, revenir à une pleine adhésion et réussir une vérification d'intégrité ultérieure sans nouvelles erreurs d'E/S. Tant que ces trois conditions ne sont pas remplies sous une charge représentative normale, gardez l'incident ouvert en toute sécurité et conservez les journaux capturés.
FAQ
Puis-je laisser la reconstruction se terminer s'il n'y a que quelques erreurs ?
Seulement lorsque les erreurs sont comprises, stables et que les données sont sauvegardées. Une augmentation des erreurs de lecture source ou des réinitialisations répétées est un signal d'escalade même si le pourcentage cible continue d'augmenter.
Dois-je remplacer le disque avec le plus grand nombre d'erreurs SMART ?
Pas automatiquement. Confirmez si les erreurs suivent ce disque au numéro de série ou restent avec sa baie et son chemin de connexion. Remplacer le mauvais membre pendant une opération dégradée peut détruire la source valide restante.
Une reconstruction terminée peut-elle encore contenir des fichiers endommagés ?
Oui. Certaines implémentations peuvent se terminer tout en signalant des secteurs irrécupérables ou des fichiers affectés. Examinez toujours le rapport d'erreur final et effectuez une vérification d'intégrité après que l'ensemble soit revenu à un état stable.
La condition d'arrêt
Lorsque les erreurs d'E/S augmentent pendant la reconstruction, protégez les données lisibles avant de poursuivre la complétion. Continuez uniquement après avoir prouvé que l'ensemble source et le chemin de connexion sont suffisamment stables pour fournir chaque bloc restant.
Assistance et conseils
Plus à lire

Pourquoi un ensemble RAID devient-il inactif après une coupure de courant ?
Un ensemble inactif signifie souvent que des métadonnées ont été trouvées, mais que le système n'avait pas suffisamment de confiance ou de membres pour...

Quels sont les risques de forcer la remise en ligne d’un membre RAID manquant ?
Les options de forçage peuvent contourner les vérifications de sécurité concernant les métadonnées obsolètes, la parité corrompue, les écritures manquantes ou les pools actifs...

Comment distinguer un câble SATA défectueux d’un disque NAS en panne
Suivez si les erreurs proviennent du disque ou restent liées au chemin SATA, et séparez les compteurs de transport des preuves de l'état du...

