Reconstruction RAID en cours mais les erreurs d’E/S augmentent : que faire ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Si les erreurs d’E/S continuent d’augmenter pendant une reconstruction NAS, réduisez les écritures et considérez le membre survivant ou le chemin de connexion comme instable. Un pourcentage en progression ne rend pas les échecs de lecture croissants sûrs à ignorer.

L’objectif immédiat est de préserver les données lisibles et d’identifier si les erreurs sont dues à des défaillances du support, des réinitialisations de lien ou une cible défectueuse. Sauvegardez les journaux et numéros de série, confirmez l’état des sauvegardes et évitez de relancer la reconstruction à répétition pendant que l’ensemble source se détériore.

Les erreurs croissantes priment sur la barre de progression

Un pourcentage de reconstruction indique la part du disque cible traitée. Il ne dit pas si chaque lecture source a réussi. Comparez régulièrement les compteurs cumulés de lecture, écriture, somme de contrôle, support et timeout de commande.

Lorsque la reconstruction progresse mais que les erreurs augmentent aussi, le RAID peut reconstruire la plupart des blocs tout en échouant sur des zones spécifiques. Une seule lecture source échouée peut avoir plus d’importance que des milliers de lectures réussies lorsque le niveau RAID n’a plus de copie restante pour ce bloc.

Identifier quel appareil produit les erreurs

Associez chaque identifiant de journal à un numéro de série physique. Déterminez si les erreurs proviennent de l’ancien membre survivant, de la nouvelle cible ou d’un chemin de contrôleur partagé. Une erreur d’écriture sur la cible et une erreur de lecture sur la source nécessitent des décisions différentes.

Les données sur la santé du disque aident à prioriser l’enquête. L’utilisation opérationnelle par Backblaze de cinq attributs d’alerte SMART concentre l’attention sur les indicateurs de secteurs réalloués, irrécupérables, en timeout, en attente et hors ligne irrécupérables, plutôt que de se fier à une seule étiquette globale de santé.

Séparer les erreurs de support des erreurs de lien

Les secteurs en attente ou irrécupérables indiquent un support illisible. La croissance des erreurs UDMA CRC, les réinitialisations de transport et les détachements répétés indiquent plus souvent un problème de câble, de backplane, de pont, d’alimentation ou de chemin de contrôleur. Les deux peuvent interrompre la reconstruction, mais changer les disques ne résoudra pas un problème de lien partagé.

Une explication du compte d'erreurs UDMA CRC distingue les erreurs de transfert d'interface des dommages sur le plateau. Enregistrez le compte brut, corrigez une variable de connexion, et vérifiez si le compteur continue d'augmenter.

Ne continuez pas à redémarrer une reconstruction défaillante

Chaque redémarrage complet relit les membres survivants et peut solliciter les mêmes régions faibles sans produire un meilleur résultat. Si l'opération échoue à plusieurs reprises près de la même adresse ou si un second disque tombe en panne, arrêtez les tentatives de réparation de routine.

Une reconstruction bloquée par des erreurs source illustre la limite centrale : lorsque la seule source bonne a une lecture irrécupérable, le groupe n'a nulle part ailleurs où obtenir les données manquantes. Les options forcées ne peuvent pas recréer un contenu inconnu.

Choisissez entre continuer, copier et imager

Condition Direction préférée Pourquoi
Erreurs stables, reconstruction en cours Surveillez avec une charge réduite La récupération peut se terminer normalement
Les erreurs de liaison augmentent, média stable Stabilisez le chemin câble/baie/contrôleur La panne peut être hors du disque
Les erreurs sur le média source augmentent Copiez d'abord les données critiques lisibles La redondance restante s'affaiblit
Abandon répété à la même plage Arrêtez les tentatives de reconstruction aveugles Zone illisible persistante
Déconnexion ou défaillance du second membre Envisagez un flux de travail d'imagerie/récupération Le groupe peut dépasser la tolérance aux pannes

Si les données sont irremplaçables et que la sauvegarde n'est pas vérifiée, imager les membres lisibles peut être plus sûr que de permettre une autre reconstruction automatique. Un flux de travail orienté récupération lors d'une défaillance du second disque pendant la reconstruction met l'accent sur l'arrêt des tentatives de réparation intensives en écriture lorsque l'ensemble survivant est instable.

Réduire le travail au premier plan sans masquer l'incident

Arrêtez les sauvegardes, l'indexation des médias, les téléchargements, les machines virtuelles et autres écritures évitables. Ne conservez que les services nécessaires pour copier les données critiques ou surveiller le groupe. Réduire la charge de travail peut diminuer la mise en file d'attente et faciliter l'interprétation du moment des erreurs.

Ne supprimez pas les journaux, ne réinitialisez pas les compteurs SMART et ne redémarrez pas plusieurs fois avant de capturer les preuves. Un redémarrage peut changer les noms des périphériques et effacer la séquence montrant quel membre a échoué en premier.

Que capturer avant de couper l'alimentation

  • État de l'ensemble, niveau RAID, rôles des membres, cible de reconstruction et compteurs de progression exacts
  • Chaque modèle de disque, numéro de série, baie, port de contrôleur et identifiant de périphérique actuel
  • Événements du noyau ou du contrôleur couvrant la première défaillance jusqu'à la dernière erreur d'E/S
  • Valeurs brutes SMART du média, délai d'attente, température et erreurs d'interface
  • Liste des fichiers ou plages de blocs illisibles et état de la dernière sauvegarde vérifiée

Ce dossier permet un test contrôlé de câble, un remplacement de disque, un clonage ou une récupération professionnelle sans deviner quel membre contenait les données les plus récentes.

Exiger un suivi stable après toute intervention

Après avoir remplacé un câble, déplacé un disque au numéro de série confirmé ou réduit la charge, réinitialisez uniquement la base de comparaison pertinente et surveillez la réapparition. Une amélioration temporaire ne prouve pas que la faute sous-jacente a disparu.

L'ensemble doit terminer la récupération, revenir à une pleine adhésion et réussir une vérification d'intégrité ultérieure sans nouvelles erreurs d'E/S. Tant que ces trois conditions ne sont pas remplies sous une charge représentative normale, gardez l'incident ouvert en toute sécurité et conservez les journaux capturés.

FAQ

Puis-je laisser la reconstruction se terminer s'il n'y a que quelques erreurs ?

Seulement lorsque les erreurs sont comprises, stables et que les données sont sauvegardées. Une augmentation des erreurs de lecture source ou des réinitialisations répétées est un signal d'escalade même si le pourcentage cible continue d'augmenter.

Dois-je remplacer le disque avec le plus grand nombre d'erreurs SMART ?

Pas automatiquement. Confirmez si les erreurs suivent ce disque au numéro de série ou restent avec sa baie et son chemin de connexion. Remplacer le mauvais membre pendant une opération dégradée peut détruire la source valide restante.

Une reconstruction terminée peut-elle encore contenir des fichiers endommagés ?

Oui. Certaines implémentations peuvent se terminer tout en signalant des secteurs irrécupérables ou des fichiers affectés. Examinez toujours le rapport d'erreur final et effectuez une vérification d'intégrité après que l'ensemble soit revenu à un état stable.

La condition d'arrêt

Lorsque les erreurs d'E/S augmentent pendant la reconstruction, protégez les données lisibles avant de poursuivre la complétion. Continuez uniquement après avoir prouvé que l'ensemble source et le chemin de connexion sont suffisamment stables pour fournir chaque bloc restant.

Assistance et conseils

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.