Inquiétez-vous lorsque les erreurs de somme de contrôle réapparaissent après avoir enregistré et effacé l’ancienne référence, et non simplement parce qu’un compteur n’est pas à zéro.
ZFS peut réparer un bloc défectueux lorsqu’une redondance fournit une copie valide, mais cette réparation n’explique pas pourquoi les mauvaises données sont arrivées. Enregistrez la sortie de zpool status -v et les journaux système pertinents, vérifiez les sauvegardes, puis utilisez la récurrence, le schéma des appareils affectés et un scrub propre pour déterminer si l’événement était isolé ou si la panne est toujours active.
Consignez ce que ZFS a corrigé avant d’effacer quoi que ce soit
Enregistrez l’état complet du pool, l’horodatage du scrub, le nombre d’erreurs par appareil et toute liste d’erreurs permanentes. Capturez également au même moment les messages du noyau concernant les réinitialisations de liaison, les dépassements de délai des commandes, les pannes du contrôleur, les erreurs machine et les événements de coupure de courant inattendus.
Une explication détaillée de la communauté sur les compteurs de sommes de contrôle ZFS corrigés et leurs causes possibles distingue les blocs corrigés de la panne de câble, d’alimentation, de contrôleur, de mémoire ou de disque qui a pu les produire. La réparation ne certifie pas l’intégrité du chemin matériel.
Vérifiez qu’une autre copie utilisable des données importantes existe avant de solliciter le pool. Effacer les compteurs n’est acceptable qu’après avoir sauvegardé les éléments de preuve, car la prochaine décision dépend de l’apparition ou non d’erreurs réellement nouvelles.
Utilisez la récurrence et l’étendue comme seuil de décision
Après avoir enregistré la référence, effacez les compteurs et lancez un scrub pendant une période où l’alimentation et la température sont stables. Si le scrub se termine proprement et que l’utilisation normale ne produit aucune nouvelle erreur, surveillez plutôt que de remplacer le matériel à partir d’un seul événement historique.
Si le même disque accumule de nouvelles erreurs de somme de contrôle, inspectez son chemin de données et d’alimentation, son historique SMART, les statistiques de liaison et le port du contrôleur. Si plusieurs disques accumulent des erreurs simultanément, donnez la priorité aux composants partagés tels que le HBA, le fond de panier, l’alimentation, le câblage, la mémoire ou la stabilité du système.
Toute erreur permanente de données, erreur d’E/S répétée, suspension du pool ou augmentation rapide du compteur accroît l’urgence. Arrêtez les écritures non essentielles, actualisez la sauvegarde et isolez la couche suspecte avant qu’un autre scrub n’ajoute de la charge.
Modifiez une seule couche et prouvez le résultat
Une fois le système hors tension, rebranchez ou remplacez le câble de données et d’alimentation suspect, ou déplacez l’appareil vers un port connu comme fonctionnel. Ne remplacez pas plusieurs couches à la fois, sinon un résultat positif ne permettra pas d’identifier le composant qui a changé l’issue.
Pour un schéma propre à un appareil, exécutez le test du fabricant du disque ou une lecture contrôlée après avoir examiné l’historique SMART. Pour un schéma touchant plusieurs appareils, testez la mémoire et la stabilité de l’alimentation, puis inspectez le chemin du contrôleur avant de supposer que plusieurs disques sont tombés en panne simultanément.
Le guide des systèmes d’exploitation pour serveurs domestiques aide à déterminer où se trouvent la santé du pool, les journaux du noyau et la gestion du contrôleur sur les plateformes NAS et Linux courantes.
Vérifiez la récupération avec la charge de travail d’origine
Effectuez un scrub complet après la réparation isolée, puis répétez la charge de travail qui avait précédemment révélé le problème. La récupération signifie que le scrub se termine sans nouvelles erreurs de somme de contrôle, de lecture ou d’écriture, et que les compteurs restent stables après un redémarrage et pendant une autre période représentative de charge de travail.
Remplacez un disque lorsque les éléments de preuve le suivent sur un chemin connu comme fonctionnel, que les données SMART ou les autotests se dégradent également, ou qu’il produit de nouvelles erreurs après avoir éliminé les problèmes de câblage et d’alimentation. Remplacez ou réparez la couche partagée lorsque les erreurs restent liées à un port, un boîtier, un contrôleur ou un événement d’alimentation.
Faites immédiatement remonter le problème en cas d’erreurs permanentes, de pool dégradé sans redondance suffisante ou d’incertitude concernant la copie faisant autorité. Un événement corrigé est un avertissement qui appelle un diagnostic ; une nouvelle correction répétable prouve que ce diagnostic ne peut pas être différé.
FAQ
zpool clear corrige-t-il la cause ? Non. Il réinitialise les compteurs enregistrés après la sauvegarde des éléments de preuve ; seuls un scrub propre et une charge de travail de suivi stable montrent que le chemin sous-jacent ne produit plus de mauvaises données.
Peut-on ignorer une seule erreur de somme de contrôle corrigée ? Considérez-la comme un avertissement enregistré. Si elle ne réapparaît pas après l’effacement de la référence et un scrub propre, une simple surveillance peut être proportionnée ; une récurrence ou des défauts d’E/S associés exigent une isolation.
Un rapport SMART sain permet-il d’innocenter le disque ? Non. SMART peut ne pas détecter les problèmes de câble, de contrôleur, d’alimentation et certains défauts de l’appareil ; combinez-le donc avec l’étendue des erreurs ZFS, les journaux système, des échanges contrôlés et des scrubs après réparation.
Assistance et conseils
Plus à lire

Quelle luminosité d’écran aide à réduire la fatigue oculaire lors de longues consultations de fichiers NAS ?
Il n’existe pas de pourcentage de luminosité universel ; adaptez un écran blanc à la pièce, maîtrisez les reflets, gardez le texte lisible et...

Comment réduire les tensions cervicales lorsque la console d’un serveur domestique est montée trop bas
Déplacez les tâches routinières hors de la console basse ou relevez la cible visuelle en toute sécurité, tout en gardant le clavier plus bas...

Pourquoi mes yeux sont-ils fatigués après avoir surveillé un tableau de bord de serveur lumineux la nuit ?
La fatigue liée aux tableaux de bord nocturnes combine souvent une luminosité inadaptée, des reflets, une concentration prolongée et une diminution du clignement des...

