Considérez une reconstruction RAID comme bloquée uniquement lorsque le nombre de blocs traités cesse d'augmenter lors de vérifications répétées et que les journaux ne montrent aucune pause intentionnelle, limitation de priorité, phase en attente ou tentative de récupération. Le temps écoulé seul est insuffisant.
Les grands ensembles peuvent passer des heures dans une zone lente, changer brusquement de vitesse sous charge applicative ou faire une pause entre la reconstruction et la vérification. Établissez le mouvement avec les compteurs et les journaux avant d'intervenir, car arrêter ou réassembler un ensemble peut créer plus de risques que d'attendre.
Utilisez la variation de progression, pas un pourcentage unique
Enregistrez le nombre exact de blocs traités, le pourcentage, la vitesse et l'heure de fin estimée à intervalles fixes. Une reconstruction progresse lorsque le nombre de blocs augmente, même si le pourcentage arrondi reste inchangé. Sur des ensembles multi-téraoctets, un dixième de pour cent affiché peut représenter une grande quantité de travail.
Vérifiez le contrôleur ou le système d'exploitation depuis la même interface à chaque fois. Différents tableaux de bord peuvent mettre en cache le statut ou rapporter des phases différentes. Une barre de progression qui semble figée alors que les compteurs de blocs avancent est un problème de surveillance, pas une reconstruction bloquée.
Estimez une base locale plutôt qu'un délai universel
Il n'existe pas de nombre d'heures sûr unique. Le temps de reconstruction dépend de la capacité utilisée, de la configuration RAID, de la vitesse des disques, des erreurs, de la politique du contrôleur, de la charge en arrière-plan et du fait que l'implémentation copie tous les blocs ou seulement les régions allouées.
Utilisez la première heure stable pour estimer une plage approximative, puis comparez les intervalles suivants. Un taux de resynchronisation mdadm très lent peut provenir de la charge de travail, de l'alignement, du comportement du lien ou d'un disque en difficulté ; un diagnostic correct nécessite plus qu'une simple augmentation de la limite de vitesse.
Recherchez une pause intentionnelle ou une nouvelle phase
Certains systèmes limitent la récupération pour protéger les E/S au premier plan, mettent en pause les vérifications pendant le resilver, attendent l'affectation d'un disque de secours ou passent de la reconstruction à l'initialisation de la parité ou à la vérification de cohérence. L'étiquette peut rester « reconstruction » alors que la tâche active change.
Vérifiez la maintenance programmée, les réglages d'alimentation, les limites de température, la priorité de reconstruction et le trafic applicatif. Si la vitesse augmente lorsque la charge en premier plan diminue, le volume est limité en ressources plutôt que bloqué.
Les erreurs de lecture répétées créent un véritable blocage
Un disque source peut passer beaucoup de temps à retenter un secteur faible, provoquant un effondrement du débit près de la même plage de blocs. Si le contrôleur signale finalement une lecture irrécupérable, la reconstruction peut s'interrompre car la redondance ne peut pas reconstruire cette région.
Une reconstruction arrêtée par des erreurs de lecture montre pourquoi le dernier bloc réussi et l'erreur du noyau immédiatement après sont importants. Ne redémarrez pas sans cesse une récupération qui échoue à la même adresse sans protéger les données et examiner le membre source.
Une vitesse nulle avec activité de journal peut indiquer une nouvelle tentative
Une vitesse affichée à zéro peut survenir lors de tentatives de commande, réinitialisations de périphérique, récupération d'erreur, mises à jour des métadonnées ou pause temporaire. Surveillez le temps d'occupation du disque, la profondeur de la file d'attente, les événements du contrôleur et les messages du noyau. Les réinitialisations ou délais d'attente répétés ne sont pas un progrès sain.
Une récupération qui s'interrompt à plusieurs reprises montre aussi que chaque arrêt n'est pas forcément dû à une défaillance SMART évidente. Capturez le point exact et tous les journaux au lieu de supposer qu'un nouveau disque ou un réglage de vitesse plus élevé résoudra le problème.
Utiliser un tableau de décision de blocage pratique
| Observation sur deux intervalles ou plus | Interprétation | Action |
|---|---|---|
| Augmentation des blocs traités | Lent mais en progression | Continuer la surveillance |
| Pourcentage inchangé, augmentation des blocs | Affichage arrondi | Attendre |
| Blocs inchangés, tâche indiquant une pause | Maintien intentionnel | Trouver la raison de la pause ou de la politique |
| Blocs inchangés, tentatives/réinitialisations répétées | Problème matériel ou de chemin | Réduire les écritures ; inspecter la source et la connexion |
| S'arrête au même bloc après redémarrage | Région illisible persistante | Protéger les données ; arrêter les tentatives aveugles |
| 99,9 % avec phase de suivi active | Finalisation ou travail sur les métadonnées | Vérifier l'étiquette d'opération et les journaux |
Exigez des preuves d'au moins deux signaux indépendants avant de déclarer la reconstruction bloquée : absence de mouvement des compteurs plus une erreur, un état abandonné ou un point d'arrêt identique persistant.
Que faire avant de redémarrer quoi que ce soit
- Sauvegardez les détails de l'ensemble, les numéros de série des membres, les compteurs de blocs traités et le journal complet des événements.
- Réduisez les E/S d'application non essentielles et confirmez que les disques cible et source restent détectés.
- Vérifiez les indicateurs SMART des médias et les compteurs de réinitialisation de lien ou CRC sur chaque source active.
- Confirmez qu'il n'y a pas d'état en pause, de limite de température, de politique de priorité ou de phase de vérification en attente.
- Passez à la sauvegarde, à l'imagerie ou à la récupération lorsque la même plage illisible arrête les tentatives répétées.
N'utilisez pas les commandes stop, assemble, force-online ou metadata-clear tant que l'état de l'ensemble et l'implémentation exacte ne sont pas connus.
Comparer la progression pendant un intervalle calme
Un test de blocage utile nécessite une fenêtre d'observation contrôlée. Suspendez les transferts importants et les tâches planifiées, puis enregistrez les compteurs au début et à la fin de l'intervalle. Cela sépare la contention en premier plan d'un processus de récupération qui ne peut pas avancer seul.
Si la progression reprend lorsque la charge diminue, choisissez une priorité de maintenance plus basse ou un planning plus calme. Si les compteurs restent fixes et que la même erreur se répète, attendre davantage sans enquête apporte peu d'informations.
FAQ
Est-ce que 99,9 % pendant une heure signifie automatiquement un blocage ?
Non. Les mises à jour finales des métadonnées ou une phase de vérification peuvent prendre du temps. Confirmez si les blocs traités, les écritures sur le périphérique ou l'état de l'opération changent encore avant d'intervenir.
Dois-je augmenter la limite de vitesse de reconstruction ?
Seulement après avoir prouvé que les disques sont sains et que la politique d'E/S en premier plan est le goulot d'étranglement. Une limite plus élevée peut aggraver la latence des applications et exercer plus de pression sur un disque source marginal.
Quand dois-je arrêter d'attendre ?
Ne considérez pas cela comme normal lorsque les compteurs restent inchangés lors de vérifications répétées et que les journaux montrent un abandon, une réinitialisation récurrente du périphérique, une lecture irrécupérable ou une défaillance dans la même plage de blocs.
La définition opérationnelle du blocage
Une reconstruction est bloquée lorsque le travail mesurable s'est arrêté et que le système ne peut pas expliquer la pause par une politique, une charge ou une nouvelle phase. Utilisez des compteurs et des preuves d'erreur, pas l'anxiété ou le temps réel.
Assistance et conseils
Plus à lire

Pourquoi un ensemble RAID devient-il inactif après une coupure de courant ?
Un ensemble inactif signifie souvent que des métadonnées ont été trouvées, mais que le système n'avait pas suffisamment de confiance ou de membres pour...

Quels sont les risques de forcer la remise en ligne d’un membre RAID manquant ?
Les options de forçage peuvent contourner les vérifications de sécurité concernant les métadonnées obsolètes, la parité corrompue, les écritures manquantes ou les pools actifs...

Comment distinguer un câble SATA défectueux d’un disque NAS en panne
Suivez si les erreurs proviennent du disque ou restent liées au chemin SATA, et séparez les compteurs de transport des preuves de l'état du...

