Solution communautaire

Le stockage de ZimaOS devient soudainement en lecture seule : vérifiez le NVMe, le RAID et les erreurs du système de fichiers

After updating to ZimaOS 1.5.3, a user's main storage suddenly became read-only. Reseating the NVMe drives and rebooting restored access, while replies advised checking RAID health, drive health and I/O errors if it returned.

Le passage en lecture seule d’un pool de stockage est un symptôme de protection, pas un diagnostic. Dans ce cas rapporté par la communauté, l’utilisateur a réinstallé les SSD NVMe et redémarré la machine, après quoi le stockage a été rétabli. Cela laisse penser qu’un problème de connexion ou un incident matériel transitoire était plausible, mais la discussion n’a pas démontré que la mise à jour en était la cause.

Le mode lecture seule peut être une réponse de protection aux erreurs de stockage

Les systèmes de fichiers et les couches de stockage Linux peuvent restreindre les écritures lorsqu’ils détectent de graves problèmes d’E/S ou de cohérence. Sur Btrfs, le fonctionnement de scrub de Btrfs décrit la vérification et la réparation des sommes de contrôle pour les profils répliqués pris en charge, mais scrub n’est qu’un outil et ne remplace pas l’analyse de l’état des périphériques.

Vérifier l’état des périphériques et la stabilité des connexions

La réponse de la communauté recommandait de vérifier l’état SMART, les journaux système, l’installation des SSD NVMe, l’alimentation ainsi que la stabilité du fond de panier et des câbles. Les diagnostics de disque smartctl fournissent la couche de diagnostic de l’état des disques pris en charge.

L’écosystème PCIe de Zima est pertinent lorsque des périphériques NVMe sont connectés via des adaptateurs PCIe ou du matériel d’extension. Une liaison instable peut se manifester par un problème de système de fichiers, même si le système de fichiers n’en est pas la cause initiale.

Ne pas formater la matrice comme première solution

Une réponse relatait la reconstruction d’une propre matrice RAID après un événement similaire, mais ce n’est pas une première réaction sûre. Si les données sont importantes, suivez les principes du processus de récupération RAID et vérifiez l’existence d’une sauvegarde indépendante avant de recréer les matrices ou les systèmes de fichiers.

Le processus de sauvegarde de ZimaOS est la bonne étape suivante une fois le stockage de nouveau lisible. Si le problème se reproduit, capturez les journaux pendant la panne au lieu de vous fier uniquement à l’état normal après un redémarrage.

Liste de vérification pratique en cas de récidive

  1. Interrompez les écritures inutiles et n’initialisez ni ne formatez rien.
  2. Vérifiez l’état de santé du stockage et du RAID.
  3. Consultez les journaux du noyau et du système pour repérer les erreurs d’E/S, NVMe, de système de fichiers ou de RAID.
  4. Vérifiez l’état des disques lorsque les diagnostics SMART/NVMe sont disponibles.
  5. Inspectez l’installation physique, les adaptateurs, l’alimentation et le refroidissement.
  6. Sauvegardez les données importantes dès que le système de fichiers est de nouveau lisible en toute sécurité.

En résumé

La réinstallation des SSD NVMe a rétabli le stockage de cet utilisateur, mais cela doit être considéré comme l’indice d’un éventuel problème matériel ou de chemin de connexion transitoire, et non comme une réparation définitive. Un passage récurrent en lecture seule justifie d’effectuer des diagnostics des disques, du RAID, du système de fichiers, des journaux et des connexions avant tout formatage ou toute reconstruction.