لماذا يفقد الخادم المنزلي أحد أقراص NVMe فقط بعد الاستيقاظ من وضع السكون؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

قد يختفي محرك NVMe بعد السكون عندما تفشل وحدة التحكم فيه أو وصلة PCIe في العودة من حالة الطاقة المنخفضة أثناء الاستئناف.

عادةً لا تكون المشكلة في محرك يعمل بعد إقلاع بارد ثم يختفي فقط بعد التعليق مشكلةً بسيطة في نظام الملفات. فقد يحدث العطل قبل ظهور مساحة الأسماء أو القسم أو نظام الملفات أو التطبيق؛ إذ قد لا يُعاد تعداد جهاز PCIe، أو قد تفشل وحدة تحكم NVMe في أن تصبح جاهزة، أو قد تؤدي مجموعة من إعدادات إدارة الطاقة إلى جعل الوصلة غير قابلة للوصول. شخّص أول طبقة مفقودة بدءًا من أدنى مستوى، وتجنّب تهيئة وحدة التخزين أو استبدالها أو إعادة بنائها حتى تفهم مسار الجهاز.

حدّد أدنى طبقة تختفي بعد الاستئناف

قبل السكون، سجّل جهاز PCI، ووحدة تحكم NVMe، ومساحات الأسماء، والأقسام، ومعرّفات UUID لنظم الملفات، ونقاط التثبيت، والتطبيقات التي تستخدم محرك الأقراص. كرّر الفحوص نفسها فور الاستئناف.

يعرض النظام الفرعي لـ NVMe في Linux وحدات التحكم ومساحات الأسماء كطبقات منفصلة. ويساعد أمر nvme list في Ubuntu على التمييز بين وحدة تحكم مفقودة ووحدة تحكم ما تزال موجودة لكنها لم تعد تعرض مساحة الأسماء المتوقعة.

إذا كانت وظيفة PCI مفقودة، فركّز على البرامج الثابتة وطاقة وصلة PCIe وسلوك التعليق. وإذا بقيت وحدة التحكم موجودة لكن اختفى جهاز الكتل، فركّز على إعادة ضبط NVMe، ومساحات الأسماء، وأخطاء برنامج التشغيل، وجاهزية وحدة التحكم.

قارن بين الإقلاع البارد وإعادة التشغيل وكل حالة سكون مدعومة

اختبر الإقلاع البارد، وإعادة التشغيل العادية، والتعليق إلى الخمول، والتعليق العميق فقط عندما يعرضهما نظام التشغيل والبرامج الثابتة. سجّل الانتقال الذي يعيد إنتاج العطل.

يميّز Linux بين التعليق إلى الخمول ووضع الاستعداد والتعليق إلى ذاكرة الوصول العشوائي، ولكل منها مستوى مختلف من خفض طاقة الجهاز والمنصة. يوضح وصف حالات السكون في النواة سبب قدرة إحدى وحدات تحكم NVMe على الاستئناف بنجاح من حالة سطحية، مع فشلها بعد انتقال أعمق للمنصة.

يُعدّ اقتصار العطل على حالة واحدة دليلًا أقوى على وجود مشكلة في انتقال الطاقة منه على وجود مشكلة في تهيئة القرص. أبقِ الحالة المعروفة بعملها متاحة أثناء اختبار إصلاح دائم للبرامج الثابتة أو برنامج التشغيل.

تحقّق من إعادة تعداد جهاز PCIe

قارن مخرجات ناقل PCI قبل السكون وبعد الاستئناف، بما في ذلك عنوان وحدة تحكم NVMe، وحالة الوصلة المتفاوض عليها، وبرنامج تشغيل النواة، وعدادات الأخطاء. احفظ عنوان الناقل الدقيق قبل الاختبار.

تعرض أداة lspci وحدة التحكم على طبقة PCI قبل مشاركة أي مساحة أسماء أو نظام ملفات، ما يجعلها الأداة الفاصلة الصحيحة عندما يبدو أن جهاز NVMe بالكامل قد اختفى.

إذا كان الجهاز مفقودًا من تعداد PCI، فلن تفيد إعادة فحص نظام الملفات أو إعادة إنشاء نقاط التثبيت. وإذا ظل ظاهرًا، فالتقط أخطاء NVMe والنواة قبل محاولة إعادة ضبط وحدة التحكم.

-15% OFF

اختبر انتقالات حالة الطاقة المستقلة لوحدة NVMe

سجّل إعدادات حالة طاقة NVMe الحالية وما إذا كانت انتقالات حالة الطاقة المستقلة مفعّلة. غيّر متغيرًا واحدًا متعلقًا بالطاقة فقط خلال دورة تعليق مضبوطة واحدة.

توثّق ArchWiki سلوك توفير الطاقة في NVMe وعنصر التحكم في زمن استجابة APST المستخدم للحد من مدى دخول وحدة التحكم في حالات الطاقة المنخفضة عندما تستأنف أجهزة معينة بصورة غير موثوقة.

يُعدّ تقييد APST مؤقتًا إجراءً تشخيصيًا، وليس دليلًا على أن كل حالة عميقة معيبة. إذا نجا محرك الأقراص من دورات استئناف متكررة فقط عند استخدام سياسة طاقة أقل عمقًا، فقارن إصلاحات البرامج الثابتة والنواة قبل الإبقاء على الحل البديل بصورة دائمة.

راجع سلوك البرامج الثابتة وBIOS ووضع الاستعداد الحديث

سجّل إصدار البرامج الثابتة للوحة الأم، والبرامج الثابتة لمحرك NVMe، وإصدار نظام التشغيل، وأي تغيير حديث في BIOS أو برنامج التشغيل. تحقّق مما إذا كانت المنصة تستخدم السكون التقليدي أو نموذج خمول حديث منخفض الطاقة.

يوضح نموذج الاستعداد الحديث من Microsoft أن الأجهزة المدعومة تظل خاضعة لسلوك منخفض الطاقة تديره المنصة بدلًا من اتباع المسار نفسه للسكون التقليدي، ما قد يغيّر طريقة تكرار مشكلة NVMe بين الأنظمة.

حدّث طبقة برامج ثابتة واحدة في كل مرة، واحتفظ بالإصدار السابق أو بطريقة الاسترداد. لا تجمع بين تحديث BIOS وتحديث البرامج الثابتة لمحرك SSD وترقية نظام التشغيل في اختبار واحد، لأنك لن تتمكن من تحديد التغيير الذي نجح.

افحص طاقة وصلة PCIe وإدارة الطاقة أثناء التشغيل

تحقّق من إعدادات ASPM في PCIe، وحالة الطاقة أثناء التشغيل، وما إذا كانت وحدة تحكم NVMe تدخل حالة تعليق أثناء التشغيل قبل سكون النظام. قارن الفتحة التي يحدث فيها العطل بفتحة أخرى فقط إذا كان تصميم الخادم يسمح بذلك بأمان.

توضح إرشادات إدارة الطاقة من Red Hat أن إدارة الطاقة أثناء التشغيل وASPM في PCIe آليتان منفصلتان، لذا فإن تعطيل إحداهما وملاحظة حدوث تغيير لا يحدد تلقائيًا أن الأخرى هي السبب.

إذا انتقلت المشكلة مع محرك الأقراص إلى فتحة أخرى، فاشتبه في وحدة التحكم أو البرامج الثابتة. وإذا بقيت في فتحة واحدة، فافحص البرامج الثابتة للوحة الأم، وتقسيم المسارات، والمسارات المشتركة، وطاقة الفتحة، وسلامة الإشارة.

استعد بأمان وتحقّق من دورات الاستئناف المتكررة

عندما يختفي محرك الأقراص، احتفظ بالسجلات قبل إيقاف التشغيل البارد. تجنّب عمليات إعادة الضبط الساخنة المتكررة إذا أبلغت وحدة التحكم عن حالة حرجة أو أخطاء في الوصلة أو اختفاء مساحات الأسماء.

توفر قائمة التحقق من استرداد الخادم المنزلي في ZimaSpace القاعدة المرتبطة التالية: تحقّق من ظهور الأجهزة وحالة التخزين قبل تشغيل إصلاح نظام الملفات أو استعادة البيانات.

تُحل المشكلة عندما تصمد وحدة التحكم ومساحة الأسماء والأقسام ونقاط التثبيت والتطبيقات أمام دورات متكررة من السكون والاستئناف في حالة الطاقة المقصودة. احتفظ بنسخة احتياطية حديثة حتى ينجح الإصلاح أيضًا بعد إعادة التشغيل وفترة الخمول وحمل التخزين المعتاد.

الدعم والنصائح

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.