قد يختفي محرك NVMe بعد السكون عندما تفشل وحدة التحكم فيه أو وصلة PCIe في العودة من حالة الطاقة المنخفضة أثناء الاستئناف.
عادةً لا تكون المشكلة في محرك يعمل بعد إقلاع بارد ثم يختفي فقط بعد التعليق مشكلةً بسيطة في نظام الملفات. فقد يحدث العطل قبل ظهور مساحة الأسماء أو القسم أو نظام الملفات أو التطبيق؛ إذ قد لا يُعاد تعداد جهاز PCIe، أو قد تفشل وحدة تحكم NVMe في أن تصبح جاهزة، أو قد تؤدي مجموعة من إعدادات إدارة الطاقة إلى جعل الوصلة غير قابلة للوصول. شخّص أول طبقة مفقودة بدءًا من أدنى مستوى، وتجنّب تهيئة وحدة التخزين أو استبدالها أو إعادة بنائها حتى تفهم مسار الجهاز.
حدّد أدنى طبقة تختفي بعد الاستئناف
قبل السكون، سجّل جهاز PCI، ووحدة تحكم NVMe، ومساحات الأسماء، والأقسام، ومعرّفات UUID لنظم الملفات، ونقاط التثبيت، والتطبيقات التي تستخدم محرك الأقراص. كرّر الفحوص نفسها فور الاستئناف.
يعرض النظام الفرعي لـ NVMe في Linux وحدات التحكم ومساحات الأسماء كطبقات منفصلة. ويساعد أمر nvme list في Ubuntu على التمييز بين وحدة تحكم مفقودة ووحدة تحكم ما تزال موجودة لكنها لم تعد تعرض مساحة الأسماء المتوقعة.
إذا كانت وظيفة PCI مفقودة، فركّز على البرامج الثابتة وطاقة وصلة PCIe وسلوك التعليق. وإذا بقيت وحدة التحكم موجودة لكن اختفى جهاز الكتل، فركّز على إعادة ضبط NVMe، ومساحات الأسماء، وأخطاء برنامج التشغيل، وجاهزية وحدة التحكم.
قارن بين الإقلاع البارد وإعادة التشغيل وكل حالة سكون مدعومة
اختبر الإقلاع البارد، وإعادة التشغيل العادية، والتعليق إلى الخمول، والتعليق العميق فقط عندما يعرضهما نظام التشغيل والبرامج الثابتة. سجّل الانتقال الذي يعيد إنتاج العطل.
يميّز Linux بين التعليق إلى الخمول ووضع الاستعداد والتعليق إلى ذاكرة الوصول العشوائي، ولكل منها مستوى مختلف من خفض طاقة الجهاز والمنصة. يوضح وصف حالات السكون في النواة سبب قدرة إحدى وحدات تحكم NVMe على الاستئناف بنجاح من حالة سطحية، مع فشلها بعد انتقال أعمق للمنصة.
يُعدّ اقتصار العطل على حالة واحدة دليلًا أقوى على وجود مشكلة في انتقال الطاقة منه على وجود مشكلة في تهيئة القرص. أبقِ الحالة المعروفة بعملها متاحة أثناء اختبار إصلاح دائم للبرامج الثابتة أو برنامج التشغيل.
تحقّق من إعادة تعداد جهاز PCIe
قارن مخرجات ناقل PCI قبل السكون وبعد الاستئناف، بما في ذلك عنوان وحدة تحكم NVMe، وحالة الوصلة المتفاوض عليها، وبرنامج تشغيل النواة، وعدادات الأخطاء. احفظ عنوان الناقل الدقيق قبل الاختبار.
تعرض أداة lspci وحدة التحكم على طبقة PCI قبل مشاركة أي مساحة أسماء أو نظام ملفات، ما يجعلها الأداة الفاصلة الصحيحة عندما يبدو أن جهاز NVMe بالكامل قد اختفى.
إذا كان الجهاز مفقودًا من تعداد PCI، فلن تفيد إعادة فحص نظام الملفات أو إعادة إنشاء نقاط التثبيت. وإذا ظل ظاهرًا، فالتقط أخطاء NVMe والنواة قبل محاولة إعادة ضبط وحدة التحكم.
اختبر انتقالات حالة الطاقة المستقلة لوحدة NVMe
سجّل إعدادات حالة طاقة NVMe الحالية وما إذا كانت انتقالات حالة الطاقة المستقلة مفعّلة. غيّر متغيرًا واحدًا متعلقًا بالطاقة فقط خلال دورة تعليق مضبوطة واحدة.
توثّق ArchWiki سلوك توفير الطاقة في NVMe وعنصر التحكم في زمن استجابة APST المستخدم للحد من مدى دخول وحدة التحكم في حالات الطاقة المنخفضة عندما تستأنف أجهزة معينة بصورة غير موثوقة.
يُعدّ تقييد APST مؤقتًا إجراءً تشخيصيًا، وليس دليلًا على أن كل حالة عميقة معيبة. إذا نجا محرك الأقراص من دورات استئناف متكررة فقط عند استخدام سياسة طاقة أقل عمقًا، فقارن إصلاحات البرامج الثابتة والنواة قبل الإبقاء على الحل البديل بصورة دائمة.
راجع سلوك البرامج الثابتة وBIOS ووضع الاستعداد الحديث
سجّل إصدار البرامج الثابتة للوحة الأم، والبرامج الثابتة لمحرك NVMe، وإصدار نظام التشغيل، وأي تغيير حديث في BIOS أو برنامج التشغيل. تحقّق مما إذا كانت المنصة تستخدم السكون التقليدي أو نموذج خمول حديث منخفض الطاقة.
يوضح نموذج الاستعداد الحديث من Microsoft أن الأجهزة المدعومة تظل خاضعة لسلوك منخفض الطاقة تديره المنصة بدلًا من اتباع المسار نفسه للسكون التقليدي، ما قد يغيّر طريقة تكرار مشكلة NVMe بين الأنظمة.
حدّث طبقة برامج ثابتة واحدة في كل مرة، واحتفظ بالإصدار السابق أو بطريقة الاسترداد. لا تجمع بين تحديث BIOS وتحديث البرامج الثابتة لمحرك SSD وترقية نظام التشغيل في اختبار واحد، لأنك لن تتمكن من تحديد التغيير الذي نجح.
افحص طاقة وصلة PCIe وإدارة الطاقة أثناء التشغيل
تحقّق من إعدادات ASPM في PCIe، وحالة الطاقة أثناء التشغيل، وما إذا كانت وحدة تحكم NVMe تدخل حالة تعليق أثناء التشغيل قبل سكون النظام. قارن الفتحة التي يحدث فيها العطل بفتحة أخرى فقط إذا كان تصميم الخادم يسمح بذلك بأمان.
توضح إرشادات إدارة الطاقة من Red Hat أن إدارة الطاقة أثناء التشغيل وASPM في PCIe آليتان منفصلتان، لذا فإن تعطيل إحداهما وملاحظة حدوث تغيير لا يحدد تلقائيًا أن الأخرى هي السبب.
إذا انتقلت المشكلة مع محرك الأقراص إلى فتحة أخرى، فاشتبه في وحدة التحكم أو البرامج الثابتة. وإذا بقيت في فتحة واحدة، فافحص البرامج الثابتة للوحة الأم، وتقسيم المسارات، والمسارات المشتركة، وطاقة الفتحة، وسلامة الإشارة.
استعد بأمان وتحقّق من دورات الاستئناف المتكررة
عندما يختفي محرك الأقراص، احتفظ بالسجلات قبل إيقاف التشغيل البارد. تجنّب عمليات إعادة الضبط الساخنة المتكررة إذا أبلغت وحدة التحكم عن حالة حرجة أو أخطاء في الوصلة أو اختفاء مساحات الأسماء.
توفر قائمة التحقق من استرداد الخادم المنزلي في ZimaSpace القاعدة المرتبطة التالية: تحقّق من ظهور الأجهزة وحالة التخزين قبل تشغيل إصلاح نظام الملفات أو استعادة البيانات.
تُحل المشكلة عندما تصمد وحدة التحكم ومساحة الأسماء والأقسام ونقاط التثبيت والتطبيقات أمام دورات متكررة من السكون والاستئناف في حالة الطاقة المقصودة. احتفظ بنسخة احتياطية حديثة حتى ينجح الإصلاح أيضًا بعد إعادة التشغيل وفترة الخمول وحمل التخزين المعتاد.
الدعم والنصائح
المزيد للقراءة

هل يمكن لـ Plex مشاركة وحدة معالجة الرسومات (GPU) مع حاوية Docker أخرى؟
يمكن لـ Plex وحاوية أخرى غالبًا الوصول إلى وحدة معالجة الرسومات نفسها، لكن يجب اختبار دعم برنامج التشغيل، وتعيين الجهاز، وحِمل محرّك الفيديو، والذاكرة،...

كيفية معرفة ما إذا كان خطأ Plex ناتجًا عن العميل أم الخادم
أعِد إنتاج العنصر نفسه على عميل آخر، وقارن مسار الجلسة، ثم اجمع أدلة من الخادم فقط بعد أن يحدد النطاق موضع الفشل الفعلي.

كيفية إعداد ذاكرة التخزين المؤقت وموقع التخزين المؤقت لتحويل الترميز في Plex
احمِ حالة Plex الدائمة مع وضع الملفات المؤقتة للتحويل على مساحة تخزين محلية مناسبة، ثم تحقّق من التنظيف والمساحة الحرة وسلوك إعادة التشغيل.

