لا تقرر أن قرص NAS قد فشل بناءً على فصل واحد، تنبيه إدخال/إخراج، أو سطر SMART. يمكن أن ينتج كابل بيانات SATA التالف، الموصل الفضفاض، سلك الطاقة غير المستقر، المنفذ الفاشل، مشكلة وحدة التحكم، والقرص التالف أعراضًا متداخلة. الطريقة الموثوقة هي الحفاظ على الأدلة الأصلية، فصل أخطاء الرابط عن أخطاء الوسائط، تغيير متغير واحد في كل مرة، وملاحظة ما إذا كانت الأخطاء الجديدة تتبع مسار الكابل أو الرقم التسلسلي للقرص.
احمِ المصفوفة واحتفظ بالأدلة الأولى
إذا كان نظام NAS متدهورًا أو يفصل عضوًا بشكل متكرر، قلل من الكتابات التي يمكن تجنبها وتأكد من وجود بيانات لا يمكن استبدالها على نسخة احتياطية قابلة للقراءة منفصلة. سجل حالة المصفوفة قبل إعادة توصيل أي شيء. اختبار الكابل منخفض التكلفة، لكن إزالة قرص ثانٍ عن طريق الخطأ أو إعادة البناء عبر اتصال غير مستقر يمكن أن يخلق مشكلة استرداد أكبر بكثير.
احفظ طراز القرص المتأثر، الرقم التسلسلي، الحاوية، اسم الجهاز، تقرير SMART، تاريخ الاختبارات الذاتية، أحداث وحدة التحكم، والوقت الدقيق لكل إعادة تعيين أو خطأ في الإدخال/الإخراج. يستخدم دليل ZimaSpace لـ تمييز قرص RAID المفقود عن حاوية قرص تالفة نفس المبدأ: تحديد الجهاز المادي أولاً، ثم تتبع ما يتبعه الخطأ.
لا تمسح سمات SMART أو عدادات وحدة التحكم أو سجلات النظام قبل حفظ خط الأساس. العديد من العدادات هي إجماليات مدى الحياة ولن تعود إلى الصفر بعد استبدال الكابل. المهم هو ما إذا كانت القيمة الخام تزداد بعد تغيير محكم. تصوير الكابلات ووضع علامات على كلا الطرفين يمنع أيضًا حدوث لبس لاحقًا حول أي مسار تم اختباره فعليًا.
ابنِ فرضيتين متنافستين قبل الاختبار
الافتراض أ هو عطل في مسار الاتصال: كابل بيانات SATA، الموصل، المنفذ، أثر اللوحة الخلفية، قناة وحدة التحكم، موصل الطاقة، أو مصدر طاقة غير مستقر. هذا المسار غالبًا ما ينتج عنه إعادة تعيين الروابط، أخطاء CRC، انخفاض السرعة، انتهاء مهلة الأوامر، اختفاء مفاجئ، أو نفس الأعراض على أقراص مختلفة متصلة عبر نفس مسار الأجهزة.
الافتراض ب هو عطل في القرص: وسائط غير قابلة للقراءة، زيادة في القطاعات المعاد تخصيصها أو المعلقة، فشل في الاختبارات الذاتية، عطل في الإلكترونيات الداخلية، ضوضاء غير طبيعية، أو أخطاء تتبع نفس القرص ذو الرقم التسلسلي عبر كابلات ومنافذ معروفة بأنها سليمة. توضح مناقشة في BleepingComputer لماذا أخطاء النقل المتعلقة بالكابل لا يجب أن تُعامل تلقائيًا كقطاعات تالفة فعلية.
احتفظ بكلتا الفرضيتين مفتوحتين حتى تفرق الأدلة بينهما. خطأ CRC واحد لا يثبت أن الكابل سيء حاليًا، وخطأ قراءة واحد لا يثبت أن القرص يجب التخلص منه فورًا. يجب أن يسأل نموذج الاختبار أي العدادات الجديدة تنمو، وأي مكون يتبع العرض، وما إذا كان القرص يمكنه إكمال اختبار ذاتي طويل على مسار مستقر.
فصل أخطاء الرابط عن أخطاء الوسائط في بيانات SMART
عدد أخطاء UDMA CRC، الذي يظهر غالبًا كصفة SMART C7 أو 199، هو في الأساس دليل على مسار الاتصال. يشرح Level1Techs أن خطأ UDMA CRC يسجل تلفًا تم اكتشافه بين القرص ووحدة تحكم المضيف. الكابل هو سبب شائع، لكن الموصل، المنفذ، اللوحة الخلفية، وحدة التحكم، عدم استقرار الطاقة، أو إلكترونيات واجهة القرص نفسها يمكن أن تكون مسؤولة أيضًا.
تشير السمات المتعلقة بالوسائط في اتجاه مختلف. عدد القطاعات المعاد تخصيصها، عدد القطاعات المعلقة الحالية، الأخطاء غير القابلة للإصلاح في وضع عدم الاتصال، الأخطاء غير القابلة للإصلاح المبلغ عنها، والاختبار الذاتي الطويل الذي ينتهي بفشل قراءة هي أدلة أقوى على وجود مشكلة في القرص. تختلف أسماء السمات الخاصة بالمورد والصيغ الخام، لذا قارن الاتجاهات ونتائج الاختبار بدلاً من تطبيق عتبة واحدة عالمية على كل نموذج.
مجموع CRC المخزن ليس كافيًا بمفرده. شرح HardForum لـ مراقبة ما إذا كانت القيمة الخام لـ CRC تستمر في الزيادة يوضح التمييز الرئيسي. إذا ظل العدد دون تغيير بعد استبدال الكابل، فقد يصف حدثًا قديمًا. إذا ارتفع أثناء عمليات النقل الجديدة، فإن مسار الرابط النشط لا يزال غير مستقر.
| الأدلة | أكثر اتساقًا مع الكابل أو المنفذ أو مسار الطاقة | أكثر اتساقًا مع فشل القرص | لا يزال غامضًا |
|---|---|---|---|
| عدد أخطاء UDMA CRC / CRC الواجهة | تتوقف الزيادات الجديدة بعد تغيير الكابل أو المنفذ | زيادات جديدة تتبع نفس القرص عبر مسارات معروفة جيدة | مجموع قديم غير صفري لا يزداد |
| قطاعات معاد تخصيصها أو معلقة | عادة لا ينشأ فقط بسبب كابل البيانات | العدادات ترتفع أو تبقى دون حل بعد اختبار المسار المستقر | قيمة تاريخية واحدة بدون اتجاه أو نتيجة اختبار |
| اختبار SMART الذاتي الطويل | ينجح بشكل متكرر بعد إصلاح الرابط | يفشل عند LBA متكرر أو مرحلة قراءة على نظام آخر | تم الإلغاء لأن القرص انقطع الاتصال |
| سجلات النظام | إعادة تعيين الرابط، خطأ PHY، تقليل السرعة، إعادة توصيل الجهاز | خطأ قراءة وسائط غير قابل للتصحيح، خطأ استشعار، LBA سيء متكرر | مهلة I/O عامة بدون تفاصيل أدنى |
| يتبع الخطأ | نفس الفتحة، الكابل، المنفذ، اللوحة الخلفية، أو فرع الطاقة | نفس القرص ذو الرقم التسلسلي نفسه | تغيرت عدة متغيرات معًا |
غيّر متغيرًا واحدًا في الأجهزة في كل مرة
أوقف تشغيل NAS عندما لا يكون الغلاف أو وحدة التحكم مصممة للعملية الساخنة التي تخطط لأدائها بالضبط. ضع علامة على القرص والكابل، ثم استبدل فقط كابل بيانات SATA بكابل قصير معروف بالجودة ويغلق بإحكام ولا يكون منحنيًا بشدة. احتفظ بنفس القرص، المنفذ، موصل الطاقة، والفتحة للمقارنة الأولى.
قم بتشغيل النظام، واحفظ خط أساس جديد، وشغل عبء عمل تمثيلي محدود أثناء مراقبة أخطاء CRC الجديدة، أو إعادة التعيين، أو الانقطاعات. تشير مجتمع Unraid إلى أن أخطاء CRC غالبًا ما تشير إلى اتصال SATA لكنها قد تتعلق أيضًا بالطاقة. إذا استمر الخطأ، انتقل بعد ذلك إلى منفذ معروف بالجودة أو فرع طاقة مع الحفاظ على القرص نفسه.
لا تستبدل الكابل، أو تحرك القرص، أو تغير المنفذ، أو تبدل سلك الطاقة في خطوة واحدة. قد يجعل ذلك العرض يختفي، لكنه يدمر الأدلة اللازمة لتحديد المكون الفاشل. بعد كل تغيير، سجل الوقت المنقضي، عبء العمل، درجة الحرارة، فروق SMART، وأحداث السجل حتى يمكن مقارنة النتائج بدلاً من تذكرها.
قرر بناءً على ما يتبعه الخطأ الجديد
الكابل هو السبب الرئيسي عندما تظل خصائص وسائط القرص مستقرة، وتنجح الاختبارات الطويلة، وتتوقف أحداث CRC أو إعادة التعيين الجديدة بعد استبدال كابل البيانات. استبدل الكابل المشكوك فيه بدلاً من إعادة تركيبه في مكان آخر. إذا عادت المشكلة فقط على منفذ واحد في اللوحة الأم أو فتحة واحدة في اللوحة الخلفية، فإن المكون الفاشل يكون أبعد من الكابل.
القرص هو السبب الرئيسي عندما تستمر القطاعات غير المقروءة، القطاعات المعلقة، أحداث إعادة التخصيص، أو فشل الاختبارات الذاتية على كابل ومنفذ معروفين بالجودة، خاصةً عندما يكون نفس LBA أو القرص ذو الرقم التسلسلي نفسه متورطًا. تشير Tom's Hardware بالمثل إلى أن أخطاء CRC وحدها تحدد مشكلة في مسار النقل، وليس بالضرورة فشل القرص؛ استبدال القرص يتطلب أدلة أقوى من صحة الوسائط أو اختبارات متابعة الأخطاء.
المسار المشترك هو السبب الرئيسي عندما تفشل أقراص مختلفة في نفس الحاوية، على نفس منفذ وحدة التحكم، أو على نفس مقسم الطاقة. إذا انقطعت عدة أقراص معًا، فافحص مصدر الطاقة، اللوحة الخلفية المشتركة، HBA، والموصلات قبل إدانة عدة أقراص. السبب الجذري هو المكون المشترك للفشل، وليس بالضرورة أول جهاز تم ذكره في التنبيه.
قم بإصلاح السبب المؤكد قبل إعادة البناء
في حالة تأكيد مشكلة في الكابل، استبدل الكابل بشكل دائم، وثبت كلا الموصلين، صحح الانحناءات الحادة أو الشد، وأنشئ خط أساس جديد للعدادات. تحقق من عمليات القراءة والكتابة العادية، ثم قم بتشغيل الفحص أو التحقق من التناسق المدعوم من المنصة. يمكن للقرص الصحي العودة للخدمة عندما تظل خصائص الوسائط مستقرة ولا تظهر أخطاء ارتباط جديدة على المسار الذي تم إصلاحه.
في حالة تأكيد مشكلة في القرص، انسخ البيانات الحرجة القابلة للقراءة أولاً، واستبدل القرص وفقًا لإجراءات المصفوفة، وراقب عملية إعادة البناء. توقف وأعد التقييم إذا ظهرت أخطاء على عضو آخر أو إذا انقطع الاستبدال مرارًا وتكرارًا. شرح ZimaSpace لـ التكرار في RAID مقابل استرداد النسخ الاحتياطية هو الحد المناسب: إعادة البناء تستعيد التكرار، وليس نسخة نظيفة سابقة من البيانات التالفة.
قم بالتصعيد إلى وحدة التحكم أو اللوحة الخلفية أو استكشاف أخطاء الطاقة عندما يؤثر نفس المسار على عدة أقراص معروفة بالجودة. لا تبدأ بإعادة بناء متكررة لمجرد "رؤية ما يحدث". يكون التشخيص كاملاً فقط عندما يتم عزل المكون المشتبه به، ويكون مسار الاستبدال مستقرًا، وتتوقف العدادات عن الزيادة، ويمر القرص أو المصفوفة بالتحقق، وتظل البيانات المهمة قابلة للاسترداد خارج NAS.
الأسئلة الشائعة
هل يعني وجود عدد غير صفري من أخطاء UDMA CRC أن القرص يتعطل؟
لا. يسجل أخطاء الاتصال التي تم اكتشافها عبر مسار القرص-المضيف. احفظ القيمة الحالية وراقب ما إذا كانت تزداد بعد استبدال الكابل واختبار منفذ معروف بالجودة.
هل يمكن لكابل SATA سيء أن يسبب قطاعات معلقة؟
عادةً ما يتسبب كابل سيء في أخطاء نقل أو ارتباط. القطاعات المعلقة أو المعاد تخصيصها هي مؤشرات أقوى على صحة الوسائط، لكن الأوامر المتقطعة والسجلات الغامضة قد تتداخل. أعد اختبار القرص على مسار مستقر قبل اتخاذ القرار.
هل يجب أن أجري اختبار SMART طويل على مصفوفة RAID متدهورة؟
احمِ البيانات القابلة للقراءة أولاً واعتبر الضغط على الأعضاء المتبقين. قم بإجراء الاختبارات وفقًا لتوجيهات منصة NAS، تجنب تداخل المهام الثقيلة، وتوقف إذا ظهرت انقطاعات أو أخطاء إضافية.
الدعم والنصائح
المزيد للقراءة

لماذا لا تتغير سعة RAID بعد استبدال كل قرص؟
لا تزال سعة RAID تظهر الحجم القديم بعد استبدال القرص الأكبر؟ تحقق من حالة إعادة البناء، وأقسام الأعضاء، ونمو RAID، وطبقات الحجم، ونظام الملفات.

هل يمكن لأقراص بسرعة 5400 دورة في الدقيقة و7200 دورة في الدقيقة أن تشترك في نفس مرآة RAID 1؟
يمكن أن يعمل مرآة RAID 1 بسرعات مختلطة، لكن الأداء والسعة والسلوك الحراري ووقت إعادة البناء تتبع العضو الأضعف وسياسات وحدة التحكم.

لماذا لا تتغير سعة RAID بعد استبدال كل قرص؟
قم بتشخيص سبب استمرار ظهور سعة RAID القديمة بعد تركيب أقراص أكبر، ثم قم بتوسيع كل طبقة تخزين بالترتيب الصحيح.

