سقوط عضو RAID لا يعني تلقائيًا فشل القرص. السبب الحقيقي هو المكون الذي يتبع الخطأ بعد الفحوصات المضبوطة وتبديل الطاقة.
ابدأ بالحفاظ على حالة المصفوفة، تسجيل الرقم التسلسلي للقرص والحاوية، مقارنة سمات وسائط SMART مع أخطاء الاتصال، وقراءة سجلات وحدة التحكم. ثم غيّر متغيرًا واحدًا في الأجهزة في كل مرة. هذا المسار يساعدك على تجنب استبدال قرص سليم أو إعادة البناء عبر حاوية معطوبة.
توقف قبل أن تعيد البناء أو تسحب قرصًا آخر
المصفوفة المتدهورة لديها مساحة أقل لخطأ أو فشل آخر. تأكد من وجود بيانات لا يمكن استبدالها على نسخة احتياطية منفصلة قابلة للقراءة، احفظ حالة التخزين الحالية، وقلل من الكتابات التي يمكن تجنبها قبل تغيير الأجهزة.
التقط لقطات شاشة أو تصديرات لحالة RAID، قائمة الأقراص الفعلية، تقارير SMART، وأحداث وحدة التحكم. سجل وقت التنبيه، العضو المنطقي المتأثر، الحاوية المبلغ عنها، الطراز، الرقم التسلسلي، وأي عدادات للوسائط، المهلة، إعادة التعيين، أو إعادة الاتصال. لا تمسح العدادات حتى يتم تخزين هذه الأدلة خارج المصفوفة.
لا تبدأ إعادة البناء لمجرد التحقق مما إذا كان القرص سينخفض مرة أخرى. إعادة البناء تزيد من عمليات الإدخال/الإخراج المستمرة عبر الأعضاء الباقين ويمكن أن تخفي ما إذا كانت المشكلة الأولى من القرص، مسار الاتصال الخاص به، أو مكون وحدة تحكم مشترك.
طابق التنبيه مع قرص فعلي، وليس فقط رقم الحاوية
قد يعرض برنامج RAID اسم جهاز نظام التشغيل، فتحة وحدة التحكم، عنوان الحاوية، أو رقم العضو الافتراضي. هذه التسميات ليست دائمة دائمًا، لذا فإن الهوية الأكثر أمانًا هي الرقم التسلسلي للقرص أو WWN المطابق للدرج الفعلي.
يوصي دليل استكشاف الأخطاء العملي بتسجيل الرقم التسلسلي للقرص لأن معرفات الأجهزة قد تتغير. أنشئ خريطة صغيرة تحتوي على عضو RAID، جهاز نظام التشغيل، الرقم التسلسلي أو WWN، الحاوية، منفذ وحدة التحكم، وطابع وقت التنبيه.
استخدم مؤشر LED لتحديد الموقع فقط كمساعدة للتأكيد. قبل إزالة أي شيء، قارن الرقم التسلسلي المعروض مع الملصق على الدرج أو القرص. سحب عضو سليم خاطئ يمكن أن يحول مصفوفة متدهورة قابلة للاسترداد إلى فشل متعدد الأقراص.
افصل أخطاء وسائط القرص عن أخطاء الاتصال
تشير أدلة وسائط القرص إلى الداخل، نحو الأقراص الدوارة، الفلاش، الرؤوس، أو إلكترونيات القرص. القطاعات المعاد تخصيصها، الأخطاء التي لا يمكن تصحيحها المبلغ عنها، القطاعات المعلقة الحالية، والقطاعات غير القابلة للإصلاح في وضع عدم الاتصال هي من بين خمسة مؤشرات SMART التي تستخدمها Backblaze عند تحديد محركات الأقراص التي تحتاج إلى تحقيق.
ابحث عن التغيرات مع مرور الوقت بدلاً من اعتبار كل قيمة خام غير صفرية حكمًا نهائيًا. زيادة عداد الوسائط، أخطاء قراءة متكررة في مواقع مماثلة، أو فشل اختبار ذاتي موسع يجعل القرص نفسه أكثر اشتباهًا. حالة SMART العامة "ناجح" لا تستبعد وجود عطل متقطع أو متطور.
تشير أدلة الاتصال إلى الخارج، نحو المسار بين القرص والمتحكم. أخطاء UDMA CRC تحصي عمليات النقل الفاشلة على وصلة SATA؛ زيادة العد قد تشير إلى كابل، موصل، لوحة خلفية، واجهة متحكم، أو مسار لوحة الدوائر المطبوعة للقرص بدلاً من تلف الوسائط.
استخدم السجلات للعثور على الطبقة الفاشلة
تُظهر بيانات SMART ما سجله القرص، بينما تُظهر سجلات النظام والمتحكم كيف فقدت طبقة التخزين الاتصال. فصل أخطاء الوسائط أو القراءة عن مهلات الأوامر، إعادة تعيين الروابط، إزالة الأجهزة، إعادة الاتصال، أحداث الطاقة، وإعادة تعيين المتحكم.
رقم تسلسلي واحد يبلغ عن أخطاء في الوسائط أينما تم توصيله يشير إلى عطل في القرص. عدة أقراص تسقط من حجرات تشترك في كابل واحد، موصل لوحة خلفية، مجموعة منافذ HBA، أو فرع طاقة يشير إلى مسار مشترك. العطل الذي يظهر فقط أثناء عمليات الإدخال/الإخراج الثقيلة قد يكشف عن اتصال هامشي أو مشكلة طاقة لا تكشفها الفحوصات أثناء الخمول.
ابنِ جدولًا زمنيًا بدلاً من قراءة رسائل معزولة. طابق كل انقطاع مع نفس الرقم التسلسلي، الحجرة، عبء العمل، وقناة المتحكم. السؤال المفيد ليس ما إذا كانت رسالة السجل تبدو خطيرة؛ بل ما إذا كان نفس المكون مشتركًا عبر الحوادث المتكررة.
أعد تركيب المسار قبل تبديل الحجرات
أوقف المصفوفة وأغلق الطاقة ما لم يكن الهيكل ومنصة RAID يدعمان صراحةً إجراء التبديل الساخن الذي تخطط له. وجود حجرة تدعم التبديل الساخن لا يجعل التحركات الموضعية أو التبديلات التشخيصية آمنة تلقائيًا أثناء نشاط المصفوفة.
أعد تركيب القرص في الحامل الخاص به، ثم افحص مسار البيانات والطاقة الذي يخدم الحجرة. اعتمادًا على النظام، قد يشمل هذا المسار موصل SATA أو SAS، كابل تفريع، مقبس اللوحة الخلفية، HBA، بطاقة RAID، حزمة الطاقة، واتصال الحاوية. ابحث عن تركيب غير محكم، أقفال تالفة، حطام، اتصالات مثنية، توتر الكابل، أو موصل مشترك يخدم عدة حجرات متأثرة.
بعد إعادة تركيب القرص، قم بتسجيل خط أساس جديد لأخطاء CRC، مهلات الاتصال، وعدادات الوسائط. أعد إنتاج عبء العمل الأصلي باستخدام قراءة محكومة أو عبء خدمة عادي قبل بدء إعادة البناء. إذا توقفت عدادات الاتصال عن الزيادة وبقي القرص موجودًا، فقد يكون الحدث الأصلي مشكلة اتصال عابرة.
قم بتشغيل اختبار عزل محكم للقرص والحاوية
الاختبار الحاسم يغير متغيرًا واحدًا مع الحفاظ على هوية القرص وسلامة المصفوفة. لا تفترض أن كل تنفيذ RAID يمكنه قبول الأعضاء في فتحات مختلفة. تحقق أولاً من سلوك الاستبدال أو الاستيراد للمنصة، احتفظ بخريطة السيريال مرئية، واستخدم إجراء إيقاف التشغيل عند عدم اليقين.
- تحقق من أن النسخة الاحتياطية والتشخيصات المحفوظة قابلة للقراءة.
- ضع علامة على القرص المشتبه به، حاويته الأصلية، والمسار المعروف الجيد الذي ستستخدمه.
- انقل القرص المشتبه به إلى حاوية أو مسار كابل معروف جيدًا، أو اربطه بوحدة تحكم تشخيصية منفصلة دون الكتابة عليه.
- اختبر الحاوية المشتبه بها بقرص احتياطي أو معروف جيدًا فقط عندما يمكن القيام بذلك دون الانضمام، التهيئة، التنسيق، أو إعادة بناء المصفوفة.
- قم بتشغيل نفس عبء العمل المقروء المسيطر وقارن فقط الأحداث الجديدة في السجل وزيادات العدادات.
تحليل إعادة تعيين رابط SATA مستقل يستخدم نفس المبدأ: نقل نفس القرص إلى حاوية أو مسار كابل مختلف ومراقبة ما إذا كان العطل يتبع الجهاز أو يبقى مع الاتصال الأصلي.
تفسير ما إذا كان الخطأ يتبع القرص أو يبقى مع الحاوية
استخدم كلا الجزأين من الاختبار عندما يكون ذلك ممكنًا. تحريك القرص المشتبه به فقط يمكن أن يُظهر أنه يفشل في مكان آخر، لكن اختبار الحاوية الأصلية بقرص آخر هو ما يؤكد ما إذا كانت الفتحة أو المسار المشترك يمكن أن يعيد إنتاج المشكلة.
| النتيجة الملحوظة | الطبقة الأكثر احتمالاً | الإجراء التالي |
|---|---|---|
| يفشل القرص المشتبه به في حاوية معروفة جيدة، بينما يظل قرص آخر مستقرًا في الحاوية الأصلية | وسائط القرص، إلكترونيات القرص، أو برنامج تشغيل القرص | أكمل التشخيص غير المدمر، ثم استبدل القرص إذا تكررت الأخطاء أو فشل الاختبار الموسع |
| القرص المشتبه به مستقر في مكان آخر، بينما يفشل قرص آخر في الحاوية الأصلية | موصل الحاوية، اتصال العلبة، الكابل، اللوحة الخلفية، منفذ وحدة التحكم، أو مسار الطاقة | توقف عن استخدام ذلك المسار حتى يتم إصلاح أو استبدال الأجهزة المشتركة |
| تُظهر عدة حاويات على نفس الموصل أو مجموعة HBA إعادة تعيينات | كابل مشترك، موصل اللوحة الخلفية، وحدة التحكم، التبريد، أو توزيع الطاقة | تتبع المكون المشترك وأعد الاختبار بعد تغيير جزء مشترك واحد |
| لا تعود أخطاء بعد إعادة التثبيت، وجميع العدادات الجديدة تظل مستقرة | اتصال عابر أو هامشي | استمر في المراقبة تحت عبء العمل الذي تسبب في الانخفاض أصلاً |
| يُظهر القرص أخطاء في الوسائط ويُسبب الحاوية أيضًا أخطاء في الاتصال مع قرص آخر | أكثر من عطل واحد | لا تُجبر على تشخيص سبب واحد فقط؛ عزل القرص وإصلاح المسار بشكل منفصل |
لا تعامل تمهيدًا نظيفًا واحدًا كدليل. كرر الملاحظة تحت عبء عمل مماثل وراقب فروق العدادات، وليس الإجماليات فقط. إذا تبعت أخطاء الوسائط الرقم التسلسلي، استبدل القرص. إذا بقيت فشل الروابط مرتبطة بالفتحة أو مجموعة الموصلات، أصلح ذلك المسار قبل إعادة البناء.
اختر الإصلاح الصحيح وحالة التوقف
عندما تتبع الأدلة القرص، تحقق من الأعضاء الآخرين في المصفوفة، استبدل العضو الفاشل عبر سير العمل المدعوم من المنصة، وراقب إعادة البناء. اختر قرص استبدال NAS متوافق بناءً على السعة، الواجهة، عبء العمل، ومتطلبات المصفوفة بدلاً من العلامة التجارية فقط.
عندما تبقى الأدلة مع الفتحة، لا تضع قرصًا جديدًا في مسار ينتج إعادة تعيين بالفعل. قم بتعطيل الفتحة إذا سمحت المنصة، ثم أصلح أو استبدل الحامل، الكابل، اللوحة الخلفية، قناة وحدة التحكم، اتصال الحاوية، أو فرع الطاقة الذي حددته اختبار العزل.
توقف وارتقِ عندما يختفي عدة أعضاء، تصبح المصفوفة غير قابلة للقراءة، تبدأ الأخطاء أثناء إعادة البناء، هوية القرص غير مؤكدة، أو لا توجد نسخة احتياطية مؤكدة. لا تهيئ، لا تفرمت، لا تمسح بيانات أجنبية، ولا تجبر على استيراد عضو مرارًا فقط لجعل التحذير يختفي.
الأسئلة الشائعة
هل يمكن للقرص أن يجتاز SMART ويظل السبب؟
نعم. SMART دليل مفيد، لكنه ليس ضمانًا كاملاً. يمكن للإلكترونيات المتقطعة، سلوك البرنامج الثابت، انتهاء مهلة الأوامر، أو الأخطاء غير الممثلة بسمات البائع أن تجعل القرص غير موثوق. اجمع بين اتجاهات SMART والسجلات، الاختبارات الموسعة، وما إذا كان الخطأ يتبع الرقم التسلسلي.
هل يثبت عد CRC غير الصفري أن الفتحة سيئة؟
لا. قد يسجل العداد حدث كابل أو اتصال أقدم ويمكن أن يبقى غير صفري بعد إصلاح السبب. المهم هو ما إذا كانت القيمة تزداد بعد إعادة التثبيت وما إذا كانت الزيادة تتبع القرص، مسار الكابل، مجموعة الفتحات، أو وحدة التحكم.
هل يمكنني تبديل الأقراص ساخنًا فقط لتشخيص الفتحة؟
فقط عندما يكون الحاوية، وحدة التحكم، تنفيذ RAID، والإجراء الدقيق موثقين كآمنين للتبديل الساخن. قاعدة عامة أكثر أمانًا هي إيقاف المصفوفة، إيقاف التشغيل، حفظ خريطة الرقم التسلسلي إلى الفتحة، وتجنب أي حركة قد تؤدي إلى التهيئة أو إعادة بناء غير مقصودة.
هل يجب أن أعيد البناء قبل الانتهاء من التشخيص؟
ليس عندما يكون من الممكن أن يكون هناك مشكلة في كابل مشترك، لوحة خلفية، وحدة تحكم، أو مصدر طاقة. إعادة البناء تضغط على المسار المتبقي وقد تؤدي إلى فقدان عضو آخر. قم بتأمين نسخة احتياطية، حدد الطبقة الفاشلة، أكد الأقراص الناجية، ثم أعد البناء عبر اتصال مستقر.
السبب الحقيقي هو المكون الذي يعيد إنتاج الخطأ تحت اختبار مراقب. اتبع الرقم التسلسلي، الفتحة، العدادات، والسجلات — وليس الأيقونة الحمراء الأولى — وقم بإصلاح الطبقة الفاشلة قبل الوثوق بإعادة البناء.
الدعم والنصائح
المزيد للقراءة

لماذا يصبح مصفوف RAID غير نشط بعد انقطاع التيار الكهربائي؟
غالبًا ما تعني المصفوفة غير النشطة أنه تم العثور على بيانات وصفية ولكن النظام لم يكن لديه ثقة كافية أو أعضاء كافون لبدء تشغيلها...

ما هي مخاطر إجبار عضو RAID المفقود على العودة عبر الإنترنت؟
يمكن لخيارات الإكراه تجاوز فحوصات الأمان المتعلقة بالبيانات الوصفية القديمة، التماثل القذر، الكتابات المفقودة، أو المجموعات النشطة؛ قم بفحص الأدلة وحفظها قبل استخدامها.

كيفية التمييز بين كابل SATA التالف ومحرك NAS المعطل
تتبع ما إذا كانت الأخطاء تتبع القرص أو تبقى مع مسار SATA، وفصل عدادات النقل عن أدلة صحة الوسائط قبل استبدال الأجهزة.
