ドロップしたRAIDディスクと故障したドライブベイのどちらが本当の原因かを見分ける方法

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

RAIDメンバーがドロップしたからといって、ディスクが故障したとは限りません。真の原因は、制御されたチェックと電源オフの交換後にエラーが続くコンポーネントです。

まずアレイの状態を保存し、ドライブのシリアル番号とベイを記録し、SMARTメディア属性と接続エラーを比較し、コントローラーログを読みます。その後、ハードウェアの変数は一度に一つだけ変更してください。この方法は、正常なディスクの交換や故障したベイを通じたリビルドを避けるのに役立ちます。

リビルドや別のディスクの取り外しを始める前に停止する

劣化したアレイは、さらなるミスや故障の余地が少なくなっています。読み取り可能な別のバックアップにかけがえのないデータが存在することを確認し、現在のストレージ状態を保存し、ハードウェアを変更する前に不要な書き込みを減らしてください。

RAIDの状態、物理ディスクリスト、SMARTレポート、コントローライベントのスクリーンショットやエクスポートを取得してください。アラート時間、影響を受けた論理メンバー、報告されたベイ、モデル、シリアル番号、およびメディア、タイムアウト、リセット、再接続カウンターを記録してください。証拠がアレイ外に保存されるまでカウンターをクリアしないでください。

ディスクが再度ドロップするかどうかを確認するためだけにリビルドを開始しないでください。リビルドは生き残っているメンバー間の持続的なI/Oを増加させ、最初の問題がディスク、接続経路、または共有コントローラコンポーネントのどれから来たのかを隠す可能性があります。

アラートを物理ドライブに一致させ、単なるベイ番号だけに頼らない

RAIDソフトウェアは、オペレーティングシステムのデバイス名、コントローラスロット、エンクロージャアドレス、または仮想メンバー番号を表示することがあります。これらのラベルは常に固定されているわけではないため、最も安全な識別は物理トレイに対応したディスクのシリアル番号またはWWNです。

実用的なトラブルシューティングガイドでは、デバイス識別子が変わる可能性があるため、ドライブのシリアル番号を記録することを推奨しています。RAIDメンバー、OSデバイス、シリアルまたはWWN、ベイ、コントローラーポート、アラートのタイムスタンプを含む小さなマップを作成してください。

ロケートLEDは確認補助としてのみ使用してください。何かを取り外す前に、表示されているシリアル番号とトレイまたはドライブのラベルを比較してください。誤った正常なメンバーを引き抜くと、回復可能な劣化アレイが複数ディスクの故障に変わる可能性があります。

ドライブメディアのエラーとリンクエラーを区別する

ドライブメディアの証拠は、プラッター、フラッシュ、ヘッド、またはドライブの電子部品に向かっています。再割り当てセクター、報告された修正不能エラー、現在保留中のセクター、およびオフラインの修正不能セクターは、Backblazeが調査が必要なハードドライブを判断する際に使用する5つのSMART指標の一部です。

すべての非ゼロの生値を判定とみなすのではなく、時間経過による変化を探してください。増加するメディアカウント、類似位置での繰り返し読み取りエラー、または失敗した拡張自己診断はディスク自体の疑いを強めます。全体的なSMARTステータスが「合格」であっても、一時的または進行中の故障を否定するものではありません。

接続の証拠はディスクとコントローラ間の経路に向かっています。UDMA CRCエラーはSATAリンク上の転送失敗をカウントします。増加するカウントは、ケーブル、コネクター、バックプレーン、コントローラインターフェース、またはドライブPCB経路の問題を示す可能性があり、メディアの損傷ではありません。

ログを使って故障層を特定します。

SMARTデータはドライブが記録した内容を示し、システムおよびコントローラログはストレージスタックがどのように接触を失ったかを示します。メディアまたは読み取りエラーをコマンドタイムアウト、リンクリセット、デバイスの取り外し、再接続、電源イベント、およびコントローラリセットから区別してください。

接続されている場所に関係なくメディアエラーを報告する単一のシリアル番号はディスクの故障を示唆します。1本のケーブル、バックプレーンコネクター、HBAポートグループ、または電源分岐を共有するベイから複数のディスクが切断される場合は共有経路の問題が疑われます。重いI/O時にのみ発生する故障は、アイドル時のチェックでは見逃される境界的な接続や電源問題を露呈することがあります。

孤立したメッセージを読むのではなく、タイムラインを作成してください。各ドロップを同じシリアル、ベイ、ワークロード、およびコントローラチャネルに一致させます。重要な質問は、ログ行が深刻に聞こえるかどうかではなく、同じコンポーネントが繰り返されるインシデントで共通しているかどうかです。

ベイを交換する前に経路を再装着してください。

シャーシとRAIDプラットフォームが計画している正確なホットスワップ操作を明示的にサポートしていない限り、アレイを停止して電源を切ってください。ホットスワップ対応のベイであっても、アレイがアクティブな間に位置の移動や診断的な交換が自動的に安全になるわけではありません。

ドライブをキャディに再装着し、次にベイに供給されるデータおよび電源経路を点検します。システムによっては、その経路にSATAまたはSASコネクター、ブレイクアウトケーブル、バックプレーンソケット、HBA、RAIDカード、電源ハーネス、およびエンクロージャ接続が含まれる場合があります。緩んだ装着、損傷したラッチ、異物、曲がった接点、ケーブルの張り、または複数の影響を受けたベイに供給される共有コネクターを探してください。

再装着後、CRC、タイムアウト、およびメディアカウンターの新しいベースラインを記録します。リビルドを開始する前に、制御された読み取りまたは通常のサービス負荷で元のワークロードを再現してください。接続カウンターの増加が止まり、ディスクが存在し続ける場合、元のイベントは一時的な接触問題であった可能性があります。

制御されたドライブとベイの分離テストを実行する

決定的なテストは、ディスクの識別とアレイの安全性を保ちながら一つの変数を変更します。すべてのRAID実装が異なるスロットのメンバーを受け入れられるとは限らないため、プラットフォームの交換またはインポート動作を最初に確認し、シリアルマップを表示したままにし、不確かな場合は電源オフの手順を使用してください。

  1. バックアップと保存された診断情報が読み取り可能であることを確認します。
  2. 疑わしいディスク、その元のベイ、および使用する良好なパスにラベルを付けます。
  3. 疑わしいディスクを良好なベイまたはケーブルパスに移動するか、書き込みを行わずに別の診断コントローラに接続します。
  4. アレイの結合、初期化、フォーマット、または再構築を伴わずに行える場合に限り、疑わしいベイを予備または良好なディスクでテストします。
  5. 同じ制御された読み取りワークロードを実行し、新しいログイベントとカウンターの増加のみを比較します。

独立したSATAリンクリセット分析は同じ原理を使用します:同じディスクを別のベイまたはケーブルパスに移動し、故障がデバイスに従うか元の接続に留まるかを観察します。

エラーがディスクに従うかベイに留まるかを解釈する

可能な場合はテストの両方の側面を使用してください。疑わしいディスクだけを移動すると他の場所で故障することが示されますが、別のディスクで元のベイをテストすることで、スロットまたは共有パスが問題を再現できるかどうかが確認されます。

観察された結果 最も可能性の高い層 次のアクション
疑わしいディスクが良好なベイで故障し、別のディスクが元のベイで安定している ディスクメディア、ドライブ電子部品、またはドライブファームウェア 非破壊診断を完了し、エラーが繰り返すか拡張テストに失敗した場合はディスクを交換する
疑わしいディスクは他の場所で安定しているが、別のディスクが元のベイで故障している ベイコネクタ、キャディ接点、ケーブル、バックプレーン、コントローラポート、または電源パス 共有ハードウェアが修理または交換されるまで、そのパスの使用を停止する
同じコネクタまたはHBAグループの複数のベイでリセットが発生している 共有ケーブル、バックプレーンコネクタ、コントローラ、冷却、または電源分配 共通コンポーネントを追跡し、共有部品の一つを交換して再テストする
再装着後にエラーが戻らず、すべての新しいカウンターが安定している 一時的または境界的な接続 ドロップを最初に引き起こしたワークロード下で監視を続ける
ディスクにメディアエラーがあり、ベイも別のドライブとリンクエラーを引き起こしている 複数の故障 単一原因の診断を強制せず、ディスクを分離してパスを個別に修復してください

一度の正常起動を証拠とみなさないでください。同等の負荷で観察を繰り返し、合計だけでなくカウンターの差分を監視してください。メディアエラーがシリアル番号に従う場合はディスクを交換し、リンク障害がベイやコネクターグループに関連している場合は再構築前にその経路を修理してください。

適切な修理と停止条件を選択する

証拠がディスクに従う場合は、他のアレイメンバーを検証し、プラットフォームのサポートされたワークフローを通じて故障したメンバーを交換し、再構築を監視してください。ブランドだけでなく、容量、インターフェース、ワークロード、アレイの要件に基づいてNAS交換用ドライブを選択してください。

証拠がベイにある場合、リセットを引き起こしている経路に新しいディスクを挿入しないでください。プラットフォームが許す場合はベイを無効にし、分離テストで特定されたキャディ、ケーブル、バックプレーン、コントローラーチャンネル、エンクロージャー接続、または電源系統を修理または交換してください。

複数のメンバーが消失した場合、アレイが読み取れなくなった場合、再構築中にエラーが発生し始めた場合、ディスクの識別が不確かである場合、または検証済みのバックアップが存在しない場合は停止してエスカレーションしてください。警告を消すためだけに初期化、フォーマット、外部メタデータのクリア、またはメンバーの強制インポートを繰り返さないでください。

よくある質問

ドライブがSMARTを通過しても原因である可能性はありますか?

はい。SMARTは有用な証拠ですが完全な保証ではありません。断続的な電子部品の問題、ファームウェアの挙動、コマンドのタイムアウト、またはベンダーの属性に表れない障害がドライブを信頼できなくすることがあります。SMARTの傾向をログや拡張テスト、エラーがシリアル番号に従うかどうかと組み合わせて判断してください。

ゼロでないCRCカウントはベイが故障している証拠ですか?

できません。カウントは古いケーブルや接続イベントを記録している場合があり、原因が修正された後もゼロでないままでいることがあります。重要なのは、再装着後に値が増加するかどうか、そしてその増加がディスク、ケーブル経路、ベイグループ、またはコントローラーに従うかどうかです。

ベイの診断だけのためにドライブをホットスワップできますか?

エンクロージャー、コントローラー、RAIDの実装、および正確な操作がホットスワップ対応として文書化されている場合のみです。より安全な一般的ルールは、アレイを停止し、シャットダウンし、シリアル番号とベイのマップを保存し、初期化や意図しない再構築を引き起こす可能性のある操作を避けることです。

診断を終える前に再構築すべきですか?

共有ケーブル、バックプレーン、コントローラー、または電源の問題がまだ考えられる場合は再構築しないでください。再構築は残りの経路に負荷をかけ、別のメンバーが落ちる可能性があります。バックアップを確保し、故障しているレイヤーを特定し、生存しているディスクを確認してから、安定した接続を通じて再構築してください。

真の原因は、制御されたテスト環境で障害を再現するコンポーネントです。最初の赤いアイコンではなく、シリアル番号、ベイ、カウンター、ログを追跡し、再構築を信頼する前に故障しているレイヤーを修理してください。

サポートとヒント

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.