NASの再構築中にI/Oエラーが増え続ける場合は、書き込みを減らし、生存メンバーまたは接続パスを不安定と見なしてください。進行率が上がっていても、増加する読み取り失敗を無視して安全とは言えません。
直近の目標は読み取り可能なデータを保護し、エラーがメディアの故障、リンクのリセット、または不良ターゲットのどれであるかを特定することです。ログとシリアルを保存し、バックアップ状況を確認し、ソースセットが劣化している間に再構築を繰り返し再起動するのは避けてください。
増加するエラーは進行バーを上書きする
再構築の進行率はターゲットのどれだけが処理されたかを示しますが、すべてのソース読み取りが成功したかどうかは示しません。定期的に累積の読み取り、書き込み、チェックサム、メディア、およびコマンドタイムアウトのカウンターを比較してください。
再構築が進行しながらエラーも増加している場合、アレイはほとんどのブロックを再構築しているが特定の領域で失敗している可能性があります。RAIDレベルにそのブロックの残りのコピーがない場合、1回の失敗したソース読み取りは何千回もの成功よりも重要です。
どのデバイスがエラーを発生させているかを特定する
すべてのログ識別子を物理的なシリアル番号にマッピングします。エラーが古い生存メンバー、新しいターゲット、または共有コントローラーパスのどこから発生しているかを特定します。ターゲットの書き込みエラーとソースの読み取りエラーでは異なる判断が必要です。
ドライブの健康状態データは調査の優先順位付けに役立ちます。Backblazeの5つのSMART警告属性の運用では、単一の全体的な健康ラベルに頼るのではなく、再割り当て済み、修正不可能、タイムアウト、保留中、およびオフライン修正不可能の指標に注目しています。
メディアエラーとリンクエラーを区別する
保留中または修正不可能なセクターは、読み取り不能なメディアを示しています。UDMA CRCの増加、トランスポートのリセット、および繰り返される切断は、ケーブル、バックプレーン、ブリッジ、電源、またはコントローラーパスの問題を示すことが多いです。どちらも再構築を中断させる可能性がありますが、ディスクを交換しても共有リンクの問題は解決しません。
UDMA CRCエラー数の説明は、インターフェース転送エラーとプラッタ損傷を区別します。生のカウントを保存し、接続の変数を1つ修正し、カウンターが増加し続けるかどうかを確認してください。
故障している再構築を繰り返し再起動しないでください
完全な再起動ごとに生存メンバーを再読み取りし、同じ弱い領域に負荷をかける可能性があり、より良い結果は得られません。操作が同じアドレス付近で繰り返し中断したり、2台目のドライブが落ちたりする場合は、通常の修復試行を停止してください。
ソースエラーによって再構築がブロックされることは中心的な限界を示します:唯一の良好なソースに回復不能な読み取りエラーがある場合、アレイは欠損データを取得する他の場所がありません。強制オプションでは未知の内容を再現できません。
継続、コピー、イメージングの選択
| 状態 | 推奨方向 | 理由 |
|---|---|---|
| エラーは安定、再構築は進行中 | 負荷を減らして監視 | リカバリーは正常に完了する可能性あり |
| リンクエラーは増加、メディアは安定 | ケーブル/ベイ/コントローラーパスを安定化 | 障害はドライブ外にある可能性 |
| ソースメディアのエラーが増加 | まず重要な読み取り可能データをコピー | 残りの冗長性が弱まっている |
| 同じ範囲で繰り返し中断 | 無謀な再構築の再試行を停止 | 持続的な読み取り不能領域 |
| セカンドメンバーが切断または故障 | イメージング/リカバリーワークフローを検討してください | アレイがフォールトトレランスを超えている可能性があります |
データが代替不可能でバックアップが検証されていない場合、読み取り可能なメンバーのイメージングは、別の自動再構築を許可するよりも安全です。リカバリー指向の再構築中のセカンドドライブ障害ワークフローは、生存セットが不安定な場合に書き込み負荷の高い修復試行を停止することを強調します。
インシデントを隠さずにフォアグラウンドの作業を減らす
バックアップ、メディアのインデックス作成、ダウンロード、仮想マシン、その他の不要な書き込みを停止します。重要なデータのコピーやアレイの監視に必要なサービスのみを維持してください。負荷を下げることでキューイングが減り、エラーのタイミングを解釈しやすくなります。
証拠を取得する前にログを消去したり、SMARTカウンターをリセットしたり、繰り返し再起動したりしないでください。再起動はデバイス名を変更し、どのメンバーが最初に故障したかを示す順序を消去する可能性があります。
電源を切る前に取得すべきもの
- アレイの状態、RAIDレベル、メンバーの役割、再構築ターゲット、および正確な進行カウンター
- すべてのディスクモデル、シリアル番号、ベイ、コントローラーポート、および現在のデバイス識別子
- 最初の故障から最新のI/Oエラーまでのカーネルまたはコントローラーのイベント
- SMARTの生データ、タイムアウト、温度、インターフェースエラーの値
- 読み取り不能なファイルやブロック範囲のリストと最新の検証済みバックアップの状態
この記録は、どのメンバーに最新のデータが含まれているかを推測せずに、制御されたケーブルテスト、ディスク交換、クローン作成、または専門的な復旧をサポートします。
介入後は安定したフォローアップが必要です
ケーブル交換、確認済みシリアル番号のディスク移動、または負荷軽減後は、関連する比較基準のみをリセットし、再発を監視してください。一時的な改善は根本的な故障が解消された証拠ではありません。
アレイは回復を完了し、完全なメンバーシップに戻り、その後の整合性チェックに合格し、新たなI/Oエラーが発生しない状態であるべきです。これら3つの条件が通常の代表的な負荷下で満たされるまでは、インシデントを安全に開いたままにし、記録されたログを保持してください。
よくある質問
エラーが少数しか発生しない場合、再構築を完了させてもよいですか?
エラーの原因が理解されて安定しており、データがバックアップされている場合のみです。ソースの読み取りエラーの増加や繰り返しのリセットは、ターゲットの進行率が上昇していてもエスカレーションの信号です。
SMARTカウントが最も高いディスクを交換すべきですか?
自動的にはありません。エラーがそのシリアル番号のディスクに従っているか、またはそのベイと接続経路に残っているかを確認してください。劣化した状態で誤ったメンバーを交換すると、残りの有効なソースが破壊される可能性があります。
完了した再構築に損傷したファイルが含まれることはありますか?
はい。一部の実装では、回復不能なセクターや影響を受けたファイルを報告しながら完了することがあります。最終的なエラーレポートを必ず確認し、アレイが安定した状態に戻った後に整合性チェックを実行してください。
停止条件
再構築中にI/Oエラーが増加した場合は、完了を急ぐ前に読み取り可能なデータを保護してください。すべての残りのブロックを供給できるほどソースセットと接続経路が安定していることを確認してから続行します。
サポートとヒント
もっと読む

なぜRAIDアレイは停電後に非アクティブになるのですか?
非アクティブなアレイは、多くの場合、メタデータは見つかったものの、システムが不正なシャットダウン後に安全に起動するための十分な信頼性やメンバーを持っていなかったことを意味します。

RAIDの欠落メンバーを無理にオンラインに戻すリスクとは何ですか?
強制オプションは、古いメタデータ、未処理のパリティ、書き込み漏れ、またはアクティブなプールに関する安全チェックを回避できます。使用する前に証拠を確認し、保存してください。

故障しているSATAケーブルと故障しつつあるNASドライブの見分け方
エラーがディスクに起因するかSATA経路に起因するかを追跡し、ハードウェアを交換する前にトランスポートカウンターをメディアの健康状態の証拠から分離してください。

