スクラブは、実行間でエラー数が増加したり、同じデバイスで修復が繰り返されたり、以前は正常だったデータが修復不能になると、新たな損傷を検出します。単一の修復済みブロックがあるだけでは、悪化するパターンとは言えません。
最も安全な解釈は、完了したスクラブレポート、ドライブレベルのエラー、影響を受けたファイルを比較することであり、単一の警告的な数値に反応することではありません。このガイドは、正常な修正と蓄積する損傷を区別し、いつ定期メンテナンスを中止してデータ保護を優先すべきかを示します。
エラー数の増加が最も明確な警告
最も重要な比較は、スクラブでエラーが報告されるかどうかではなく、次に完了したスクラブでチェックサム、パリティ、メディア、または修復不能なエラーが増えているかどうかです。修復後に数値が安定している場合は過去の事象を反映している可能性があります。数値が増加している場合は、ストレージ経路で依然として不良な読み取りや不良データが発生していることを意味します。
各実行後に開始時間、完了時間、修復バイト数、修復不能数、およびデバイスごとの読み取り、書き込み、チェックサムカウンターを記録してください。スクラブとサイレントコリュプションの実用的な説明は、通常のワークロードが数か月間触れていない損傷をフルリードで露呈できる理由を示しています。
同じディスクでの繰り返し修復は注意が必要
冗長なファイルシステムは、別のコピーから損傷したブロックを修復してもプールをオンラインのままにできます。警告は、後のスクラブで同じ物理ディスク上の新しいブロックを修復し、かつそのディスクが保留中、再割り当て済み、または修復不能なセクターを蓄積している場合に現れます。
カウンターをクリアしてイベントを忘れないでください。まずディスクのシリアル番号、SMARTスナップショット、スクラブ結果を保存します。その後、アレイが冗長かつ応答可能な場合に限り、長時間のドライブ自己診断を実行してください。繰り返される修正は、ファイルシステムが原因を解決した証拠ではなく、メンバー、ケーブル、ベイ、電源経路、コントローラーの調査が必要な証拠です。
修復不能なファイルは優先度を変える
修復不能な結果は、少なくとも1つのブロックで冗長性が検証済みコピーを生成できなかったことを意味します。その時点で、次のスクラブを自動的に実行するのは適切ではありません。名前付きファイルを特定し、読み取り可能な重要データを別の場所にコピーし、トポロジー変更前にログを保存してください。
実例の修復不能データを含むスクラブは、修正されたメタデータとバックアップから復元しなければならなかったファイルの違いを示しています。重要なのは大きな生のエラー総数だけでなく、クリーンなフォローアップ実行が新たなエラーゼロで完了できるかどうかです。
同じ論理領域での再発は正常ではない
同じストライプ、ブロック範囲、またはファイルで繰り返されるエラーは、持続的に読み取り不能な領域や破損したパリティ状態を示す可能性があります。エラーが移動する場合は、より広範なメディア劣化、不安定なメモリ、リンク問題、電源不安定を示すことがあります。プラットフォームが正確なオフセットを示す場合は保存してください。
最初に影響を受けた範囲を理解せずに、何百万ものエラーに対して繰り返し修復を強制しないでください。大きなパリティエラーのクラスターは、1回のI/O障害に起因し、その後の比較を汚染することがあるため、最初の不良位置とそれに先行するイベントが重要です。
スクラブ中の新たなリンクやI/Oエラーは重要
スクラブは持続的な読み取りを行い、限界的なケーブル、バックプレーン、電源コネクター、USBブリッジ、コントローラーパスを露呈することがあります。スクラブ実行中はシステムログを監視してください。リンクリセット、コマンドタイムアウト、デバイス切断、CRCエラーは、単なる遅い進行率よりも強い警告です。
通信エラーが増加してもメディアセクター指標が安定している場合は、ディスクをすぐに非難せず、一度に1つの接続を再装着または交換し、シリアル番号とベイのマップを保存し、エラーベースラインをリセットして制御された読み取りを繰り返してください。経路に残る障害はドライブに追従する障害とは異なる修理が必要です。
完了できないスクラブも結果の一つ
スクラブが繰り返し同じ付近で一時停止、再起動、停止する場合、それは単に時間がかかっているわけではありません。まずスケジュールされたジョブ、シャットダウン、別のリシルバーが中断していないか確認してください。その後、停止ポイントをデバイスログやディスクごとの遅延と照合します。
スケジュールされたプロセスは、実行時間とスループットの安定したベースラインを持つべきです。スクラブ出力の解釈に関するガイダンスは、進行状況、修復バイト数、最終ステータスを一緒に読む必要があるため有用であり、経過時間だけでは損傷を判断できません。
判断前にトレンド表を使う
短期間の履歴では、一度のノイジーな実行でリスクの高い交換を決めてしまうことを防げます。以下の観察項目は、少なくとも最後の正常な実行と最初のエラー以降のすべての実行で記録してください。
| 観察項目 | 通常の監視 | 今すぐエスカレーション |
|---|---|---|
| 修復済みブロック | 1回のイベント、次のスクラブは正常 | 後のスクラブで新たな修復 |
| 修復不能データ | なし | 名前付きファイルまたは恒久的なエラーあり |
| デバイスカウンター | リセット後安定 | 読み取り/書き込み/チェックサムカウントが増加し続ける |
| システムログ | リセットやタイムアウトなし | 繰り返される切断、リセット、I/O障害 |
| 完了状況 | 正常なベースライン付近で完了 | 繰り返し同じ範囲で停止 |
2つ以上のエスカレーション信号が同時に現れた場合は、書き込みを減らし、バックアップを確認し、影響を受けたハードウェア経路を診断してから、再度フルスクラブを開始してください。
よくある質問
修復済みスクラブ後にエラーカウンターをクリアすべきですか?
レポートを保存し物理ディスクを特定した後にのみクリアしてください。クリアされたベースラインは再発検出に役立ちますが、先にクリアすると損傷が新しいかどうかを判断する比較が失われます。
チェックサムエラーが1つだけでドライブ交換が必要ですか?
単独では必要ありません。1つの修正済みエラーはメディア、メモリ、ケーブル、または以前の中断が原因のことがあります。経路を確認した後、同じシリアル番号のディスクで新たなエラーが続く場合に交換がより正当化されます。
重いアプリケーショントラフィックでチェックサム損傷が起きますか?
重いトラフィックはスクラブを遅くし弱いハードウェアを露呈することはありますが、正当なワークロードが検証済みの内容不一致を作ることはありません。新たなチェックサムエラーはストレージの整合性イベントとして扱い、通常のパフォーマンスの副作用とは見なさないでください。
判断の境界線
完了した実行間でエラーが増加し、修復が1つのメンバーで繰り返され、修復不能なファイルが現れ、同じハードウェア経路が繰り返しリセットされる場合は、スクラブ結果を悪化する損傷と見なしてください。繰り返しの負荷をかける前にデータを保護してください。
サポートとヒント
もっと読む

なぜRAIDアレイは停電後に非アクティブになるのですか?
非アクティブなアレイは、多くの場合、メタデータは見つかったものの、システムが不正なシャットダウン後に安全に起動するための十分な信頼性やメンバーを持っていなかったことを意味します。

RAIDの欠落メンバーを無理にオンラインに戻すリスクとは何ですか?
強制オプションは、古いメタデータ、未処理のパリティ、書き込み漏れ、またはアクティブなプールに関する安全チェックを回避できます。使用する前に証拠を確認し、保存してください。

故障しているSATAケーブルと故障しつつあるNASドライブの見分け方
エラーがディスクに起因するかSATA経路に起因するかを追跡し、ハードウェアを交換する前にトランスポートカウンターをメディアの健康状態の証拠から分離してください。

