不良なSATAケーブルはトランスポートエラーを引き起こし、故障しつつあるドライブはメディアエラーやデバイスエラーを発生させます。信頼できるテストは、どのエラータイプが増加し、それがどこに追従するかを追跡することです。
単一のSMARTステータスや一度の切断だけで診断しないでください。ディスクのシリアル番号、現在のカウンター、カーネルメッセージ、ベイ、ケーブル、コントローラーポートを記録し、パスの構成要素を一度に一つずつ変更してください。各制御された変更後のパターンは、元のエラー数よりも有用です。
何かを再装着する前にベースラインを取得する
ケーブルを交換する前に、影響を受けているドライブのシリアル番号、モデル、ベイ、コントローラーポート、SMART属性、セルフテストログ、エラーログ、最近のシステムメッセージを記録してください。再装着は症状を止めることがありますが、ドライブとパスの関係を消してしまうことがあります。
/dev/sdXのようなデバイス名は再起動やケーブルの移動で変わることがあるため、シリアル番号が安定した識別子です。ベースラインにタイムスタンプを付け、生のカウンター値を記録してください。複数のSMARTカウンターは累積的で、ケーブル交換後もゼロに戻らないことがあります。
アレイが劣化しているかエラーが増加している場合は、重い書き込みを一時停止してください。まず証拠を保存し、その後に一つずつ制御された変更を行ってください。ケーブル、ベイ、電源コネクタ、ドライブの交換を同時に行うと信頼できる診断はできません。
トランスポートエラーとメディアエラーを区別する
トランスポートエラーはコマンドやデータがSATAパスを通過する際に発生し、メディアエラーはドライブがセクターを信頼性を持って読み書きできない場合に発生します。両者は似たようなアプリケーションの症状を引き起こしますが、異なるハードウェアを示します。
LinuxのATAエラーモデルはATAバスエラーとメディアエラーを区別します。CRCや伝送失敗はパスに属し、リトライ後に報告される訂正不能な読み取りはデバイスメディアに属します。タイムアウトはあいまいな場合があるため、補助的なカウンターと制御された交換が必要です。
行動を起こす前に各ログエントリを分類してください。CRCやリンクリセットの増加はケーブル、コネクタ、バックプレーン、電源の安定性、コントローラーパスに注意を向けさせ、読み取り不能なセクターや失敗したセルフテストはドライブ自体の疑いを持続させます。
CRCおよびリンクカウンターが増加し続けるか監視する
ゼロでないCRCカウントはインターフェースエラーが発生したことを示しますが、過去の合計だけでは現在ケーブルが悪いとは証明できません。重要な信号は、既知のテスト期間中に生のカウントが増加するかどうかです。
ICRCはインターフェースCRCエラーを記録します。このカウンターはドライブに保存されるため、元のケーブルやホストが交換された後も表示されることがあり、過去のカウントを現在の故障とみなすのではなく、交換前後の値を比較してください。
データケーブルを再装着または交換した後に制御された読み取り負荷を実行し、新しいカウントを記録してください。CRCやリンクリセットイベントが停止し、メディア指標が安定している場合はパスが主な原因です。カウントが増加し続ける場合は、ベイ、ポート、電源接続の分離を続けてください。
セルフテストでドライブ側の故障を確認する
読み取り不能なセクター、保留中のセクター、再割り当て済みセクター、CRCに関連しない失敗したコマンド、または繰り返し発生する場所で停止するセルフテストが報告される場合、ドライブは疑わしいままです。これらはデバイスのメディアアクセス能力に関わる信号です。
SMARTのセルフテストとエラーログは、RAID層だけに依存せずデバイス側の証拠を保存するため有用です。SMARTセルフテストログは、生の属性やシステムログと合わせて解釈し、単一の「PASSED」行に単純化しないでください。
深刻に劣化したアレイや繰り返し読み取りエラーを返すドライブに対しては、過負荷になる拡張テストは実行しないでください。データが危険にさらされている場合は、バックアップやイメージングを優先し、その後に制御された負荷下で孤立したドライブをテストしてください。
パスの構成要素を一度に一つずつ交換する
最も明確な判別方法は、故障が物理ドライブに追従するか、SATAパスに留まるかです。テストごとに一つの構成要素だけを交換してください。最初にデータケーブル、次にベイやバックプレーンパス、最後にプラットフォームが安全に許す場合はコントローラーポートを交換します。
新しいエラーを比較する際は同じディスクシリアルとワークロードを維持してください。あるベイやケーブルでのみトランスポートカウンターが増加する場合はディスク以外が原因であり、メディアエラーやセルフテスト失敗がシリアルに追従してクリーンなパス上で発生する場合はドライブが原因です。
アクティブなRAIDメンバーをシャッフルする際は、シリアルとスロットの対応を記録し、ストレージスタックがスロット順ではなくメタデータでメンバーを識別していることを確認してください。制御された移動ができない場合は、まずケーブルを交換し、ログを使って残りのパスを絞り込んでください。
タイムアウトやリセットは補助的な証拠として解釈する
コマンドのタイムアウト、SATAリンクのリセット、デバイスの一時的な消失は、弱いケーブル、不安定な電源、コントローラーの問題、または応答を停止したドライブが原因で起こることがあります。重要な信号ですが、それ自体で原因を特定するものではありません。
ATAのリカバリーパスは、伝送失敗や不明なコマンド状態の後にリンクをリセットすることがあります。繰り返されるリセットと増加するCRCエラーはパスの仮説を強め、繰り返される訂正不能セクターやセルフテスト失敗はメディアの仮説を強めます。
各イベントをタイムスタンプでRAIDのドロップ、アプリケーションのI/Oエラー、SMARTの変化と相関させてください。メンテナンス後の単一のリセットは説得力に欠け、同じケーブル、ベイ、ドライブシリアルで繰り返されるパターンの方が信頼性があります。
証拠が追従する構成要素を交換する
新しいCRCおよびリンクエラーが一つの接続に結びつき、ドライブが他の場所で制御されたメディアチェックに合格する場合は、ケーブルを交換するかパスを修理してください。既知の良好なパス上でデバイス側のエラーがシリアルに追従する場合は、ドライブを交換または廃棄してください。
あいまいなケースは二者択一に無理に当てはめないでください。故障しつつあるドライブが限界のケーブルと共存することもあり、安定したSMARTセルフテストは繰り返されるトランスポート障害を消し去るものではなく、RAIDメンバーのドロップを引き起こす可能性があります。
修理後は新しいベースラインを確立し、通常のワークロード、スクラブや整合性チェック、監視期間を通じてカウンターの増加が止まることを確認してください。エラーが続く、データが読み取れない、アレイに冗長性が残っていない場合はエスカレーションやディスクのイメージングを行ってください。
| 観察されたパターン | より一致する原因 | 次の制御されたアクション |
|---|---|---|
| CRCカウントが増加;メディアテストは合格 | ケーブル、コネクタ、ベイ、またはコントローラーパス | パスの構成要素を一つ交換して再テスト |
| 訂正不能セクターがディスクシリアルに追従 | ドライブのメディア故障 | データを保護しドライブを交換 |
| 明確なカウンターなしのタイムアウト | あいまいなパスまたはデバイスの故障 | ログを相関させて変数を一つ変更 |
| ケーブル交換後にエラーが停止 | 解決されたトランスポート障害 | 新しいベースラインから監視を継続 |
サポートとヒント
もっと読む

なぜRAIDアレイは停電後に非アクティブになるのですか?
非アクティブなアレイは、多くの場合、メタデータは見つかったものの、システムが不正なシャットダウン後に安全に起動するための十分な信頼性やメンバーを持っていなかったことを意味します。

RAIDの欠落メンバーを無理にオンラインに戻すリスクとは何ですか?
強制オプションは、古いメタデータ、未処理のパリティ、書き込み漏れ、またはアクティブなプールに関する安全チェックを回避できます。使用する前に証拠を確認し、保存してください。

異なる速度のドライブは同じミラーアレイで共有できますか?
異なる速度のドライブでもデータのミラーリングは可能ですが、遅いドライブが書き込み、リカバリ、レイテンシ、およびワークロードの制限をアレイ全体に設定することがあります。

