故障しているSATAケーブルと故障しつつあるNASドライブの見分け方

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

NASドライブが1回の切断、I/Oアラート、またはSMARTラインから故障したと決めつけないでください。悪いSATAデータケーブル、緩んだコネクタ、不安定な電源リード、故障しつつあるポート、コントローラの問題、損傷したドライブは重複する症状を引き起こす可能性があります。信頼できる方法は、元の証拠を保存し、リンクエラーとメディアエラーを分離し、一度に1つの変数を変更し、新しいエラーがケーブル経路に従うかドライブのシリアル番号に従うかを確認することです。

アレイを保護し最初の証拠を保存する

NASが劣化しているかメンバーが繰り返し切断されている場合は、不要な書き込みを減らし、代替不可能なデータが別の読み取り可能なバックアップに存在することを確認してください。何かを再装着する前にアレイの状態を記録してください。ケーブルテストは低コストですが、不注意な2台目のディスクの取り外しや不安定な接続を通じたリビルドは、はるかに大きな復旧問題を引き起こす可能性があります。

影響を受けたドライブのモデル、シリアル番号、ベイ、デバイス名、SMARTレポート、自己診断履歴、コントローライベント、および各リセットやI/Oエラーの正確な時刻を保存してください。ZimaSpaceのドロップしたRAIDディスクと不良ドライブベイの区別ガイドは同じ原則を使っています:まず物理デバイスを特定し、次にエラーが何に従うかを追跡します。

ベースラインを保存する前にSMART属性、コントローラカウンタ、システムログをクリアしないでください。多くのカウンタは累積値であり、ケーブルを交換してもゼロに戻りません。重要なのは、制御された変更後に生の値が増加するかどうかです。配線の写真を撮り両端にラベルを付けることも、後で交換した際にどの経路が実際にテストされたかの不確実性を防ぎます。

テスト前に2つの競合する仮説を立てる

仮説Aは接続経路の故障です:SATAデータケーブル、コネクタ、ポート、バックプレーントレース、コントローラチャネル、電源コネクタ、または不安定な電源供給です。この経路の問題は、リンクリセット、CRCエラー、ダウンシフト、コマンドタイムアウト、突然の消失、または同じハードウェア経路を通じて接続された異なるドライブで同じ症状を引き起こすことが多いです。

仮説Bはドライブの故障です:読み取り不能なメディア、増加する再割り当て済みまたは保留中のセクター、自己診断の失敗、内部電子部品の故障、異常なノイズ、または既知の正常なケーブルやポートを通じて同じシリアル番号のディスクに続くエラーです。BleepingComputerのディスカッションでは、ケーブル関連の転送エラーが物理的な不良セクターとして自動的に扱われるべきでない理由が説明されています。

証拠が分けるまでは両方の仮説を保持してください。1回のCRCエラーでケーブルが現在悪いとは限らず、1回の読み取りエラーでドライブを即廃棄する必要はありません。テストモデルはどの新しいカウンターが増加するか、症状がどのコンポーネントに従うか、安定経路で長い自己診断テストを完了できるかを確認すべきです。

SMARTデータでリンクエラーとメディアエラーを分離する

UDMA CRCエラー数は、SMART属性C7または199として表示されることが多く、主に通信経路の手がかりです。Level1TechsはUDMA CRCエラーはドライブとホストコントローラー間の転送の破損を記録すると説明しています。ケーブルが一般的な原因ですが、コネクタ、ポート、バックプレーン、コントローラー、電源の不安定さ、ドライブ自身のインターフェース電子回路も原因となり得ます。

メディア関連の属性は異なる方向を示します。再割り当てセクター数、現在保留中のセクター数、オフラインで修正不能、報告された修正不能エラー、読み取り失敗で終わる長い自己診断テストはドライブ問題の強い証拠です。ベンダー属性名や生データ形式は異なるため、すべてのモデルに一律の閾値を適用するより傾向やテスト結果を比較してください。

保存されたCRC合計だけでは不十分です。HardForumのCRCの生値が増え続けるかどうかを監視する説明は重要な違いを示しています。ケーブル交換後にカウントが変わらなければ古いイベントを示す可能性があります。新しい転送中に増加すれば、リンク経路はまだ不安定です。

証拠 ケーブル、ポート、または電源経路とより一致 故障ドライブとより一致 まだ曖昧
UDMA CRC / インターフェースCRCカウント ケーブルまたはポート変更後に新しい増分が停止 新しい増分は既知の良好な経路を通る同じドライブに続く 増加していない古い非ゼロ合計値
再割り当て済みまたは保留中のセクター 通常、データケーブル単独では発生しない 安定経路テスト後もカウントが増加または未解決のまま 傾向やテスト結果のない過去の値
長時間のSMART自己診断テスト リンク修復後に繰り返し成功 別のシステムで繰り返し発生するLBAまたは読み取り段階で失敗 ドライブが切断されたため中止されました
システムログ リンクリセット、PHYエラー、ダウンシフト、デバイス再接続 訂正不能なメディア読み取りエラー、センスエラー、繰り返される不良LBA 下位レベルの詳細なしの一般的なI/Oタイムアウト
エラーが続く 同じベイ、ケーブル、ポート、バックプレーン、または電源系統 同じシリアル番号のドライブ 複数の変数を同時に変更した

ハードウェアの変数は一度に一つずつ変更する

エンクロージャやコントローラが計画している正確なホットスワップ動作に対応していない場合は、NASの電源を切ってください。ドライブとケーブルにラベルを付け、SATAデータケーブルのみを短くて確実にロックでき、急激に曲がっていない既知の良好なケーブルに交換します。最初の比較では同じドライブ、ポート、電源コネクタ、ベイを使用してください。

システムを起動し、新しいベースラインを保存して、代表的な限定負荷を実行しながら新しいCRCエラー、リセット、切断を監視します。UnraidコミュニティはCRCエラーは一般的にSATA接続を示しますが、電源も関係することがあると指摘しています。エラーが続く場合は、ドライブを固定したまま既知の良好なポートや電源系統に移動してください。

ケーブル交換、ドライブ移動、ポート変更、電源ケーブル交換を一度に行わないでください。症状が消えるかもしれませんが、故障部品を特定するための証拠が失われます。変更ごとに経過時間、負荷、温度、SMARTの変化、ログイベントを記録し、結果を記憶ではなく比較できるようにしてください。

新しいエラーが何に続くかで判断する

ケーブルは、ドライブのメディア属性が安定しており、長時間のテストに合格し、新しいCRCやリセットイベントがデータケーブル交換後に止まる場合に主な原因となります。疑わしいケーブルは他の場所に再設置するのではなく廃棄してください。問題が特定のマザーボードのポートやバックプレーンのスロットでのみ再発する場合、故障した部品はケーブルよりも上流にあります。

ドライブは、既知の良好なケーブルとポートで読み取り不能なセクター、保留中のセクター、再割り当てイベント、または自己テストの失敗が続く場合に主な原因となります。特に同じLBAやシリアル番号のディスクが関与している場合です。Tom's Hardwareも同様にCRCエラーだけでは転送経路の問題を示すものであり、自動的にディスクの故障を意味しないと指摘しています。ドライブの交換には、メディアの健康状態やエラー追跡テストからのより強い証拠が必要です。

異なるドライブが同じベイ、同じコントローラーポート、または同じ電源スプリッターで故障する場合、共有経路が主な原因です。複数のドライブが同時に切断される場合は、複数のディスクを非難する前に電源、共有バックプレーン、HBA、およびコネクターを点検してください。根本原因は故障に共通するコンポーネントであり、アラートで最初に名前が挙がったデバイスとは限りません。

リビルド前に原因を修復する

ケーブルの問題が確認された場合は、ケーブルを恒久的に交換し、両方のコネクターを固定し、鋭い曲がりや張力を修正し、新しいカウンターベースラインを確立してください。通常の読み書きを検証し、プラットフォームがサポートするスクラブまたは整合性チェックを実行してください。メディア属性が安定し、修理された経路で新たなリンクエラーが発生しなければ、健全なドライブはサービスに復帰できます。

ドライブの問題が確認された場合、まず読み取り可能な重要データをコピーし、アレイの手順に従ってディスクを交換し、リビルドを監視してください。別のメンバーにエラーが発生したり、交換ディスクが繰り返し切断された場合は停止して再評価してください。ZimaSpaceのRAID冗長性とバックアップ回復の違いの説明が関連する境界です:リビルドは冗長性を回復するものであり、損傷したデータの以前のクリーンなコピーを復元するものではありません。

同じ経路が複数の良好なドライブに影響を与える場合は、コントローラー、バックプレーン、または電源のトラブルシューティングにエスカレーションしてください。「どうなるか見るために」繰り返しリビルドを開始しないでください。診断は、疑わしいコンポーネントが特定され、交換経路が安定し、カウンターの増加が止まり、ドライブまたはアレイが検証に合格し、重要なデータがNAS外で回復可能な状態で初めて完了します。

よくある質問

UDMA CRCカウントがゼロでない場合、それはドライブの故障を意味しますか?

いいえ。これはドライブとホスト間の通信エラーを記録します。現在の値を保存し、ケーブルを交換して良好なポートでテストした後に増加するかどうかを監視してください。

不良のSATAケーブルが保留中セクターを作成することはありますか?

不良ケーブルは通常、転送エラーやリンクエラーを引き起こします。保留中または再割り当て済みセクターはメディアの健康状態を示すより強い手がかりですが、中断されたコマンドやあいまいなログが重なることもあります。決定する前に、安定した経路でドライブを再テストしてください。

劣化したRAIDアレイで長時間のSMARTテストを実行すべきですか?

まず読み取り可能なデータを保護し、残りのメンバーへの負荷を考慮してください。NASプラットフォームの指示に従ってテストを実行し、重いタスクが重複しないようにし、切断や追加のエラーが発生した場合は停止してください。

サポートとヒント

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.