最も迅速に切り分けるには、ドライブを同じものに固定したまま、エンクロージャ、ケーブル、ポート、電源を変更し、その後、問題が疑われるエンクロージャで正常なドライブを使って再テストします。
この判断が重要になるのは、USBディスクが負荷中に消失し、再接続または再起動後に戻る場合です。競合する可能性は、ドライブ内部のメディアまたはコントローラーの障害と、ドライブ外部のブリッジ、ケーブル、ポート、または電源の障害です。保存済みの構成と使い捨て可能なデータから始め、一度に1つの分岐だけを観察し、データ損失、権限、または可用性のリスクが拡大する場合は中止してください。
ドライブ内部のメディアまたはコントローラーの障害と、ドライブ外部のブリッジ、ケーブル、ポート、または電源の障害を切り分ける
変更を加える前に環境を記録します。ソフトウェアとファームウェアのバージョン、デバイスの識別情報、マウントまたはネットワークパス、空き容量、権限、そして観測された症状を記録してください。ベースラインには、USBディスクが負荷中に消失し、再接続または再起動後に戻る状況を再現するのに十分な詳細を残す必要があります。
最初の候補は、ドライブ内部のメディアまたはコントローラーの障害です。2つ目は、ドライブ外部のブリッジ、ケーブル、ポート、または電源の障害です。現在のUSBブリッジ経由のSMARTは、テストで使用する仕組みまたはコマンド境界を定義するものであり、この特定のホームサーバーでの観測に取って代わるものではありません。
切り分けを実行する前に、合格条件と中止条件を書き出します。合格とは、他方の分岐が予測する証拠に変化しながら、無関係なサービスには変化がないことです。不合格の場合は、推測に基づく修正を連鎖させるのではなく、保存済みの状態に戻せる必要があります。
管理された1つの切り分けを実行する
次の切り分けを使用します。SMARTデータとカーネルログを取得し、その後、同じ継続的な転送のもとで対応する交換テストを実行します。変更した変数に結果を帰属できるよう、ワークロード、クライアント、パス、ファイルセット、タイミングを一定に保ってください。
USB電源管理を使用して、分岐を実際に切り分けられる項目を選び、そのタイムスタンプ、終了ステータス、エラーテキスト、デバイスまたはスナップショットの識別情報、レイテンシ、転送バイト数、権限、復旧状態を取得します。クリーンなコマンド終了だけでは、テスト対象が識別情報、耐久性、またはアプリケーション状態に関する主張である場合には不十分です。
元の条件に再起動、再接続、再マウント、またはキャッシュのコールド化が含まれている場合は、そのイベントの後にテストを1回繰り返します。最初の実行が破壊的である場合や、環境を復元できない場合は中止し、代わりに使い捨て可能なコピーで再現してください。
smartctl -a -d sat /dev/sdX
dmesg -w
証拠がどの分岐を支持するかを解釈する
合格: エンクロージャを変更してもエラーがドライブに追従する、または正常なドライブを使うとエラーがエンクロージャに追従する。合格した正確なバージョン、識別情報、ワークロードを記録し、結論が普遍的な主張ではなく条件付きのものになるようにしてください。
不合格: 障害が1つのホストまたは電源状態でのみ発生するため、USBコントローラー、自動サスペンド、または電力供給が引き続き対象になります。不合格だからといって、反対の分岐が自動的に証明されるわけではありません。ネットワーク、メモリ、権限、またはソースの一貫性が両方に影響する可能性があるため、エスカレーションする前に、それらの共有依存関係を切り分けてください。
例外または曖昧な結果: リセットが繰り返される場合は書き込みを停止し、負荷テストの前に重要なデータをクローンします。復元可能なコピーが存在するまで、ログを保持し、修復、プルーニング、破棄、再パーティション、または再帰的な所有権変更コマンドを実行しないでください。
適合する対処を適用し、元の障害を再現する
観測された分岐に適合する対処を適用し、その後、縮小した代替テストではなく元の条件を再現します。エラーがエンクロージャ間でドライブに追従する、または正常なドライブを使った場合にエンクロージャに追従する状態が、2サイクルにわたって、あるいは該当する再起動、スリープ、中断、または負荷遷移後にも維持された場合にのみ、判断は有効です。
個別のバックアップジョブを使用して、最も近い依存ワークフローを確認します。ただし、元のトリガーは変更しないでください。無関係なデータセット、共有、コンテナ、ユーザー、復旧ポイントは、以前のアクセス状態とタイミングを維持する必要があります。
中止の境界は明確です。障害が1つのホストまたは電源状態でのみ発生し、USBコントローラー、自動サスペンド、または電力供給が引き続き対象となる場合は、最後に検証済みの構成へ戻し、証拠を保持します。分岐が再現可能な場合にのみ、より深いプラットフォームまたはハードウェアテストへエスカレーションしてください。
目的の結果が得られたら、バックアップ検証の頻度と比較し、リスクが隣接するサービスへ移らないようにします。新たなバックアップ、識別情報、タイムアウト、または可用性の障害が発生した場合、目的のテストに成功していても変更は失敗です。
FAQ
USBディスクの切断を診断する際、残る検索は通常、「ドライブが故障しているのにSMARTが正常なことはあるか」、「なぜ同じワークロードでテストするのか」、「テストをいつ中止すべきか」に関するものです。以下の回答では、これらのエッジケースを主な判断から切り離して扱います。
合格の境界は変わりません。エラーがエンクロージャ間でドライブに追従する、または正常なドライブを使った場合にエラーがエンクロージャに追従することです。後続の条件によってファイルシステム、識別情報、ネットワークパス、またはアプリケーションのバージョンが変わった場合は、その変更の影響を受ける切り分けだけを再実行してください。
障害が1つのホストまたは電源状態でのみ発生し、USBコントローラー、自動サスペンド、または電力供給が引き続き対象となる場合は、実験の範囲を広げるのをやめてください。その時点で、リセットが繰り返される場合は書き込みを停止し、負荷テストの前に重要なデータをクローンします。プラットフォーム、ストレージ、またはハードウェアの担当者へエスカレーションする前に、証拠を保持してください。
ドライブが故障しているのにSMARTが正常なことはありますか?
はい。電気的な障害、ブリッジ、ファームウェア、一部の初期メディア障害では、SMART属性がすぐには変化しないことがあります。
なぜ同じワークロードでテストするのですか?
切断は、大きな電流消費、継続的な書き込み、UASPキュー、または熱負荷の最中にのみ発生することがあります。
テストはいつ中止すべきですか?
リセットの繰り返し、I/Oエラー、異常な音、またはSMARTエラーの増加が見られたら中止し、まずデータを保護してください。
同じワークロードによって、証拠がドライブ内部のメディアまたはコントローラーの障害、あるいはドライブ外部のブリッジ、ケーブル、ポート、または電源の障害に追従し、適合する対処によって元の症状が解消され、別の症状が発生しなくなった時点で診断は完了です。どちらの分岐も再現性を保てない場合は、ログと保存済みの状態をそのまま保持してください。不確実性は、修正を積み重ねる理由ではなく、エスカレーションする理由です。
サポートとヒント
もっと読む

新しいストレージへリポジトリを移行するためのBorg Backup移行ガイド
Borgリポジトリを一貫性のある1つのオブジェクトとして移行します。書き込みを停止し、鍵とIDを保持し、リストアを検証してから、移行元を維持したままクライアントを更新します。

Resticリポジトリのメンテナンスワークフロー:チェック、プルーニング、コンパクト化、復元テスト
Resticには個別のcompactコマンドはありません。pruneが再パッキングを実行します。ロックと空き容量を確保し、完了後に再確認して、最後に分離環境で復元テストを行ってください。

壊れた、または放置されたバックアップ履歴からのTime Machine NAS復元ガイド
古いバンドルはそのままにしてください。修復するか新しいチェーンを作るかを決める前に、NASアクセス、宛先ID、イメージの損傷、放棄された履歴を切り分けてください。

