2回目の回復不能な読み取りエラーは、劣化したNAS RAIDの再構築中に重大になります。なぜなら、最初の故障メンバーが通常欠損情報をカバーする冗長性の一部または全部をすでに消費しているためです。もし別の必要なブロックが読み取れなければ、アレイは残りのミラーコピーやパリティ方程式で再構築できる以上の未知データを抱える可能性があります。
「2回目」とは、回復中の2つ目の利用不可入力を指し、必ずしも2台目の完全なドライブ故障を意味しません。読み取れないブロックは、他はオンラインに見える生存ドライブ上に存在するかもしれません。その影響はRAIDレベル、ストライプの位置、利用可能な複製、ファイルシステムが別の検証済みコピーを識別できるかに依存します。
RAIDアレイが劣化モードに入ると何が変わるのか?
正常な冗長アレイは1つのメンバーから情報を失っても、別のミラーコピーを使うかパリティから欠損ブロックを計算して読み取りに応答できます。ドライブが故障すると、同じアレイは劣化モードに入ります:データは利用可能ですが、通常の回復経路の1つがすでに使用されています。
再構築中、交換用ドライブには欠損メンバーの有効なコピーがありません。再構築されるすべての領域は、生存しているメンバーが必要なデータを返すことに依存しています。したがって、再構築は単なる大規模なコピー作業ではなく、アレイがより小さなエラー余裕で動作しながら情報を継続的に再生成しなければならない一時的な状態です。
回復不能な読み取りエラーとは、デバイスが自身のエラー訂正や再試行手順の後でも正しく返せないセクターやブロックのことです。正常なアレイでは、冗長性によりその障害がアプリケーションから隠されることがあります。劣化したアレイでは、同じ読み取れないブロックが再構築を妨げる追加の未知となる可能性があります。
2回目の読み取りエラーはどこで再構築を破壊する可能性があるか?
パリティRAIDは、1ストライプずつ欠損データを再構築します。単一パリティストライプは、残りのデータブロックとパリティが欠損値を定義しているため、1つの未知のブロックを解決できます。もし1台のドライブがすでに欠損していて、同じストライプ内の別の必要なブロックが読み取れなくなると、そのストライプには2つの未知が存在し、パリティ関係は1つだけになります。
故障は再構築の依存関係に局所的であり、アレイ内のすべてのバイトに自動的に及ぶわけではありません。実装によってはリビルド全体を停止するものもあれば、損傷した領域やファイルを報告するもの、修正不能なエラーを記録しながら継続するものもあります。重要なメカニズムは、影響を受けたストライプが元の計算に十分な信頼できる情報をもはや含まないことです。
ミラーは異なる形で類似の境界を持ちます。ミラーメンバーの一方が故障した後、残りのメンバーが唯一の完全なオンラインソースとなります。そのソースのブロックが読み取れず、第三のレプリカやバックアップがない場合、ミラーはそのブロックを回復する独立したコピーを持ちません。
なぜ大容量は故障を保証するのではなく露出を増やすのですか?
大容量ドライブは、調査または再構築が必要なデータ量を増やすことでリビルド露出を増加させます。必要な読み取りが増えると、通常のワークロードでは最近触れられていない潜在的なセクタ問題に遭遇する機会が増えます。リビルドが遅くなるとアレイの劣化状態が長く続き、別の故障がより大きな影響を及ぼす期間が延長されます。
| 可変 | リビルド露出の変化 |
|---|---|
| 使用済みデータ | 割り当て認識型リビルドは総生容量未満を処理する場合があり、従来のレイアウトはより広範なアドレス範囲を読み取ることがあります。 |
| ドライブ容量 | 大きなメンバーは再構築作業の量を増やすことがあります。 |
| アレイ幅 | メンバー数が増えると、ストライプのジオメトリとリカバリ読み取りに参加するデバイスの数が変わります。 |
| 通常のワークロード | I/Oを競合するアプリケーションは、劣化期間を延長する可能性があります。 |
| 読み取りリトライ | 弱いセクターは、ほとんどの読み取りが最終的に成功しても、実効リビルド速度を低下させることがあります。 |
したがって、容量は決定的な故障スイッチではなく、露出の乗数です。適切に管理された大容量アレイは正常にリビルドできますが、メディアが弱い、小さなアレイは、古いエラー、冷却不良、または不安定な電源によりはるかに早く故障する可能性があります。
したがって、実際の比較はエンクロージャのサイズだけでなく、割り当てられたデータ、リビルドの挙動、および持続的な読み取り速度に基づいています。物理的に大きなNASは、再構築するデータが少なく、リトライの遅延が少なければ、小さなアレイよりも早く完了することがあります。
RAIDレベルは残りのマージンにどのように影響しますか?
RAID 5は通常ストライプごとに1つのパリティブロックを使用するため、故障したメンバーはストライプの単一障害許容を消費します。RAID 6は別のパリティマージンを保持し、通常は最初のドライブ故障後にもう1つの再構築マージンを残します。ミラーは残っている完全なレプリカの数に依存します。
| レイアウト | 1台のドライブが故障した後の状態 | もう1つの必要な読み取れないブロックの影響 |
|---|---|---|
| 2ウェイミラー | 1つの完全なオンラインコピーが残っています | 影響を受けたブロックには2つ目のミラーソースがありません。 |
| RAID 5 | シングルパリティはすでに欠損メンバーを再構築しています | 同じストライプ内の2つ目の未知の障害は解決不可能な場合があります。 |
| RAID 6 | 通常、もう1つのパリティ関係が残っています | 故障の組み合わせによってはストライプはまだ再構築可能かもしれません。 |
| 3ウェイミラー | 2つの完全なレプリカが残っている場合があります | 読み取れないコピーは、別の生存しているレプリカと比較できます。 |
デュアルパリティはアレイが同時に許容できる欠損入力の数を増やしますが、すべてのコントローラー障害、ファイルシステムエラー、誤削除、またはすべてのオンラインバージョンに一貫してコピーされた破損からは保護しません。
RAIDレベルのラベルはあくまで出発点に過ぎません。コントローラーの動作、ファイルシステムのチェックサム、レプリカの配置、バックアップの有無が、残りのマージンが影響を受けたブロックを特定し修復できるかを決定します。
なぜ公開されているURE率は再構築のカウントダウンではないのか?
ドライブの仕様はしばしば非回復読み取りエラー率を読み取ったビット数あたりの最大統計率として表現します。この数値は規模を理解しデバイスクラスを比較するのに役立ちますが、個々のディスクが正確にどのバイトで故障するかを予測するタイマーではありません。
実際の動作は、メディアの状態、ファームウェアの回復、ワークロード、温度、振動、インターフェースの安定性、およびRAID実装がリトライをどのように処理するかに依存します。ドライブは単純に計算された閾値をはるかに超えて読み取ってもUREが発生しないことがありますが、損傷したセクターははるかに早く失敗する可能性があります。仕様を単一の再構築に対する決定論的確率として扱うことは、仕様が提供できない精度を生み出します。
防御可能な結論はより狭くなります:より多くのデータを読み、より長く続く再構築は、劣化したアレイに既存の障害が影響を及ぼす機会を増やします。
再構築が始まる前に影響を軽減するものは何ですか?
最も強力な保護はドライブが故障する前に作られます。遅延したスクラブは潜在的なエラーを再構築前に発見できずに残しますが、スケジュールされたスクラブやパトロール読み取りは、完全な冗長性がまだ利用可能なうちに冷たい読み取り不能領域を露呈させることができます。監視は読み取り再試行の増加、保留中のセクター、インターフェースエラー、温度問題を交換が緊急になる前に明らかにできます。
アレイ設計も結果を変えます。追加のパリティやもう1つのミラーコピーはより多くの再構築の選択肢を保持し、テスト済みのバックアップはアレイ外の回復源を提供します。安定した電源、十分な冷却、利用可能な予備容量、不要な競合作業を避ける再構築ポリシーは、劣化モードで過ごす時間を減らします。
これらの制御のいずれもクリーンな再構築を保証しません。これらが組み合わさることで、1つの隠れたブロックエラーがオンラインアレイと回復不能なデータの間の唯一のポイントになることを防ぎます。
よくある質問
1つのURE(未修正読み取りエラー)が劣化したRAIDアレイを必ず破壊しますか?
いいえ。結果はRAIDレベル、影響を受けたストライプ、残りのレプリカ、コントローラーの挙動、そして別の検証済みコピーの有無によります。1つの領域を損傷させることもあれば、再構築を停止させることも、修復可能な場合もあります。
RAID 6は再構築中の読み取りエラーに免疫がありますか?
いいえ。RAID 6は通常、1つの故障後もより多くのパリティ余裕を保持しますが、追加のエラー、別のドライブ故障、コントローラーの障害、または共有された破損により、その保護を超えることがあります。
成功したスクラブは次の再構築を保証しますか?
いいえ。スクラブはプール全体の保存されたブロックチェックサムを検証し、その時点でチェックされたデータが読み取り可能で内部的に検証可能であったことを示します。しかし、後の再構築中にすべてのデバイスが健康なままであることを保証するものではありません。
再構築速度は常に最大に設定すべきですか?
自動的にはそうなりません。高速な完了は劣化時間を短縮しますが、積極的な再構築はアプリケーションと競合し、限界に近いハードウェアに負荷をかけることがあります。適切な設定は回復時間、デバイスの挙動、サービス要件のバランスを取ります。
最終的な結論
2つ目の読み取り不能なブロックは重要です。なぜなら、劣化モードですでにアレイの通常の回復余裕が使い果たされているからです。大容量はその状態にさらされるデータ量と時間を増やす可能性がありますが、RAIDのレイアウト、検証済みの冗長性、メンテナンス履歴、独立したバックアップが、エラーが修復可能な損傷になるか永久的な損失になるかを決定します。
テック&AIハブ
もっと読む

Home AssistantはLAN接続とリモート接続でなぜパフォーマンスが異なるのですか?
LAN接続とリモート接続のHome Assistantセッションではネットワーク経路が異なります。リモート接続では、DNS、暗号化、WAN、プロキシやVPN、再接続処理による遅延が加わります。

Home AssistantはCGNATや二重NAT環境でも安定して動作しますか?
CGNATと二重NATは通常、ローカルでのHome Assistantの制御には影響しません。主に、リモートクライアントがホームネットワークへのインバウンド経路を確立する方法が変わります。

インターネット障害中、ネットワーク遅延はHome Assistantにどのような影響を与えるか?
インターネット接続の喪失とネットワーク遅延は異なる障害です。DNS、クラウド連携、ゲートウェイ、リモートクライアントが待機している間も、ローカルデバイスへの経路は高速なまま維持されることがあります。

