ZFSのチェックサム訂正が繰り返される場合、いつ心配すべきか

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

チェックサムエラーが再発したときに警戒すべきなのは、古い基準値を記録してクリアした後であり、単にカウンターがゼロでないからではありません。

冗長性によって有効なコピーが提供されれば、ZFSは破損したブロックを修復できます。しかし、その修復だけでは、なぜ誤ったデータが到着したのかは分かりません。zpool status -vの結果と関連するシステムログを保存し、バックアップを確認してから、再発状況、影響を受けたデバイスのパターン、正常なスクラブの結果を使って、その事象が一度限りだったのか、障害がまだ継続しているのかを判断してください。

何かをクリアする前に、ZFSが修正した内容を記録する

プールの完全なステータス、スクラブのタイムスタンプ、デバイスごとのエラーカウント、永続エラーの一覧を保存します。同じ時刻に、リンクリセット、コマンドタイムアウト、コントローラー障害、マシンチェック、予期しない電源イベントに関するカーネルメッセージも取得してください。

修復されたZFSチェックサムカウンターと考えられる原因についての詳しいコミュニティ解説では、修正されたブロックと、それを引き起こした可能性のあるケーブル、電源、コントローラー、メモリ、ディスクの障害を区別しています。修復されたからといって、ハードウェア経路が正常だと証明されたわけではありません。

プールに負荷をかける前に、重要なデータの別の利用可能なコピーが存在することを確認してください。証拠を保存した後であれば、カウンターをクリアしても問題ありません。次の判断は、本当に新しいエラーが発生したかどうかに左右されるためです。

再発と範囲を判断の基準にする

基準値を保存したら、カウンターをクリアし、電源と温度が安定した時間帯に1回スクラブを実行します。スクラブが正常に完了し、通常の使用で新しいエラーが発生しない場合は、1回の過去の事象だけを理由にハードウェアを交換せず、監視してください。

同じディスクで新しいチェックサムエラーが増えた場合は、そのディスクのデータ経路と電源経路、SMART履歴、リンク統計、コントローラーポートを調べます。複数のディスクで同時にエラーが増えた場合は、HBA、バックプレーン、電源、ケーブル、メモリ、システムの安定性など、共有コンポーネントを優先して確認してください。

永続データエラー、繰り返すI/Oエラー、プールの停止、または急速に増加するカウントがある場合は、緊急度が高まります。不要な書き込みを停止し、バックアップを更新してから、別のスクラブで負荷を加える前に疑わしい層を切り分けてください。

1つの層だけを変更し、結果を検証する

システムの電源を切った状態で、疑わしいデータケーブルや電源ケーブルを差し直すか交換し、デバイスを正常と分かっているポートに移します。複数の層を一度に交換しないでください。そうしないと、どのコンポーネントの変更で結果が改善したのか特定できません。

特定のデバイスに偏ったパターンの場合は、SMART履歴を確認してから、ドライブベンダーのテストまたは制御された読み取りを実行します。複数のデバイスに及ぶパターンの場合は、複数のドライブが同時に故障したと考える前に、メモリと電源の安定性をテストし、コントローラー経路を確認してください。

ホームサーバーOSガイドでは、一般的なNASおよびLinuxプラットフォームで、プールの健全性、カーネルログ、コントローラー管理機能がどこにあるかを確認できます。

元のワークロードで復旧を検証する

切り分けた修理の後に完全なスクラブを実行し、続いて、以前に問題を表面化させたワークロードを再実行します。復旧とは、スクラブが新しいチェックサム、読み取り、書き込みエラーなしで完了し、再起動後および別の代表的なワークロード期間中もカウンターが増えないことです。

既知の正常な経路に移しても問題が追随する場合、SMARTまたはセルフテストの結果も悪化している場合、またはケーブルと電源を問題から除外した後も新しいエラーが発生する場合は、ドライブを交換してください。エラーがポート、エンクロージャー、コントローラー、または電源イベントに伴って発生する場合は、共有層を交換または修理してください。

永続エラー、十分な冗長性のない縮退プール、またはどのコピーを正とすべきか分からない場合は、直ちにエスカレーションしてください。修正された事象は診断を促す警告であり、再現可能な新しい修正は、診断を先送りできない証拠です。

FAQ

zpool clearで原因は解決しますか? いいえ。証拠を保存した後に記録済みのカウンターをリセットするだけです。根本的な経路が不正なデータを生成しなくなったことを示すのは、正常なスクラブと安定したフォローアップワークロードだけです。

修正されたチェックサムエラーが1件だけなら無視できますか? 記録された警告として扱ってください。カウンターをクリアして正常なスクラブを実行した後に再発しなければ、監視で十分な場合があります。ただし、再発や関連するI/O障害がある場合は、切り分けが必要です。

SMARTの正常なレポートがあれば、そのディスクは問題ないと判断できますか? いいえ。SMARTでは、ケーブル、コントローラー、電源、一部のデバイス障害を検出できない場合があります。そのため、ZFSの影響範囲、システムログ、制御された交換、修理後のスクラブを組み合わせて判断してください。

サポートとヒント

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.