RAIDスクラブは、共有ストレージパス上で検証読み取りがモデルの読み込み、検索、ログ記録、またはメモリ負荷と競合すると、ローカル推論のレイテンシを高めます。
GPUメモリにすでに常駐しているモデルは、スクラブ中も通常どおりデコードできる場合があります。一方で、最初のリクエスト、RAG検索、またはスワップ処理が突然遅くなることがあります。スクラブは割り当て済みデータを走査し、冗長コピーまたはパリティを読み取り、整合性を検証し、損傷を修復する場合があります。その影響は、RAIDという言葉そのものよりも、推論が必要とするディスク、コントローラーキュー、CPUサイクル、キャッシュページがどれかによって大きく左右されます。
スクラブはアイドル容量を検証I/Oに変える
スクラブは割り当て済みブロックを体系的に読み取り、チェックサムまたはパリティを検証し、冗長性によって可能な場合は損傷したデータを再構築します。正常なアレイでも読み取りと検証の処理は実行されるため、この操作によってすべてのメンバーディスクが数時間にわたりビジー状態になることがあります。
OpenZFSでは、スクラブとリシルバーの処理を、通常の読み取りや書き込みとのバランスを取る別個のスクラブI/Oクラスとして説明しています。スクラブのアクティビティを高めると検証は早く完了しますが、フォアグラウンド処理のレイテンシが増加する可能性があります。
回転式ディスクのアレイでは、スクラブの読み取りが小さなランダムリクエストと交錯するとヘッド移動が発生します。一方、SSDアレイではコントローラーの帯域幅や内部フラッシュチャネルが飽和することがあります。そのため、同じ公称スループットでもテールレイテンシは大きく異なる場合があります。
推論がスクラブの影響を受けるのは共有依存関係を通じてのみ
完全に常駐した重みとKVキャッシュからのトークンデコードは、主に計算とメモリ帯域幅に依存するワークロードです。ストレージが顕在化するのは、モデルの読み込み、メモリマッピングによるページフォールト、検索、プロンプトのログ記録、アダプターの切り替え、KVオフロード、またはチェックポイントやインデックスへのアクセスが発生したときです。
OpenZFSでは、スクラブ処理がディスク読み取りを発行し、スキャン順序によって処理がプールに到達する方法が変わると説明しています。こうしたスキャンスケジューリング制御によって、有用なキャッシュページが追い出されたり、レイテンシに敏感なモデルやベクトルの読み取りが到着する前にキューが占有されたりすることがあります。
CPUによるチェックサム処理やパリティ再構築も、トークン化、検索、またはCPU推論と競合する可能性があります。観測される遅延は、出力トークン毎秒の一様な低下ではなく、初回トークンレイテンシ、検索遅延、または周期的な停止として現れることがあります。
スロットリングは完了時間とテールレイテンシをトレードオフにする
スクラブの同時実行数を制限したり、インタラクティブな時間帯に検証を一時停止したりすると、推論用のキュー容量を増やせますが、潜在的なエラーが発見されない期間は長くなります。需要が予測可能で、スクラブをメンテナンス目標の期限内に完了できる場合に限り、スケジューリングだけでも効果があります。
OpenZFSのチューニングガイドでは、スクラブ遅延を増やすと、動的なワークロードへのスクラブの影響を軽減できる場合があると説明しています。ミラー、RAID-Zグループ、SATA SSD、NVMeプールではボトルネックが異なるため、適切な設定はハードウェアとワークロードによって異なります。
障害時の境界は、アレイが劣化している状態や修復が進行中の状態です。データの再構築はインタラクティブなレイテンシより優先すべき場合があり、過度なスロットリングは脆弱な状態を長引かせる可能性があります。正しい対応は、高速なチャットボットの背後にストレージのリスクを隠すことではありません。
推論のクリティカルパスに対して1回のスクラブをプロファイルする
検証の前後および実行中に、初回トークンまでの時間のp50とp99、トークンレート、検索レイテンシ、モデルのページフォールト、ディスクキューの深さ、読み取りレイテンシ、スループット、CPU使用率、ARCまたはページキャッシュのサイズ、スクラブの進行状況を記録します。この区別は、後で家庭内環境でテストするときにも確認できます。
スナップショットによるストレージ競合を利用して、スナップショットの競合とスクラブの競合を区別します。常駐モデルとコールドモデル、RAGの有効時と無効時、通常のスクラブ同時実行数と制限した同時実行数、ストレージのみのベースラインで再テストします。自動化を進める前に、中間結果を確認できる状態に保つ必要があります。
インタラクティブなテールレイテンシを保護しながら、整合性チェックを予定どおり完了できる制限値を選びます。GPUに常駐したデコードに影響がなく、検索だけが停止する場合は、モデルを調整するのではなく、共有ストレージパスを分離するか優先順位を設定します。
テック&AIハブ
もっと読む

エンベディングドリフトとは何か、プライベート検索インデックスの再構築が必要になるのはいつか?
モデル、前処理、コーパス、クエリのドリフトを解読し、監視と非互換性を区別して、プライベートインデックスの再構築が必要なタイミングを判断します。

トークナイザーの互換性とは何か、なぜモデルの切り替えで問題が起きるのか?
ローカルモデル切り替えのために、語彙の同一性、特殊トークンのセマンティクス、チャットテンプレート、キャッシュ済みトークン、アダプター、互換性チェックを解読する。

モデル常駐とは何か、ローカルAIサービスはいつ重みをロードしたままにすべきか?
重みの常駐性、キャッシュレベル、コールドスタート、追い出し、マルチプレクシング、メモリプレッシャー、そして家庭用AIサービスをウォーム状態に保つべきタイミングを解説します。

