なぜ2026年、ホームAI推論でプレフィックス対応スケジューリングが導入されているのか?

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

ホームAI推論では、繰り返し使用するシステムプロンプトやツールスキーマで高コストなプリフィル計算を再利用できるため、プレフィックスを考慮したスケジューリングが採用されつつあります。

ホームアシスタントは、固有の質問を処理する前に、システム指示、ツールスキーマ、安全ルール、家庭のコンテキストとして、何千もの同一トークンを毎回付加することがあります。これらのトークンを再計算すると、最初のトークンが生成されるまでの遅延が増加します。プレフィックスを考慮したスケジューリングは、同一のプレフィックスを持つリクエストを再利用可能なキャッシュ状態へ振り分けようとします。ただし、家庭内のワークフローを同時に繰り返し利用する状況で、1つのウォームなプレフィックスがキューを独占しないようにします。

繰り返し使われるプレフィックスがプロンプト履歴を再利用可能な計算に変える

ホームアシスタントは、固有のユーザーテキストの前に、同じシステムプロンプト、ツールスキーマ、家庭内ポリシー、RAG指示を繰り返し送信します。プリフィルでは、これらのトークンに対するアテンション状態を計算します。完全に同一のプレフィックスが再び現れる場合、キャッシュされたKVブロックによって、その作業の大部分を省略できます。

SGLangのプレフィックス共有設計では、ラディックス木を使って、リクエスト間で共通するプレフィックスを共有します。プロンプトの重複を、スケジューリングとメモリのリソースとして扱います。

キャッシュが役立つのは、後続のリクエストが一致する状態の残っている場所に到達した場合だけです。プレフィックスの局所性を無視するスケジューラーは、処理をコールドなプロセスへ送ったり、無関係なコンテキストを受け入れる際に再利用可能なブロックを追い出したりする可能性があります。

スケジューリングはキュー待ち時間とキャッシュ局所性のバランスを取る

プレフィックスを考慮したスケジューラーは、リクエストの待ち時間と、各ワーカーで再利用できるプロンプトトークン数の両方を考慮します。再利用によって最初のトークンまでの時間とプリフィル計算量は減少しますが、すべてを1つのウォームなワーカーに送ると、不公平なキューが生じる可能性があります。

オープンな推論スタックでは、デプロイパターンとしてプレフィックスキャッシュルーティングと階層型プレフィックスキャッシュを明示的に挙げています。これらが含まれていることは、キャッシュ局所性が第一級のサービング指標になりつつあることを示しています。

単一のホームGPUでは、同じ原則によって、受け入れ順を決めたり、セッション間でブロックを保持したりします。効果が最も大きいのは、安定したテンプレートや、大規模で繰り返し使用されるツール定義を持つエージェントです。無関係な単発プロンプトでは効果は限定的です。

プレフィックス認識が役立たない場合

プロンプトの早い段階で1つのトークンが変わるだけでも、その後の再利用が無効になることがあります。動的なタイムスタンプ、並べ替えられたツールスキーマ、ユーザーごとの秘密情報、一貫性のないシリアライズは、共通プレフィックスを短くします。その結果、キャッシュの検索と保持がメモリを消費するだけで、計算量をほとんど削減できなくなることがあります。

完全一致するプレフィックスの解説では、再利用には意味が似ているだけでは不十分で、同一のトークンプレフィックスが必要だと説明されています。トークン化とプロンプトの構築方法は安定していなければなりません。

また、短いプロンプトでデコード時間が支配的な場合や、リクエストがたまに1件だけ実行される場合にも、この傾向は効果を発揮しません。キャッシュの保持量を増やすと、アクティブなKV状態のための領域が減り、かえって悪影響が出る可能性があります。プレフィックス認識は最適化であり、品質向上ではありません。

キューの飢餓を引き起こさずにプレフィックスの再利用を測定する

トークン化したプレフィックスのハッシュ、照合したトークン数、キャッシュヒット率、プリフィル時間、キュー待ち時間、最初のトークンまでの遅延、追い出し回数を記録します。安定したシステムプロンプトと意図的に変更したシステムプロンプトを使い、家庭内のリクエストを1セッションおよび複数の同時セッションで再生します。

ローカルAIのコールドスタートと比較してください。ディスクやモデルのコールドスタートによって、プレフィックス再利用の効果が隠れる可能性があるためです。スケジューリングの影響を測定する前に、同じ重みをウォームアップします。

プレフィックスを考慮した順序付けは、繰り返し使われるプレフィックスを持つリクエストでプリフィルが意味のある程度まで削減され、かつ最も長く待っているリクエストの遅延が目標値を超えて増加しない場合に導入します。ツールの順序を正規化し、タイムスタンプを安定したコンテンツの後ろに移動し、機密性の高いプレフィックスをユーザー単位で分離し、キャッシュメモリに上限を設けます。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.