NVIDIA PAIRで自宅ネットワークをローカルAIクラスターに変身—それでも大容量GPUサーバーは必要?

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

NVIDIA PAIRは、ローカルAIのスケーリングに関する重要な前提を変えます。より多くのコンピューティング性能を得ることは、必ずしもより大きなGPUサーバーを1台購入することを意味しません。PAIRは同一のローカルネットワーク上にある互換性のあるコンピューターを接続し、独立したOllamaまたはLM Studioの推論リクエストを処理できるマシンへルーティングします。そのため、ゲーミングPC、ワークステーション、Mac、専用AIボックスが、同じローカル推論プールに貢献できます。

ただし、重要な制限があります。PAIRは複数のGPUを1つのより大きなアクセラレーターに統合したり、VRAMをプールしたり、1つのモデルを一般的なPC間で分割したりすることはありません。実際の価値は別のところにあります。複数の独立したAIジョブを、複数のマシンで同時に実行できるようにするのです。この違いによって、PAIRがローカルAIシステムの構築方法を本当に変えるのかどうかが決まります。

NVIDIA PAIRとは?

NVIDIA Personal AI Router(PAIR)は、同一ネットワーク上のペアリングされたコンピューターにリクエストを分散しながら、互換性のあるAIアプリケーションに1つの使い慣れたエンドポイントを提供する、ローカル推論ルーティングレイヤーです。

NVIDIAのPAIR技術概要では、このシステムをOllamaとLM Studio向けの仮想推論ルーターとして説明しています。現在のベータ版では、対応するRTXハードウェア、DGX Spark、Apple M4以降のシステムを含む、互換性のあるWindows、Linux、macOSシステムがサポート対象として挙げられています。

PAIRは推論エンジンに取って代わるものではありません。OllamaやLM Studioは、引き続き、そのリクエストに選択されたマシン上でモデルを読み込み、実行します。PAIRは、使い慣れたローカルインターフェースの背後で、検出、モデル認識、ノードの適格性確認、ルーティングを処理します。

NVIDIA PAIRはGPUメモリを統合するのか?

いいえ。PAIRはVRAMをプールしたり、1つの仮想GPUを作成したり、単一の推論リクエストを複数の一般的なシステムに分散したりすることはありません。

これは、PAIRをローカルAIクラスターと呼ぶ前に理解しておくべき、最も重要な技術的な境界です。

次のような環境がある場合:

  • VRAM 24GBの1台のRTXシステム、
  • VRAM 24GBの別のRTXシステム、
  • 独自のユニファイドメモリを搭載したMac、

PAIRによって、それらが、個々のマシンには保持できないモデルを読み込める単一の、より大きなメモリプールに自動的に変換されるわけではありません。

NVIDIAはNVIDIA PAIR FAQで、この制限を明確にしています。各推論リクエストは対象となる1つのノードに送信され、そのノード自体が要求されたモデルを実行できなければなりません。

スケーリングの目標 PAIRは役立ちますか?
24GB GPU 2台を結合して48GBのVRAMにする いいえ
1つの大規模モデルを複数の一般的なPCに分割する いいえ
複数の独立したAIリクエストを同時に実行する はい
ビジー状態の互換ノードから処理を振り分ける はい、利用可能な別の対象ノードがある場合
異なるモデルに異なるマシンを使用する はい

PAIRは主に、1つのモデルで利用できる最大メモリではなく、同時実行性と利用可能な推論容量をスケールさせます。

NVIDIA PAIRは実際に何を分散するのですか?

PAIRは独立した推論リクエストを分散します。

これは、現代のAIアプリケーションが1つのユーザー目標から複数のモデル呼び出しを生成することが増えているため重要です。マルチエージェントワークフローでは、情報源の調査、コードの確認、文書の要約、ファイルの分類、回答の検証など、個別のジョブを割り当てることがあります。

これらのジョブが十分に独立して並列実行できるなら、複数のマシンが同時に有用な計算リソースを提供できます。

  • モデル並列化では、複数のアクセラレーターが1つの大規模モデルまたは推論ジョブで協調します。
  • PAIRは、複数の独立したコンピューターを異なる推論ジョブに利用できるようにします。

エージェントワークフローでは、2つ目の問題がますます重要になっています。

単純なチャットボットよりもAIエージェントにとってPAIRが重要なのはなぜですか?

従来のチャットボットは、主に逐次的に動作します。ユーザーがメッセージを送り、モデルが回答を返し、その後に次のリクエストが続きます。

エージェントシステムの動作はさまざまです。1つの目標から複数のサブタスクが生まれ、その一部を同時に実行できる場合があります。これにより、ローカルAIのスケーリングに関する問いは、「このGPUで読み込める最大のモデルは何か?」だけでなく、「自分のローカルインフラストラクチャは、一度にいくつの有用な推論ジョブを処理できるか?」へと変わります。

NVIDIAは、5つのサブエージェントを含むHermes DesktopワークフローでPAIRを実演しました。NVIDIAの構成に限定したテストでは、3台の参加システムがワークロードを8分48秒で完了したのに対し、1台のRTX Sparkノートパソコンでは18分かかりました。

この結果はベンダーによるデモであり、一般的な性能保証ではありません。実用的なポイントはより限定的です。つまり、独立した推論ジョブを十分に用意できるワークロードでは、独立したワーカーを増やすことでメリットを得られる可能性があります。

これは、すでに所有しているハードウェアの経済性も変えます。より広範なローカルAIのコスト比較によって、使われていないコンピューティングリソースを再利用する価値と、専用の推論マシンを購入すべきかというまったく異なる問題を切り分けられます。

NVIDIA PAIRは、どのコンピューターでリクエストを実行するかをどのように決めますか?

PAIRは、すべてのコンピューターに単純に順番でリクエストを割り当てるわけではありません。

公式のPAIRドキュメントによると、ノードが候補になるには、到達可能であり、互換性のある推論エンジンを実行し、要求されたモデルと完全に一致するモデルをアドバタイズしている必要があります。

候補ノードの中から、PAIRは現在の処理状況と直近に割り当てられたジョブを考慮します。これにより、同時に発生したリクエストを利用可能な複数のマシンに分散させ、1つのエンジンの後ろですべてが待機するのを避けられます。

ここで重要なルールが生まれます。PAIRクラスターに参加しても、すべてのノードがあらゆるモデルを提供できるようになるわけではありません。

モデルは各マシンにインストールされた推論エンジンに紐付いたままです。あるノードにコーディングモデルを保持し、別のノードに汎用モデルを保持することができ、モデルの利用可能状況に応じてリクエストを振り分けられます。

PAIRノード間でモデルは自動的に同期されますか?

いいえ。ノード間でモデルファイルが自動的に共有されることはありません。

特定のモデルを搭載しているコンピューターが1台だけの場合、そのモデルのリクエストを処理できるのはそのコンピューターだけです。同じモデルを複数のノードにインストールすると、PAIRはそのワークロードに対応できる候補マシンを増やせます。

これにより、次の2つの有用な戦略を取れます。

頻繁に使うモデルを複製する

同時処理能力を高めたり、その種類のリクエストに対応する代替マシンを用意したりする場合は、頻繁に使う同じモデルを複数のノードに配置します。

異なるノードを専門化する

ハードウェアや役割に合ったモデルを異なるコンピューターにホストさせます。たとえば、あるシステムにはコーディングモデルを、別のシステムにはより軽量な汎用モデルを配置できます。

そのため、PAIRは異種混在の推論プールを構築できますが、モデルの配置は依然として容量計画上の判断事項です。同じメモリ適合ルールがすべてのノードに適用されるため、特定のマシンでどのモデルを提供できるかを判断する際には、現在のOllamaのハードウェア要件が引き続き重要です。

OllamaとLM Studioのアプリは、PAIR向けに書き換える必要がありますか?

PAIRの最も優れた設計上の選択の一つは、互換性のあるアプリケーションが使い慣れたローカルインターフェースを使い続けられることです。

PAIRはOllamaまたはLM Studioの前段にプロキシを配置します。アプリケーションはローカルのOllama互換またはOpenAI互換エンドポイントと通信し、PAIRは最終的にどのペアリング済みノードが推論を実行するかを決定します。

つまり、アプリケーションが以下を追跡する必要はありません。

  • 各コンピューターのIPアドレス、
  • 現在どのマシンがビジー状態か、
  • 要求されたモデルがインストールされている場所、
  • または次のリクエストをどのノードに送るべきか。

NVIDIAは、互換性のあるワークフローではエージェントやハーネスの変更が不要だと説明しています。

この違いから、PAIRがエージェントフレームワークではなく、推論インフラストラクチャであることも分かります。

NVIDIA PAIRはAIエージェントハーネスですか?

いいえ。PAIRとエージェントハーネスは異なる問題を解決します。

エージェントハーネスは、どの作業を行うべきか、タスクをどのように分解するか、どのツールを使うか、サブエージェントがどのように連携するかを決定します。PAIRはスタックの下位で動作します。推論リクエストが発生すると、適格なローカルマシンのうち、どれが処理すべきかを判断するのに役立ちます。

レイヤー 主な役割
エージェントハーネス タスクを計画し、ワークフローを調整
モデルルーター タスクを処理するモデルを選択
NVIDIA PAIR リクエストを処理する適格なローカルマシンを選択
Ollama / LM Studio モデルを読み込み、推論を実行
永続的なインフラストラクチャ ファイル、タスクの状態、インデックス、ログ、長期間稼働するサービスを保存

この分離により、PAIRは計画ロジックを引き継ぐことなく、さまざまなエージェントシステムの下位レイヤーとして機能できます。その上位レイヤーを詳しく知りたい場合は、DeepSeek Harnessプラグインのガイドで、ハーネスが推論の配置を別レイヤーに任せたまま、ワークフローの動作をどのように変えられるかを紹介しています。

PAIRはアイドル状態の家庭用PCを役立つAIコンピューティングリソースに変えられますか?

はい。ワークロードに十分な数の独立したリクエストがあり、利用可能なマシンに必要なモデルが実際に用意されている場合です。

多くの家庭や小規模オフィスには、すでに十分に活用されていないコンピューティングリソースがあります。

  • ゲーミングPC、
  • ワークステーション、
  • 互換性のあるMac、
  • 専用のローカルAIマシン、
  • またはDGX Sparkシステム。

PAIRを使えば、従来の常時稼働クラスターを必要とせずに、これらのマシンの処理能力を活用できます。ゲーミングPCがビジー状態になったり、ノートパソコンがスリープしたりしても、別の準備済みシステムが互換性のあるリクエストを引き続き処理できます。

しかし、余っているGPU時間だけでは不十分です。空いているノードでも、要求されたモデルがなかったり、実行に必要なメモリが不足していたりすると、リクエストには対応できません。

PAIRノードがビジー状態になったりオフラインになったりするとどうなりますか?

PAIRは利用可能なノードを追跡し、適格なマシンにのみ新しいリクエストをルーティングします。

あるワークステーションがビジー状態になっている間に、別の適切なノードが利用可能であれば、その後の独立したリクエストを別の場所に割り当てられます。これにより、すべてのアプリケーションを1台の固定された推論サーバーにハードコードするよりも、プールの柔軟性が高まります。

それでも明確な障害ケースがあります:

  • 必要なモデルが、利用できない1つのノードにしか存在しない、
  • 互換性のあるエンジンが準備されていない、
  • または、リクエストに対応できる十分な容量を持つマシンが他に残っていない場合。

PAIRは利用率を高めますが、キャパシティプランニングが不要になるわけではありません。

NVIDIA PAIRよりも、1台の大規模なGPUサーバーが適しているのはどのような場合か?

PAIRによって専用AIサーバーが不要になるわけではありません。

ワークロードで次のいずれかが必要な場合は、1台の高性能システムのほうが適した設計になることがあります:

  • すべてのPAIRノードで利用可能なメモリを超えるモデル、
  • 予測可能な24時間365日の推論、
  • 一貫したモデルの可用性、
  • 高い継続的な利用率、
  • 密結合のマルチGPU推論、
  • または、よりシンプルな運用。

専用サーバーなら、スリープしたり、持ち運ばれたり、再起動されたり、他の作業に転用されたりする可能性のあるノートパソコンやゲーミングPCに依存する必要もありません。

PAIRが最も効果を発揮するのは、各マシンのメモリ不足ではなく、未使用の分散コンピューティング容量が問題である場合です。

ローカルAIの要件 PAIR 専用GPUサーバー
複数の独立したエージェントジョブ 最適 こちらも可能
既存の異種ハードウェアを活用 最適 専用ハードウェアが必要
1つのモデルがすべてのノードのメモリ容量を超える PAIRだけでは解決できない 十分なメモリがあれば、より適している可能性
常時稼働で予測可能な推論 利用可能なノードに依存 最適
柔軟な家庭内コンピューティング 最適 関連性が低い
シンプルな管理 保守が必要な複数のマシン 多くの場合、よりシンプル

ローカルAIが1台のマシン上でストレージ、メディア、バックアップ、その他のサービスと競合している場合、制約はGPUだけに関係するものではありません。ローカルAIサーバーの限界に関するガイドでは、推論によってホームサーバーの他の機能が不安定になり始めている兆候を説明しています。

NVIDIA PAIRはローカルAIデータをプライベートに保てるのか?

PAIRは、プロンプト、データ、推論トラフィックをクラウドサービスに送信せず、ローカルネットワーク内に保持するよう設計されています。

NVIDIAのPAIRの信頼アーキテクチャでは、ペアリングされたシステム間の明示的なノードペアリングと相互TLSについて説明しています。

これによって、すべてのローカル導入が自動的に安全になるわけではありません。ユーザーには、信頼できるデバイス、信頼できるネットワーク、適切なアプリケーション権限、そして通常のエンドポイントセキュリティが引き続き必要です。

ローカルルーティングは、クラウド推論とは異なる境界を保護します。モデルへのリクエストをユーザー自身のネットワーク内に留められますが、そのネットワークと内部のマシンのセキュリティが依然として重要です。

NVIDIA PAIRをネットワーク全体で利用できるAI APIエンドポイントにできますか?

デフォルトではできません。

アプリケーション側から利用するPAIRエンドポイントは、アプリケーションを実行しているマシンにローカルです。そのマシンは別の処理能力のあるノードにリクエストをルーティングできますが、PAIRがLAN上の任意のデバイスに対して、オープンな推論サービスを自動的に公開するわけではありません。

ネットワーク全体からアクセスできるOllamaまたはOpenAI互換APIを1つ中央に用意したい場合、それは別途判断すべきデプロイメント上の選択です。

これは、PAIRを完全なホームサーバープラットフォームではなく、ルーティング層として扱うべきもう1つの理由です。

PAIRが推論にPCを使用する場合、ホームサーバーはどこに位置付けられるのでしょうか?

PAIRによってコンピューティングはより柔軟になりますが、実用的なAIシステムの他の部分は、引き続き永続性の恩恵を受けます。

GPUノードはスリープしたり、ビジー状態になったり、ネットワークから離脱したり、異なるモデルに特化したりする可能性があります。長期稼働するサービスには、別の要件があります。

永続的なローカルサーバーには、次のものを引き続き保存できます。

  • エージェントのランタイムとスケジュール、
  • プライベートファイル、
  • RAGインデックス、
  • ベクトルデータベース、
  • タスクの状態、
  • ログ、
  • モデルアーカイブ、
  • そしてバックアップです。

これにより、弾力的なコンピューティング永続状態を区別できるようになります。PAIRは前者の問題に対応し、ホームサーバーは後者を担い続けることができます。

この分離は、プライベートNAS AIアシスタントですでに役立っています。長期保存するファイルや検索状態を、すべてのモデル呼び出しを実行するマシンと同じ場所に置く必要はありません。

また、ローカルAIとファイルストレージについての考え方も変わります。安定したストレージサーバーは常時稼働させたまま、必要なときだけ、より強力な推論ノードを処理に参加させることができます。

より広範なハイブリッドAIエージェントアーキテクチャも、同じ原則に従います。AIシステムのすべての部分を同じマシンで実行する必要はありません。

NVIDIA PAIRによって、もはや1台の大型GPUサーバーは不要になるのでしょうか?

必ずしもそうとは限りません。PAIRは専用AIサーバーを不要にするのではなく、スケーリングについての考え方を変えるものです。

より大きなGPUシステムを購入する前に、ローカルAIユーザーは新たに次の質問をするようになりました。

ボトルネックは、より多くのメモリを必要とする1つのモデルですか、それとも同じマシン上で競合する多数の推論ジョブですか?

問題が1つの大きすぎるモデルである場合、PAIRのリクエストルーティングによってVRAMがプールされるわけではないため、解決できない可能性があります。

複数のエージェント、複数のユーザー、複数のモデル、または1つのGPUを取り合う多数の独立したローカルAIジョブが問題なら、既存のコンピューターを推論プールに変えるほうが、はるかに有用な場合があります。

それがPAIRの本当の意義です。ローカルAIのスケールアップは、既存のマシンをより大きな1台に置き換えることだけを意味する必要はありません。ワークロードによっては、家庭やオフィスに分散しているコンピューティングリソースを、より効率的に活用することを意味します。

将来のローカルAI環境は、1台の巨大なコンピューターというより、弾力的な推論ノードのプールに囲まれた、常時稼働のホームサーバーに近いものになるかもしれません。

FAQ:NVIDIA PAIRとローカルAIクラスター

NVIDIA PAIRでは、複数のGPUのVRAMを組み合わせられますか?

いいえ。PAIRはGPUメモリをプールしたり、1つの仮想GPUを作成したりするものではありません。各推論リクエストは、要求されたモデルを提供できる、利用可能な1つのノード上で実行されます。

NVIDIA PAIRでは、1つのGPUには大きすぎるモデルを実行できますか?

通常のPAIRノード間でメモリをプールすることはできません。選択されたマシンには、要求されたモデルを読み込んで実行するのに十分なメモリが必要です。その他の分散推論技術は、別の問題を解決するものです。

NVIDIA PAIRはOllamaで動作しますか?

はい。PAIRは現在、Ollama互換のローカルプロキシを提供しており、対応するOllamaリクエストを利用可能なペアリング済みノード間でルーティングできます。

NVIDIA PAIRはLM Studioで動作しますか?

はい。PAIRは、OpenAI互換のローカルエンドポイントを介してLM Studioもサポートしています。

NVIDIA PAIRでは、MacとRTX搭載PCを組み合わせて使えますか?

はい。サポート対象のmacOS、Windows、Linuxシステムは、同じPAIRクラスターに参加できます。特定のマシンが対応していると判断する前に、NVIDIAの最新の互換性リストを確認してください。

すべてのPAIRノードに同じモデルが必要ですか?

いいえ。ノードごとに異なるモデルを保持できます。マシンは、ローカルの推論エンジンに要求されたモデルがある場合にのみリクエストを処理できますが、同じモデルを複数のノードに複製すると、ルーティングの選択肢が増えます。

NVIDIA PAIRを導入しても、専用AIサーバーは必要ですか?

ワークロードによって異なります。PAIRは、複数の独立した推論ジョブや、既存の異なるハードウェアを組み合わせて使う場合に魅力的です。一方、大規模な単一モデル、予測可能な24時間365日の推論、または密結合のマルチGPUワークロードでは、専用GPUサーバーのほうが適している場合があります。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.