モデルシャーディングがホームネットワーク全体で役立つのは、メモリ負荷の軽減効果が、参加するコンピューター間で発生するアクティベーション転送、同期遅延、処理速度の不均衡を上回る場合に限られます。
40 GBのモデルは、2台のホームコンピューターのどちらにも収まらなくても、レイヤーを両方に分割すれば収まる場合があります。ただし、その場合はすべてのトークンが1つ以上の分割境界を越えてネットワークを通過するため、推論では計算処理に加えて、イーサネットのレイテンシとアクティベーションのサイズも考慮する必要があります。シャーディングを実用的にできるか、単に実行可能なだけにとどめるかは、分割形状、量子化、デバイスのバランス、同時実行性、障害復旧によって決まります。
分割戦略によってネットワークを通過するデータが決まる
パイプライン並列化では、連続するレイヤーをデバイスに割り当て、ステージの境界でアクティベーションを転送します。テンソル並列化では、通常、レイヤー内部の演算を分割し、頻繁な集合通信が必要になります。一方、エキスパート並列化では、Mixture-of-Expertsモデル内の選択されたエキスパートへトークンをルーティングします。
分散トランスフォーマーブロックは、インターネットで接続された複数のマシンにトランスフォーマーブロックを分散し、利用可能なピアを経由してリクエストをルーティングします。この設計は、異種環境での分散推論が可能であることを示す一方、通信と可用性が最優先で考慮すべき制約になることも明らかにしています。
一般的なホームイーサネットでは、通信量の多いテンソル分割よりも、大まかなパイプライン分割のほうが通常は変動に強くなります。量子化によって重みのメモリ使用量は減りますが、中間アクティベーションが同じ割合で減るとは限りません。そのため、モデルファイルのサイズだけではネットワーク需要を見積もれません。この違いは、後の家庭内テストでも確認できます。
帯域幅、レイテンシ、デバイスのバランスがトークン速度を決める
ステージは、必要なアクティベーションを受け取るまで処理を進められません。1トークンあたり8 MBを転送する境界がある場合、1 GbEリンクの理論上のシリアル化下限は、プロトコルと計算処理のオーバーヘッドを除いて約64ミリ秒です。より高速なリンクでは、この下限を短縮できます。
自動並列化計画は、異種デバイスとネットワークリンクにまたがるモデル並列実行計画を共同で探索します。これは、最適な分割がレイヤー数を均等にすることではなく、計算速度、メモリ、トポロジー、通信に左右されることを示しています。自動化を進める前に、中間結果を検証可能な状態にしておく必要があります。
定常状態のスループットは最も遅いステージによって制限され、一方、単一ユーザーのトークンレイテンシは往復が発生する境界によって大きく左右されます。平均帯域幅のテスト結果が良好でも、Wi-Fiの変動、省電力状態、バックグラウンドでのNAS転送によって、遅延の裾が広がることがあります。この境界は、現実的な動作条件で個別に測定する必要があります。
状態の調整と障害処理が信頼性を左右する
すべてのノードで、同じモデルリビジョン、トークナイザー、量子化レイアウト、分割マニフェストを使用する必要があります。チェックサムによって読み込み前にシャードを検証し、バージョン付きハンドシェイクによって、あるコンピューターが互換性のない更新版のレイヤーを提供することを防ぎます。限られたコンテキストを複数のソースが奪い合う状況では、この実際的な影響が現れます。
分離型推論ステージは、計算とメモリの需要が異なるため、プリフィルとデコーディングをデバイス間で分離します。この研究は、配置と通信がワークロードに適合する場合に限り、ステージの分散によってサービングを改善できることを示しています。この依存関係は、最終的なインターフェースでも明示しておく必要があります。
障害が発生し得る境界には、一時的な参加ノードも含まれます。スリープ中のノートパソコン、Wi-Fiのローミング、再起動によってステージの唯一のコピーへのアクセスが中断されると、リクエスト全体が停止します。レプリケーション、再開可能なチェックポイント、ローカルフォールバックによって可用性を高められますが、それぞれシャーディングで節約するはずだったメモリを消費します。
ネットワークリンクだけでなく分割構成を測定する
まず各デバイスを単独でベンチマークし、各分割境界のテンソル形状、1トークンあたりのバイト数、コピー時間、計算時間、メモリピーク、同期待ち時間を記録します。有線接続と無線接続の両方で、短いプロンプト、長いプリフィル、継続的なデコーディング、2人の同時ユーザーをテストしてください。
測定結果を、ホームネットワーク上のモデルシャードに関するNASシャードのシナリオと関連付けます。ノードの再起動、バージョン不一致、リンクの飽和、1台の低速な参加デバイスをシミュレートしながら、1秒あたりのトークン数、初回トークンレイテンシ、トークン間遅延のp95、復旧動作を追跡します。
必要なモデルを実行でき、現実的な競合状態でも許容できる遅延の裾を維持できる場合にのみ、シャーディングを使用してください。通信がボトルネックになる場合は、弱いデバイスをさらに追加するのではなく、より小さな量子化モデル、より粗い分割、またはより強力な1台のノードを選択します。
テック&AIハブ
もっと読む

機密ファイルを保護するホームAIのトラスト境界を実現する機能とは?
分類、機能範囲を限定したアクセス、分離された解析、取得フィルター、送信ポリシー、承認、監査によって、機密性の高いホームファイルをどのように保護できるかをご覧ください。

マークルツリーバックアップがサイレントな変更を効率的に検出できるかどうかを決める要因は何ですか?
チャンクサイズ、ファンアウト、信頼済みルート、キャッシュ済みハッシュ、変更の局所性、メタデータの範囲、スクラビングが、Merkleバックアップの検証コストをどのように決定するかを学びます。

AIインデックスとモデル状態の検証可能なバックアップを実現するコンポーネントとは?
調整されたスナップショット、コンテンツマニフェスト、チェックサム、バージョンロック、復元訓練、クエリテストによって、AIの状態を実際に復旧できることが証明される仕組みをご覧ください。

