Dzielenie modelu między urządzenia w sieci domowej pomaga tylko wtedy, gdy odciążenie pamięci przewyższa koszty przesyłania aktywacji, opóźnienia synchronizacji i różnicy prędkości między uczestniczącymi komputerami.
Model o rozmiarze 40 GB może nie zmieścić się na żadnym z dwóch komputerów domowych, ale może się zmieścić, gdy jego warstwy zostaną między nie podzielone. Każdy token musi wtedy przejść przez sieć w jednym lub kilku punktach podziału, dlatego opóźnienie Ethernetu i rozmiar aktywacji stają się częścią wnioskowania obok obliczeń. O tym, czy dzielenie modelu będzie użyteczne, czy tylko możliwe, decydują kształt podziału, kwantyzacja, równowaga urządzeń, współbieżność i odzyskiwanie po awarii.
Strategia podziału decyduje o tym, co przechodzi przez sieć
Równoległość potokowa przypisuje kolejne warstwy urządzeniom i przesyła aktywacje na granicach etapów. Równoległość tensorowa dzieli operacje wewnątrz warstwy i zwykle wymaga częstej komunikacji kolektywnej, natomiast równoległość ekspertów kieruje tokeny do wybranych ekspertów w modelach typu mixture-of-experts.
rozproszone bloki transformera rozdzielają bloki transformera między maszyny połączone przez internet i kierują żądania do dostępnych uczestników. Ich konstrukcja dowodzi, że heterogeniczne rozproszone wnioskowanie jest możliwe, a jednocześnie pokazuje, że komunikacja i dostępność są ograniczeniami pierwszoplanowymi.
W przypadku zwykłego domowego Ethernetu grube podziały potokowe są zazwyczaj bardziej odporne niż obciążone komunikacją podziały tensorowe. Kwantyzacja zmniejsza pamięć zajmowaną przez wagi, ale może nie zmniejszać proporcjonalnie rozmiaru aktywacji pośrednich, dlatego sam rozmiar pliku modelu nie wystarcza do oszacowania zapotrzebowania na sieć. Ta różnica pozostaje widoczna podczas późniejszych testów domowych.
Przepustowość, opóźnienie i równowaga urządzeń wyznaczają szybkość generowania tokenów
Etap nie może działać dalej, dopóki nie otrzyma wymaganych aktywacji. Jeśli jedna granica przesyła 8 MB na token, łącze 1 GbE ma teoretyczny czas serializacji wynoszący około 64 milisekund, jeszcze przed uwzględnieniem narzutu protokołu i obliczeń; szybsze łącza obniżają tę wartość.
automatyczne plany równoległości wspólnie wyszukują plany wykonywania równoległego modelu na heterogenicznych urządzeniach i łączach sieciowych. Pokazuje to, dlaczego najlepszy podział zależy od szybkości obliczeń, pamięci, topologii i komunikacji, a nie od równej liczby warstw. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja będzie kontynuowana.
Najwolniejszy etap ogranicza przepustowość w stanie ustalonym, a granice wymagające komunikacji w obie strony dominują nad opóźnieniem generowania tokenu dla pojedynczego użytkownika. Zmienność Wi-Fi, tryby oszczędzania energii i transfery w tle do serwera NAS zwiększają opóźnienia ogona, nawet gdy średni test przepustowości wygląda dobrze. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Koordynacja stanu i obsługa awarii decydują o niezawodności
Wszystkie węzły muszą korzystać z tej samej wersji modelu, tokenizera, układu kwantyzacji i manifestu podziału. Sumy kontrolne weryfikują fragmenty przed załadowaniem, a wersjonowane uzgadnianie zapobiega udostępnianiu przez jeden komputer warstw z niezgodnej aktualizacji. Praktyczne konsekwencje ujawniają się, gdy kilka źródeł konkuruje o ograniczony kontekst.
rozłączne etapy wnioskowania oddzielają fazę wstępnego przetwarzania od dekodowania i uruchamiają je na różnych urządzeniach, ponieważ różnią się wymaganiami dotyczącymi obliczeń i pamięci. Praca pokazuje, że rozdzielanie etapów może usprawnić obsługę tylko wtedy, gdy rozmieszczenie i komunikacja odpowiadają charakterystyce obciążenia. Ta zależność powinna pozostać wyraźna w końcowym interfejsie.
Granica awarii dotyczy tymczasowego uczestnika. Jeśli śpiący laptop, przełączenie między punktami dostępowymi Wi-Fi lub ponowne uruchomienie przerwie działanie jedynej kopii danego etapu, całe żądanie zostanie zatrzymane. Replikacja, wznawialne punkty kontrolne lub lokalny mechanizm awaryjny mogą poprawić dostępność, ale każde z tych rozwiązań zużywa pamięć, którą dzielenie modelu miało zaoszczędzić.
Mierz podział, a nie tylko łącze sieciowe
Najpierw zmierz każde urządzenie osobno, a następnie zapisz dla każdej granicy podziału kształt tensora, liczbę bajtów na token, czas kopiowania, czas obliczeń, szczytowe zużycie pamięci i czas oczekiwania na synchronizację. Testuj krótkie prompty, długie wstępne przetwarzanie, ciągłe dekodowanie oraz dwóch równoczesnych użytkowników przez połączenia przewodowe i bezprzewodowe.
Odnieś pomiary do scenariusza fragmentów modelu na serwerze NAS opisanego w artykule fragmenty modelu w sieci domowej. Zasymuluj ponowne uruchomienie węzła, niezgodność wersji, nasycenie łącza i jednego wolnego uczestnika, śledząc liczbę tokenów na sekundę, opóźnienie do pierwszego tokenu, opóźnienie między tokenami przy percentylu p95 oraz sposób odzyskiwania.
Stosuj dzielenie modelu tylko wtedy, gdy umożliwia użycie wymaganego modelu i utrzymuje akceptowalne opóźnienie ogona przy realistycznym współdzieleniu zasobów. Jeśli dominuje komunikacja, wybierz mniejszy model po kwantyzacji, grubszy podział lub jeden wydajniejszy węzeł zamiast dodawać więcej słabych urządzeń.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie funkcje umożliwiają utworzenie domowej granicy zaufania AI wokół wrażliwych plików?
Zobacz, jak klasyfikacja, dostęp ograniczony zakresem uprawnień, izolowane przetwarzanie, filtry wyszukiwania, zasady kontroli danych wychodzących, zatwierdzenia i audyty chronią poufne pliki domowe.

Jakie czynniki decydują o tym, czy kopie zapasowe oparte na drzewie Merkle’a skutecznie wykrywają ciche zmiany?
Dowiedz się, jak rozmiar fragmentu, współczynnik rozgałęzienia, zaufane katalogi główne, buforowane sumy skrótów, lokalność zmian, zakres metadanych i skanowanie integralności wpływają na koszt weryfikacji...

Jakie komponenty umożliwiają weryfikowalne kopie zapasowe indeksów AI i stanu modeli?
Zobacz, jak skoordynowane migawki, manifesty treści, sumy kontrolne, blokady wersji, próby przywracania i testy zapytań dowodzą, że stan AI można rzeczywiście odzyskać.

