Kilka modeli lokalnych może współdzielić jeden akcelerator, gdy warstwa obsługi koordynuje rezydencję wag, pamięć dynamiczną, czas wykonywania i izolację żądań między obciążeniami.
Domowy procesor graficzny może naprzemiennie obsługiwać model konwersacyjny, model osadzania, koder wizji i rozpoznawanie mowy. Stałe załadowanie wszystkich zestawów wag może przekroczyć pojemność pamięci VRAM, natomiast wyładowywanie ich przy każdym żądaniu powoduje nieregularne opóźnienie do wygenerowania pierwszego tokenu. Kontroler wielu modeli potrzebuje zasad rezydencji, rozliczania pamięci między modelami, planowania, izolacji pamięci podręcznych, wywłaszczania i sprawiedliwego dostępu, zamiast polegać na osobnych procesach, które bez kontroli konkurują o zasoby.
Zasady rezydencji decydują o tym, które wagi pozostają rozgrzane
Kontroler śledzi rozmiar modelu, częstotliwość napływania żądań, czas ładowania, cel opóźnienia i ostatnie użycie. Popularne modele pozostają w pamięci, rzadko używane zajmują pamięć procesora lub pamięć masową, a przewidywany popyt może uruchomić wstępne rozgrzewanie, zanim kolejne żądanie dotrze do akceleratora.
wstępne rozgrzewanie wielu modeli przygotowuje uniwersalne procesy robocze GPU dla wielu modeli i koordynuje rozgrzewanie z rozmieszczaniem uwzględniającym eksmisję. Wyniki pokazują, dlaczego unikanie zimnego ładowania może znacząco skrócić czas do wygenerowania pierwszego tokenu przy przewidywalnym popycie. Różnica ta pozostaje widoczna podczas późniejszych testów domowych.
Decyzje dotyczące rezydencji powinny uwzględniać kwantyzację i warianty adapterów, ponieważ dwa pozornie podobne punkty końcowe mogą przechowywać różne wagi bazowe. Ścisły limit pamięci zapobiega temu, by proaktywne ładowanie usuwało pamięć podręczną KV aktywnych żądań. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja zacznie na nim polegać.
Koordynacja pamięci między modelami zapobiega fragmentacji pojemności
Wagi są w większości stabilne, podczas gdy aktywacje i pamięci podręczne KV rosną wraz z rozmiarem partii i długością sekwencji. Wspólny alokator może odwzorowywać strony pamięci na żądanie, odzyskiwać nieaktywne obszary i udostępniać rezerwacje, dzięki czemu jeden model nie zużyje przestrzeni obiecanej innemu.
koordynacja pamięci między modelami wprowadza koordynację pamięci między modelami wraz z dynamicznym odwzorowywaniem stron wirtualnych na fizyczne oraz zasadami współdzielenia ustalanymi w czasie działania. Projekt wyjaśnia, dlaczego zwykłe współdzielenie GPU na poziomie procesów nie potrafi dobrze reagować na szybko zmieniające się zapotrzebowanie modeli. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Współdzielenie pamięci nie oznacza współdzielenia danych. Bloki pamięci podręcznej KV, pamięci podręczne prefiksów, bufory tymczasowe i stan adapterów wymagają identyfikatorów dzierżawcy oraz modelu; w przeciwnym razie ponownie użyta strona lub klucz pamięci podręcznej może ujawnić kontekst albo zniekształcić wyniki między punktami końcowymi.
Planowanie i multipleksowanie adapterów kontrolują czas wykonywania
Planista wybiera między współdzieleniem przestrzennym, w którym modele jednocześnie zajmują pamięć, a współdzieleniem czasowym, w którym jądra wykonują się naprzemiennie. Ciągłe tworzenie partii zwiększa przepustowość, natomiast wywłaszczanie i kolejki ważone chronią interaktywne żądanie przed długim zadaniem w tle.
multipleksowanie adapterów obsługuje tysiące adapterów niskiego rzędu opartych na współdzielonych modelach bazowych, stronicując wagi adapterów i koordynując heterogeniczne partie. Pokazuje to, jak specjalizacja może współdzielić więcej stanu niż całkowicie oddzielne repliki modeli. Praktyczne znaczenie staje się widoczne, gdy kilka źródeł konkuruje o ograniczony kontekst.
Granica awarii przebiega na poziomie jąder i zakłóceń pamięci. Dwa modele, które mieszczą się jednocześnie, mogą nadal nie osiągać docelowych opóźnień, gdy konkurują o moc obliczeniową, przepustowość lub silniki kopiowania. Współdzielenie jest użyteczne tylko wtedy, gdy opóźnienie p95 i sprawiedliwość dostępu dla każdego modelu mieszczą się w założeniach polityki, a nie wtedy, gdy jedynie zagregowane wykorzystanie wygląda na wysokie.
Zbuduj macierz zakłóceń współdzielenia modeli
Zmierz każdy model osobno, a następnie uruchom każdą istotną parę oraz oczekiwany zestaw czterech modeli z krótkimi, długimi, nagłymi i działającymi w tle żądaniami. Zapisz czas zimnego ładowania, zajętą pamięć, wzrost pamięci KV, wykorzystanie jąder, przepustowość, opóźnienia p50 i p95 oraz eksmisje.
Wykorzystaj zasadę kierowanego stosu opisaną w kierowanej rezydencji modeli, aby przypisać każdemu punktowi końcowemu priorytet i klasę rezydencji. Powtórz testy z adapterami, wariantami skwantyzowanymi, ciągłym tworzeniem partii i wywłaszczaniem, sprawdzając, czy pamięci podręczne i tożsamości żądań pozostają od siebie odizolowane.
Zachowaj politykę współdzielenia tylko wtedy, gdy ważne modele interaktywne osiągają docelowe opóźnienie podczas najgorszego oczekiwanego zestawu obciążeń. Jeśli jedna para powoduje powtarzające się przeładowywanie, wykonuj ją szeregowo albo zarezerwuj przedział czasowy, zamiast zwiększać współbieżność dla lepiej wyglądającego wykresu wykorzystania.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie funkcje umożliwiają utworzenie domowej granicy zaufania AI wokół wrażliwych plików?
Zobacz, jak klasyfikacja, dostęp ograniczony zakresem uprawnień, izolowane przetwarzanie, filtry wyszukiwania, zasady kontroli danych wychodzących, zatwierdzenia i audyty chronią poufne pliki domowe.

Jakie czynniki decydują o tym, czy kopie zapasowe oparte na drzewie Merkle’a skutecznie wykrywają ciche zmiany?
Dowiedz się, jak rozmiar fragmentu, współczynnik rozgałęzienia, zaufane katalogi główne, buforowane sumy skrótów, lokalność zmian, zakres metadanych i skanowanie integralności wpływają na koszt weryfikacji...

Jakie komponenty umożliwiają weryfikowalne kopie zapasowe indeksów AI i stanu modeli?
Zobacz, jak skoordynowane migawki, manifesty treści, sumy kontrolne, blokady wersji, próby przywracania i testy zapytań dowodzą, że stan AI można rzeczywiście odzyskać.

