Dlaczego rozdzielczość obrazu zmienia obciążenie multimodalnej domowej sztucznej inteligencji?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Rozdzielczość obrazu zmienia obciążenie multimodalnej sztucznej inteligencji, ponieważ większe obrazy wejściowe zwykle generują więcej fragmentów, przycięć, tokenów i operacji związanych z mechanizmem uwagi przed wygenerowaniem tekstu.

Domowy serwer AI może szybko odpowiedzieć na podstawie pomniejszonego zdjęcia z telefonu, ale zwolnić przy zrzucie ekranu w pełnej rozdzielczości, zeskanowanej stronie, panoramie lub żądaniu obejmującym wiele obrazów. Oryginalna liczba pikseli nie zawsze trafia bezpośrednio do modelu językowego; koder wizyjny zmienia rozmiar obrazu, przycina go, dzieli na kafelki i konwertuje na tokeny wizualne. Wybrana strategia wstępnego przetwarzania decyduje o tym, ile drobnych szczegółów zostanie zachowanych oraz ile mocy obliczeniowej, pamięci, miejsca w kontekście i czasu oczekiwania pochłonie żądanie.

Transformatory wizyjne konwertują piksele na tokeny fragmentów

Koder wizyjny zwykle dzieli obraz na fragmenty o stałym rozmiarze, przekształca każdy fragment w osadzenie, a następnie przetwarza powstałą sekwencję za pomocą warstw transformera.

Artykuł dotyczący Vision Transformera traktuje obraz jako sekwencję fragmentów, a nie jako jeden niepodzielny element wejściowy.

Przy stałym rozmiarze fragmentu zwiększenie zarówno szerokości, jak i wysokości obrazu tworzy proporcjonalnie więcej fragmentów. Podwojenie obu wymiarów może więc skutkować około czterokrotnie większą liczbą surowych fragmentów przed późniejszym grupowaniem lub kompresją.

Wstępne przetwarzanie może zmniejszyć obraz i utracić piksele albo zachować je dzięki kafelkowaniu

Niektóre potoki zmieniają rozmiar każdego obrazu do jednej, stałej rozdzielczości kodera. Liczba tokenów pozostaje wtedy stabilna, ale podczas zmniejszania mogą zniknąć drobny tekst i niewielkie obiekty.

LLaVA-UHD wykorzystuje dzielenie w natywnej rozdzielczości, aby dzielić duże obrazy na sekcje o zmiennym rozmiarze i porządkować powstałe tokeny wizualne.

Kafelkowanie zachowuje lokalne szczegóły dzięki przetwarzaniu kilku przyciętych fragmentów, ale każde dodatkowe przycięcie powtarza pracę kodera wizyjnego i dostarcza modelowi językowemu kolejne tokeny lub skompresowane cechy.

Dwa pliki o tej samej liczbie megapikseli mogą również otrzymać różne układy przycięć, ponieważ współczynnik proporcji oraz reguły wyboru siatki stosowane przez środowisko uruchomieniowe wpływają na wymaganą liczbę kafelków.

Wyższa rozdzielczość może zwielokrotnić liczbę tokenów wizualnych w modelu językowym

Po zakodowaniu obrazu projektor konwertuje cechy obrazu na tokeny zgodne z modelem językowym. Tokeny te zajmują pozycje w kontekście wraz z tekstem użytkownika i wygenerowaną odpowiedzią.

LLaVA-OneVision informuje, że jego etapy AnyRes zwiększają liczbę tokenów wizualnych wraz ze wzrostem obsługiwanej rozdzielczości.

Większa liczba tokenów wizualnych zwiększa obciążenie wstępnego przetwarzania promptu, zapotrzebowanie na pamięć podręczną KV oraz część kontekstu zajmowaną przez obraz zamiast instrukcji użytkownika lub pobranych dokumentów.

Obraz w wysokiej rozdzielczości może więc spowolnić część językową nawet po zakończeniu pracy kodera wizyjnego.

-15% OFF

Koszt mechanizmu uwagi zależy od miejsca kompresji tokenów

Jeśli koder wizyjny przetwarza każdy fragment z pełnym mechanizmem samo-uwagi, jego koszt wewnętrzny może szybko rosnąć wraz ze wzrostem liczby fragmentów. Jeśli model językowy otrzymuje każdy token wizualny, rośnie również multimodalne wstępne przetwarzanie.

Badania nad przyspieszaniem przetwarzania obrazów w wysokiej rozdzielczości wskazują, że AnyRes może tworzyć od trzech do pięciu razy więcej tokenów niż przetwarzanie w niższej rozdzielczości.

Grupowanie tokenów, resampling, wyuczona kompresja i selektywne ponowne przetwarzanie przycięć mogą skrócić sekwencję, zanim trafi ona do modelu językowego. Oszczędność obliczeń zależy od tego, czy kompresja następuje przed kosztownym etapem, czy po nim.

Wysoka rozdzielczość ogranicza możliwości jednoczesnej obsługi domowej AI

Żądanie dotyczące dużego obrazu może zajmować pamięć kodera wizyjnego, tymczasowe tensory obrazu, pamięć podręczną KV modelu językowego i czas akceleratora, podczas gdy inne rozmowy domowników czekają.

LLaVA-Mini analizuje kompresję tokenów wizualnych, ponieważ nadmiarowe tokeny obrazu zwiększają koszt wnioskowania multimodalnego.

Przegląd lokalnej AI w ZimaSpace wskazuje, że możliwości lokalnej AI zależą od rodzaju obciążenia, a nie tylko od samej etykiety AI.

Serwer obsługujący kilka rozmów tekstowych może przyjąć mniej jednoczesnych żądań dotyczących obrazów, szczególnie gdy każdy obraz korzysta z trybu kafelkowania zapewniającego wysoki poziom szczegółowości.

Dobieraj rozdzielczość do informacji, które zadanie musi zachować

Klasyfikacja scen, wykrywanie duplikatów i ogólne oznaczanie zdjęć mogą działać po znacznym zmniejszeniu obrazu. OCR, diagramy, zrzuty interfejsów, paragony i analiza niewielkich obiektów często wymagają większej szczegółowości lub celowych przycięć.

CARES pokazuje, że adaptacyjny dobór rozdzielczości może zapobiec przetwarzaniu każdego obrazu w najwyższej dostępnej rozdzielczości.

Przetestuj kilka rozdzielczości na tych samych obrazach i pytaniach. Zapisz dokładność odpowiedzi, kompletność OCR, liczbę tokenów wizualnych, szczytowe zużycie pamięci, czas do pierwszego tokena oraz wpływ na inną jednoczesną rozmowę.

Przydatne ustawienie to najniższa rozdzielczość lub strategia przycinania, która zachowuje informacje potrzebne w danym procesie. Większa liczba pikseli jest cenna tylko wtedy, gdy model potrafi przełożyć ją na lepsze wyniki zadania.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.