Przetwarzanie obszaru obrazu z kamery: jak kadrowanie koncentruje obliczenia AI na użytecznych obszarach

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Przycinanie może skoncentrować obliczenia AI kamery, odrzucając nieistotne piksele i powiększając użyteczne obszary przed inferencją, ale tylko w obrębie wybranego pola.

Kamera na podjeździe może przeznaczać większość każdej klatki na niebo, ściany i zaparkowany pojazd, podczas gdy osoba zajmuje niewielki obszar przy bramie. Przetwarzanie określonego regionu lub wybranych kafelków zapewnia temu obszarowi większą część stałej rozdzielczości wejściowej modelu. Taki wybór usuwa jednak również kontekst i tworzy granice, przy których obiekty mogą zostać przycięte lub pominięte.

Przycięcie zmienia efektywną liczbę pikseli obiektu

Większość detektorów skaluje dane wejściowe do tensora o stałym rozmiarze. Po zmniejszeniu szerokiej klatki odległa osoba może zajmować zaledwie kilka pikseli. Przycięcie obszaru bramy przed skalowaniem sprawia, że ta sama osoba jest większa we współrzędnych modelu, zwiększając ilość szczegółów dostępnych dla detektora.

inferencja od zgrubnej do szczegółowej wykorzystuje strategię od zgrubnej do szczegółowej, która przewiduje obszary prawdopodobnego występowania małych obiektów i przetwarza tylko niewielkie wycinki w większej skali. W pracy odnotowano przetwarzanie mniejszej liczby pikseli niż w przypadku pełnej piramidy obrazów przy zachowaniu podobnej jakości detekcji.

Zaoszczędzone zasoby obliczeniowe mogą obsłużyć wyższą rozdzielczość regionalną, bardziej zaawansowany model lub wyższą częstotliwość próbkowania. Zysk nie wynika z magicznej kompresji: piksele spoza przyciętego obszaru są niedostępne dla danego przebiegu inferencji i nie mogą przyczynić się do wykrywania obiektów.

Kafelki zachowują szczegóły, ale zwiększają nakład pracy związany z nakładaniem i scalaniem

Stałe kafelki dzielą dużą klatkę na wycinki o rozmiarze odpowiednim dla modelu, często z nakładaniem, aby obiekt znajdujący się blisko jednej krawędzi pojawił się w całości w sąsiednim kafelku. Każdy wycinek jest przetwarzany niezależnie, a następnie współrzędne są przeliczane z powrotem, zaś nakładające się detekcje są scalane.

Struktura inferencji wspomaganej cięciem stosuje cięcie w celu poprawy wykrywania małych obiektów w różnych istniejących rodzinach detektorów. Odnotowane w niej zyski pokazują, dlaczego zachowanie lokalnej rozdzielczości może mieć znaczenie, gdy skalowanie pełnej klatki sprawia, że obiekty stają się zbyt małe. To rozróżnienie pozostaje widoczne podczas późniejszych testów w warunkach domowych.

Większa liczba kafelków zwiększa liczbę wywołań inferencji, natomiast niewystarczające nakładanie przycina obiekty, a nadmierne nakładanie tworzy duplikaty. Tłumienie niemaksymalne lub scalanie uwzględniające śledzenie musi uzgodnić ramki reprezentujące ten sam obiekt w sąsiednich przycięciach. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja podejmie dalsze działania.

Stałe regiony zawodzą, gdy użyteczna aktywność się przemieszcza

Region wyznaczony wokół werandy działa tylko wtedy, gdy ważne zdarzenia nadal zachodzą w tym miejscu. Paczka umieszczona tuż za wielokątem, zmiana kąta kamery, korekcja obiektywu lub osoba zbliżająca się niespodziewaną trasą mogą znaleźć się poza przetwarzanymi pikselami.

System adaptacyjnego przetwarzania regionów z 2026 roku koncentruje szczegółową detekcję na automatycznie wybieranych obszarach i przedstawia kompromis między szybkością a dokładnością w porównaniu z równomiernym cięciem. Wskazuje również rzadkie cele i progi generowania regionów jako warunki prowadzące do błędów. Tę granicę należy mierzyć osobno w realistycznych warunkach działania.

Granica dotyczy zakresu pokrycia: wykluczenie tła zmniejsza nakład pracy tylko dlatego, że wykluczone piksele otrzymują mniej analiz lub nie są analizowane wcale. Zastosowania związane z bezpieczeństwem, ochroną obwodową i wykrywaniem nowych zdarzeń mogą wymagać niskokosztowego przebiegu pełnej klatki, który wyznacza dynamiczne regiony zamiast stosować trwałe, sztywne przycięcia.

Porównaj pełne klatki z inferencją uwzględniającą regiony

Oznacz zdarzenia wewnątrz proponowanych regionów, na ich granicach i tuż poza nimi, uwzględniając małe osoby, pojazdy, zwierzęta, cienie i ruch nocą. Uruchom tryby pełnej klatki, statycznego przycięcia, kafelkowania oraz działania od zgrubnego do szczegółowego, używając tego samego detektora, i zmierz czułość, zduplikowane ramki, opóźnienie oraz liczbę przetwarzanych pikseli.

Uwzględnij przypadki szerokokątne opisane w ograniczeniach kamer szerokokątnych, ponieważ zniekształcenia i korekcja obiektywu mogą przesunąć obiekt względem zapisanego wielokąta. Analizuj pominięcia według lokalizacji, zamiast polegać na jednym uśrednionym wyniku detekcji.

Stosuj przycinanie tylko wtedy, gdy zaoszczędzone zasoby przynoszą mierzalną korzyść bez niedopuszczalnych martwych stref. Zachowaj lekką procedurę wykrywania na pełnej klatce, gdy aktywność może się przemieszczać, i dodaj nakładanie lub margines tam, gdzie przycinanie na granicach powoduje powtarzalne pominięcia.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.