Agentowe wideo Gemini wykorzystuje do 88% mniej tokenów — co to oznacza dla serwerów AI NAS i prywatnego wyszukiwania multimediów

Lauren Pan jest założycielem ZimaSpace i architektem stojącym za uznaną serią ZimaBoard. Łącząc wzornictwo przemysłowe z inżynierią wbudowaną, Lauren założył ZimaSpace z jasną misją: demokratyzacji osobistej chmury obliczeniowej. Wierzy, że sprzęt powinien być zarówno "hakerski", jak i piękny—niwelując przepaść między serwerami klasy przemysłowej a gadżetami konsumenckimi. Obecnie kieruje zespołem inżynierów tworzących narzędzia, które dają twórcom pełną kontrolę nad ich cyfrowym życiem.

Gemini Agentic Video zmienia AI do analizy wideo, pozwalając modelowi decydować, którym momentom warto poświęcić uwagę, zamiast przetwarzać cały film ze stałą częstotliwością próbkowania. Google informuje, że w testowanych zadaniach można wykorzystać do 88% mniej tokenów, obniżyć koszty nawet o 66% i poprawić jakość nawet o 7%. Najważniejsza zmiana nie polega wyłącznie na tańszej analizie wideo: Gemini może przeszukać oś czasu, przeanalizować obiecujący moment, a następnie przyjrzeć mu się ponownie z większą szczegółowością, gdy wymaga tego pytanie.

W przypadku serwera NAS przechowującego nagrania z monitoringu z wielu lat, filmów rodzinnych, spotkań lub archiwów twórców nie oznacza to, że Gemini nagle może lokalnie „oglądać” całą bibliotekę. Gemini nadal działa w chmurze Google. Ciekawsza architektura polega na tym, aby lokalnie zawęzić duże prywatne archiwum, a następnie przekazać modelowi multimodalnemu tylko te klipy lub zakresy czasu, które wymagają dokładniejszej analizy. Innymi słowy, problem infrastrukturalny sprowadza się do przekształcenia wideo w skali pamięci masowej w kontekst w skali zapytania.

Czym jest Gemini Agentic Video Understanding?

Gemini Agentic Video Understanding to tryb przetwarzania wideo, który pozwala Gemini aktywnie poruszać się po filmie zamiast ładować klatki ze stałą częstotliwością w jednym przebiegu.

Google wprowadziło tę funkcję 1 września 2026 roku. Początkowe ogłoszenie premiery obejmowało Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite; aktualna dokumentacja dla deweloperów Google wymienia również Gemini 3.8 Flash wśród modeli obsługujących agentowe przetwarzanie wideo.

Zgodnie z ogłoszeniem Google dotyczącym agentowego rozumienia wideo model łączy rozumowanie z natywnymi narzędziami wideo, aby wyszukiwać, skanować i analizować odpowiednie fragmenty obrazu, dźwięku oraz transkrypcji.

Tryb przetwarzania Jak analizuje wideo Najlepsze zastosowanie
Statyczne Pobiera klatki ze stałą częstotliwością — domyślnie 1 klatka na sekundę — i umieszcza je w kontekście w jednym przebiegu Krótkie lub przewidywalne klipy
Agentowe Dynamicznie porusza się po osi czasu i ładuje tylko odpowiednie klatki, transkrypcję lub dźwięk Długie filmy i zapytania dotyczące konkretnych momentów

To rozróżnienie jest istotne, ponieważ model nie jest już biernym obserwatorem.

Może zadać wewnętrzne pytanie w rodzaju: Gdzie powinienem zajrzeć dalej?

Dlaczego oglądanie wideo ze stałą częstotliwością 1 klatki na sekundę jest nieefektywne?

Statyczne przetwarzanie wideo jest proste i przewidywalne. Gemini próbuje próbki filmu ze stałą częstotliwością — domyślnie 1 klatka na sekundę — i przetwarza te wybrane klatki wraz z dźwiękiem.

Sprawdza się to dobrze, gdy film jest krótki. Staje się znacznie mniej atrakcyjne, gdy dane wejściowe trwają godzinę lub kilka godzin.

STATYCZNE PRZETWARZANIE WIDEO

Wideo
  |
  v
Stałe próbkowanie z częstotliwością 1 klatki na sekundę
  |
  v
Klatka 1
Klatka 2
Klatka 3
Klatka 4
...
  |
  v
Duży kontekst
  |
  v
Model
  |
  v
Odpowiedź

Aktualna dokumentacja tokenów Gemini firmy Google podaje użyteczny przykład: godzinny wykład, który przy przetwarzaniu statycznym w wysokiej rozdzielczości może wymagać około 1,08 miliona tokenów, przy przetwarzaniu agentowym może zużywać około 108 000 tokenów, zależnie od pytania i treści.

Ta różnica wynika z tego, że większość pytań nie wymaga analizowania każdej sekundy filmu.

Jeśli użytkownik zapyta: „Do jakiego wniosku doszedł prelegent w kwestii kosztów przechowywania?”, przydatne informacje mogą zajmować 90 sekund w godzinnej prezentacji.

Przetworzenie pozostałych 58 minut nie sprawi automatycznie, że odpowiedź będzie lepsza.

Dlaczego stałe próbkowanie klatek może nadal pomijać ważne zdarzenia?

Zużycie tokenów to tylko połowa problemu. Stałe próbkowanie może również analizować niewłaściwe momenty.

Wyobraź sobie nagranie z kamery bezpieczeństwa, na którym ktoś kładzie paczkę na ganku między dwiema próbkowanymi klatkami:

00:10.0
Pusty ganek
    |
    |  paczka położona tutaj
    |
00:11.0
Paczka na ganku

Widok z częstotliwością 1 klatki na sekundę może uchwycić stan przed działaniem i po nim, pomijając samo działanie.

Google szczególnie podkreśla odnajdywanie momentów z dokładnością do ułamków sekundy jako jedną z nowych możliwości Agentic Video. Model może wskazać obiecujący zakres czasowy i ponownie próbkować to okno z większą gęstością, zamiast stosować wysoką liczbę klatek na sekundę do całego nagrania.

Ten rodzaj ukierunkowanej analizy jest szczególnie istotny w przypadku lokalnie przechowywanych zdarzeń i nagrań z kamer bezpieczeństwa, gdzie jedno istotne zdarzenie może zajmować zaledwie kilka sekund wśród wielogodzinnego materiału.

Zasada jest prosta:

Więcej zasobów wizualnych przeznaczaj tam, gdzie najprawdopodobniej znajduje się odpowiedź.

Jak Gemini decyduje, które fragmenty filmu oglądać?

Agentic Video przekształca rozumienie wideo w proces iteracyjny. Zamiast wybierać jedną strategię próbkowania przed rozpoczęciem rozumowania, Gemini może zmieniać sposób analizowania danych wejściowych w miarę rozwoju zadania.

Google opisuje ten system jako wybierający, co oglądać, z jaką prędkością i za pośrednictwem jakiej modalności.

ZAPYTANIE UŻYTKOWNIKA
    |
    v
Rozumuj o tym, jakie dowody są potrzebne
    |
    v
Nawiguj po osi czasu filmu
    |
    +---------------------+
    |          |          |
    v          v          v
Transkrypt   Dźwięk      Klatki
    |          |          |
    +----------+----------+
               |
               v
      Znaleziono istotny moment?
               |
          +----+----+
          |         |
         Nie        Tak
          |         |
          v         v
 Wyszukaj ponownie   Zbadaj dokładniej
               Wyższa liczba klatek na sekundę
               Większy poziom szczegółowości
                    |
                    v
                  Odpowiedź

Tworzy to pętlę bliższą dochodzeniu niż zwykłe multimodalne monitowanie.

Transkrypt może najpierw wskazać w przybliżeniu, gdzie omawiany jest dany temat. Następnie klatki mogą zweryfikować, co pojawiło się na ekranie. Jeśli znaczenie ma szybkie zdarzenie wizualne, model może przeanalizować ten wąski fragment z większą liczbą klatek na sekundę.

Sama modalność staje się częścią decyzji dotyczącej rozumowania.

Dlaczego agentowa analiza wideo może zużywać do 88% mniej tokenów?

Agentowa analiza wideo oszczędza tokeny, pomijając multimedia, które nie przyczyniają się do udzielenia odpowiedzi. Nie kompresuje po prostu całego filmu o 88%.

Obecne informacje Google dotyczące cen wskazują, że zużycie tokenów jest zmienne, ponieważ zależy od tego, co model dynamicznie wczytuje. Na wynik wpływają złożoność zapytania, treść filmu i głębokość próbkowania.

Wynik zgłoszony przez Google Znaczenie
Do 88% mniej tokenów Selektywne wczytywanie może znacznie ograniczyć ilość multimediów umieszczanych w kontekście modelu
Do 66% niższy koszt analizy Mniejsze zużycie tokenów może obniżyć całkowity koszt, ale nie w stosunku jeden do jednego
Poprawa jakości do 7% Dynamiczna inspekcja może również odzyskać dowody pomijane przez statyczne próbkowanie

Są to wyniki Google uzyskane dla przetestowanych obciążeń wideo, a nie stałe gwarancje dla każdego wejścia.

Obecne informacje Google dotyczące cen w API Gemini wyraźnie wskazują, że liczba tokenów w agentowej analizie wideo zależy od treści wczytanej przez model, a nie tylko od pełnego czasu trwania źródłowego filmu.

Trudne pytanie, które skłania model do ponownego przeanalizowania wielu sekcji, może wymagać znacznie więcej pracy niż proste zapytanie dotyczące jednej konkretnej chwili.

Dlaczego o 88% mniej tokenów nie oznacza o 88% niższego kosztu?

Agentowa analiza wideo nadal obejmuje rozumowanie i nawigację. Może analizować transkrypty, wczytywać klatki, ponownie próbkować fragment i generować końcową odpowiedź.

Dlatego najwyższa odnotowana przez Google redukcja liczby tokenów wynosi 88%, podczas gdy najwyższa odnotowana redukcja kosztu analizy wynosi 66%.

Rachunek za tokeny może obejmować kilka rodzajów pracy:

  • oryginalny prompt tekstowy,
  • rozumowanie dotyczące nawigacji,
  • dynamicznie wczytany transkrypt,
  • klatki wczytane do inspekcji,
  • dźwięk wczytany w razie potrzeby,
  • i końcowo wygenerowana odpowiedź.

Celem nie jest więc zerowe przetwarzanie. Chodzi o to, aby przeznaczać moc obliczeniową tam, gdzie ma ona największą wartość informacyjną.

Czego agentowa analiza wideo może wykryć, czego może nie wychwycić analiza statyczna?

Google podkreśla kilka obciążeń, w których adaptacyjna inspekcja temporalna ma większe znaczenie niż samo ograniczenie liczby tokenów.

Przypadek użycia Dlaczego inspekcja agentowa pomaga
Wyszukiwanie zdarzeń trwających krócej niż sekundę Ponownie analizuje krótkie przedziały czasowe, które może pominąć próbkowanie z częstotliwością 1 klatki na sekundę
Wyszukiwanie igły w stogu siana Przeszukuje wielogodzinne nagrania bez równomiernego wczytywania każdej chwili
Wykrywanie anomalii Ponownie próbuje próbki podejrzanych okresów z większą liczbą klatek na sekundę
Zliczanie szybkich działań Może ponownie odtwarzać aktywność z różnymi częstotliwościami próbkowania
Montaż wideo Może precyzyjnie lokalizować przejścia wizualne i granice zdarzeń

Możliwości te są szczególnie istotne w przypadku kamer bezpieczeństwa, nagrań sportowych, samouczków, archiwów spotkań, nagrań ekranu i materiałów twórców.

W każdym przypadku przydatny moment może być bardzo krótki w porównaniu z całkowitym czasem trwania materiału.

Czy przetwarzanie agentowe wideo jest zawsze lepsze od statycznego?

Nie. Krótkie nagrania wideo również mogą być lepszymi kandydatami do przetwarzania statycznego.

Wskazówki optymalizacyjne Google mówią, że tryb statyczny może zapewnić szybsze pojawienie się pierwszego tokenu w przypadku klipów wrażliwych na opóźnienia, trwających mniej więcej do pięciu minut, ponieważ przetwarzanie agentowe musi przed wygenerowaniem odpowiedzi przeprowadzić rozumowanie, nawigację i wewnętrzne wywołania narzędzi.

Sytuacja Lepszy punkt wyjścia
30-sekundowy klip produktowy Statyczne
Krótki klip, w przypadku którego najważniejsze jest opóźnienie odpowiedzi Statyczne
90-minutowy wykład Agentowe
Znalezienie jednego zdarzenia w nagraniu trwającym wiele godzin Agentowe
Analiza szybkiej akcji wokół jednego znacznika czasu Agentowe
Proste podsumowanie krótkiego nagrania wideo Statyczne przetwarzanie może wystarczyć

Przydatny wniosek nie brzmi: „przetwarzanie agentowe zastępuje statyczne przetwarzanie wideo”.

Chodzi o to, że strategia przetwarzania wideo może teraz dostosowywać się do obciążenia.

Czy Gemini Agentic Video zastępuje Video RAG?

Nie. Nawigacja po wideo w czasie zapytania i trwałe wyszukiwanie nagrań wideo rozwiązują różne problemy.

Gemini Agentic Video rozpoczyna od danych wejściowych w postaci nagrania wideo i decyduje, które jego fragmenty wymagają dokładniejszej analizy. System Video RAG zazwyczaj zaczyna etap wcześniej: pomaga ustalić, które nagrania lub fragmenty z dużo większej kolekcji powinny w ogóle trafić do modelu multimodalnego.

Video RAG Agentowe rozumienie wideo
Indeksuje trwałą kolekcję Analizuje dostarczone wideo w czasie zadawania zapytania
Wyszukuje kandydujące nagrania wideo lub ich fragmenty Decyduje, jak przeanalizować tych kandydatów
Może wykorzystywać transkrypcje, OCR, metadane i embeddingi Dynamicznie wykorzystuje transkrypcję, dźwięk i klatki
Przydatne w przypadku bardzo dużych archiwów Przydatne do pogłębionego rozumowania na podstawie wybranych materiałów

To rozróżnienie potwierdzają badania nad rozumieniem długich nagrań wideo.

Badanie LongVideoBench dotyczące rozumowania na podstawie nagrań wideo trwających godzinami obejmuje 3763 nagrania wideo i 6678 pytań opatrzonych adnotacjami przez ludzi, podzielonych na 17 kategorii. Autorzy określają główne wyzwanie jako wyszukiwanie szczegółowych informacji multimodalnych z długich danych wejściowych i rozumowanie na ich podstawie.

To sformułowanie ma znaczenie: odnajdywać i rozumować, a nie po prostu „umieszczać wideo w kontekście”.

Czym Video RAG różni się od zwykłego przekazania Gemini długiego nagrania wideo?

Video RAG staje się szczególnie użyteczny, gdy kolekcja jest znacznie większa niż jedno nagranie.

Badania VideoRAG nad niezwykle długimi kolekcjami wideo analizują ten problem na zbiorze testowym obejmującym ponad 160 nagrań o łącznej długości przekraczającej 134 godziny.

Proponowany system łączy tekstowe ugruntowanie wiedzy z multimodalnym wyszukiwaniem, zamiast oczekiwać, że pojedyncze wywołanie modelu wczyta całą bibliotekę.

Sugeruje to użyteczną architekturę dwuetapową:

ETAP 1
TRWAŁE WYSZUKIWANIE WIDEO

Archiwum wideo
     |
     v
Transkrypcje
Metadane
Sceny
OCR
Osadzenia
Znaczniki czasu
     |
     v
Kandydujące nagrania wideo
Kandydujące przedziały czasowe

          |
          v

ETAP 2
AGENTOWA ANALIZA WIDEO

Wybrany fragment
     |
     v
Nawiguj
Obejrzyj ponownie
Zmień FPS
Przeanalizuj dźwięk / transkrypcję / klatki
     |
     v
Dogłębna odpowiedź

Te dwie warstwy wzajemnie się uzupełniają.

Wyszukiwanie decyduje, które nagranie wideo należy przeanalizować, a agentowe rozumienie wideo decyduje, jak dokładnie je przeanalizować.

Dlaczego duże biblioteki wideo powinny być przeszukiwane przed dogłębną analizą AI?

Osobisty serwer multimediów może przechowywać 20 TB wideo. Archiwum nagrań z monitoringu może urosnąć do znacznie większych rozmiarów. Jednak odpowiedź na pytanie użytkownika może ostatecznie zależeć od ośmiu sekund nagrania.

Ta różnica zmienia architekturę.

Model multimodalny nie powinien musieć stawać się indeksem całego archiwum.

Zamiast tego:

ARCHIWUM WIDEO 50 TB
        |
        v
Przeszukiwalny indeks lokalny
        |
        v
20 kandydujących nagrań wideo
        |
        v
3 kandydujące przedziały czasowe
        |
        v
45 sekund istotnego wideo
        |
        v
Głębokie rozumowanie multimodalne

Dokładne liczby są przykładowe, ale ta zasada skaluje się.

Problem infrastrukturalny polega na przekształceniu wideo w skali pamięci masowej w kontekst w skali zapytań.

Wraz ze wzrostem archiwum ta warstwa selekcji staje się coraz ważniejsza, a nie mniej. Nasz przewodnik po sprzęcie AI NAS do indeksowania, przetwarzania multimediów i obsługi dużych lokalnych zbiorów danych wyjaśnia, dlaczego pamięć masową, aktywna warstwa SSD, sieć i moc obliczeniowa AI powinny być dobierane jako osobne zasoby, zamiast traktować je jako jedno ogólne wymaganie AI.

Jak wyglądałby potok przetwarzania wideo AI NAS?

AI NAS, który indeksuje i rozumie przechowywane multimedia, nie musi samodzielnie uruchamiać Gemini, aby dostarczać użytecznych informacji. Może wykonywać trwałe i powtarzalne zadania najbliżej oryginalnych multimediów.

Praktyczna architektura hybrydowa mogłaby wyglądać tak:

ARCHIWUM WIDEO NAS
Oryginalne filmy
        |
        v
PRZETWARZANIE LOKALNE
Metadane plików
Transkrypcje
Granice scen
Znaczniki czasu
OCR
Miniatury
Tagi obiektów
Osadzenia
        |
        v
WYSZUKIWANIE LOKALNE
        |
        v
Kandydacki film
Kandydacki zakres czasu
        |
        v
POLITYKA / DECYZJA UŻYTKOWNIKA
        |
        +--------------------+
        |                    |
        v                    v
MODEL LOKALNY          MODEL W CHMURZE
                           |
                           v
                  Agentowa analiza wideo Gemini
                           |
                           v
                  Zaawansowane rozumowanie dotyczące wideo

To wzorzec architektury, a nie zapowiedziana integracja Google z produktami NAS.

Zaletą jest to, że pamięć masowa, indeksowanie i wnioskowanie modelu nie muszą już odbywać się na tej samej maszynie.

osobisty serwer NAS w chmurze z wieloma dyskami, taki jak ZimaCube 2 może pozostać trwałą warstwą multimediów. Lokalny procesor lub układ GPU może generować metadane. Multimodalny model w chmurze można zarezerwować do pytań, w przypadku których jego lepsze rozumowanie temporalne uzasadnia koszt przesyłania danych i korzystania z API.

W konfiguracji rozdzielonej kompaktowy lokalny serwer do indeksowania i wstępnego przetwarzania, taki jak ZimaBoard 2 może również uruchamiać usługi powiązane z pamięcią masową, bez konieczności utrzymywania wydajnej maszyny inferencyjnej aktywnej przy każdym zadaniu w tle.

Czy metadane wideo i indeksy AI powinny znajdować się obok oryginalnych plików?

Nie muszą, ale przechowywanie warstwy wyszukiwania blisko archiwum może uprościć kilka elementów prywatnego obiegu pracy z multimediami.

Lokalna warstwa danych Dlaczego przechowywać je blisko archiwum?
Metadane plików Łatwe do ponownego wygenerowania i zaktualizowania po zmianie multimediów
Transkrypcje Można je przeszukiwać bez ponownego otwierania każdego filmu
Znaczniki czasu scen Zapewnia bezpośrednie ścieżki do oryginalnych nagrań
Miniatury Umożliwia lekkie przeglądanie wizualne
Osadzenia Umożliwia wyszukiwanie semantyczne w całej kolekcji
Tekst OCR Sprawia, że znaki, slajdy, interfejsy i napisy można przeszukiwać

Stabilne ścieżki również mają znaczenie. Jeśli indeks wskazuje, że zdarzenie miało miejsce w camera-02/2026-09-01.mp4 o 18:41:12 system wyszukiwania potrzebuje niezawodnego sposobu, aby później odnaleźć ten oryginalny plik.

W przypadku długowiecznych kolekcji multimediów indeks i archiwum są więc ze sobą ściśle powiązane, nawet jeśli technicznie są przechowywane w oddzielnych bazach danych lub woluminach.

Ten sam podział pamięci masowej występuje w samodzielnie hostowanych systemach do zdjęć i filmów. Na przykład nasz przewodnik po wymaganiach sprzętowych Immich dla bibliotek zdjęć i filmów oddziela oryginały zbiorcze od wrażliwych na opóźnienia zadań związanych z bazą danych, miniaturami, uczeniem maszynowym i przetwarzaniem wideo.

Czym jest gorąca, ciepła i zimna architektura AI do wideo?

Duże archiwa wideo również nie wymagają przechowywania każdego fragmentu danych na tym samym poziomie przetwarzania.

Praktyczny projekt rozdziela trzy warstwy:

Warstwa Zawartość Priorytet
Zimne archiwum Oryginalne nagrania 4K, stare nagrania, archiwum monitoringu Pojemność i trwałość
Ciepły indeks AI Transkrypcje, znaczniki czasu, miniatury, OCR, embeddingi, tagi Możliwość wyszukiwania
Gorący zbiór roboczy Klipy kandydujące, tymczasowe kadry, fragmenty o wysokiej liczbie klatek na sekundę Szybka analiza AI
ZIMNA
20 TB oryginalnych multimediów
        |
        v
CIEPŁA
Przeszukiwalne metadane i indeksy
        |
        v
GORĄCA
Istotny klip trwający 10–60 sekund
        |
        v
MODEL AI

Taka architektura koncentruje kosztowną analizę na niewielkim ułamku oryginalnych danych.

Pozwala to również uniknąć ponownego tworzenia tych samych podstawowych metadanych za każdym razem, gdy pojawia się nowe pytanie.

Warstwy ciepła i gorąca zwykle wymagają znacznie mniejszej pojemności niż oryginalne archiwum wideo, ale mogą korzystać z szybkiej pamięci SSD do obsługi baz danych, miniatur, embeddingów, indeksów i tymczasowych klipów. Na rozszerzalnym serwerze domowym rozszerzenie PCIe do NVMe SSD dla aktywnych indeksów i pamięci podręcznych AI może oddzielić te dane robocze od zbiorczej pamięci HDD.

Czy Gemini Agentic Video może analizować prywatne nagrania z serwera NAS bez ich przesyłania?

Nie. Gemini Agentic Video to usługa chmurowa, więc treści wideo analizowane przez Gemini muszą stać się dostępne dla usługi Google.

Google obsługuje obecnie kilka metod dostarczania danych wideo, w tym przesyłanie multimediów, rejestrowanie w Cloud Storage, dane wbudowane dla małych plików oraz publiczne adresy URL YouTube.

Dokumentacja przetwarzania wideo Gemini zaleca Files API dla wielu większych lub ponownie wykorzystywanych plików multimedialnych.

Zgodnie z aktualną dokumentacją Google pliki przesłane za pośrednictwem Gemini Files API są przechowywane przez 48 godzin, a następnie automatycznie usuwane.

To zupełnie co innego niż stwierdzenie, że nagrania pozostają w sieci domowej.

Aktualna dokumentacja cenowa interfejsu API Google dla płatnych planów stwierdza również, że dane z płatnych planów nie są domyślnie wykorzystywane do ulepszania produktów Google. Deweloperzy powinni jednak ocenić wymagania dotyczące przechowywania, rejestrowania, regionu, organizacji i zgodności przed wysłaniem poufnych nagrań do zewnętrznej usługi.

Jak prywatne archiwum wideo może bardziej wybiórczo korzystać z chmurowej sztucznej inteligencji?

Hybrydowy przepływ pracy może ograniczyć ilość prywatnych multimediów wymagających przetwarzania zewnętrznego.

Pierwszy etap może pozostać lokalny:

  • identyfikować plik,
  • przeszukiwać transkrypcję,
  • filtrować według kamery lub daty,
  • wykrywać ruch lub zmiany sceny,
  • pobierać potencjalne znaczniki czasu,
  • i generować krótki klip kandydujący.

Taki podział opiera się na tej samej zasadzie, którą omówiliśmy w naszym przewodniku dotyczącym utrzymywania przetwarzania AI związanego z pamięcią masową blisko prywatnych danych: NAS może pozostać stabilną warstwą danych, nawet gdy bardziej wymagające wnioskowanie odbywa się gdzie indziej.

Dopiero wtedy proces decyduje, czy rozumowanie w chmurze jest konieczne.

PRYWATNE ARCHIWUM WIDEO
        |
        v
LOKALNE WYSZUKIWANIE + FILTROWANIE
        |
        v
Znaleziono istotny fragment
        |
        v
Czy to pytanie wymaga
silniejszego rozumowania multimodalnego?
        |
    +---+---+
    |       |
   Nie      Tak
    |       |
    v       v
 Lokalnie   Zatwierdzony klip
 odpowiedź       |
              v
        Agentowa analiza wideo Gemini

Nie sprawia to, że Gemini działa lokalnie. Sprawia natomiast, że granica danych jest węższa.

Zamiast traktować całe prywatne archiwum jako potencjalny kontekst dla chmury, system może zdecydować, które materiały wymagają dalszego przetwarzania.

Kiedy analiza wideo powinna pozostać lokalna, a kiedy przejść do Gemini?

Właściwa odpowiedź zależy od prywatności, trudności, skali, sprzętu oraz tego, jak dużo rozumowania multimodalnego wymaga zadanie.

Zadanie wideo Prawdopodobny punkt wyjścia
Wyszukiwanie frazy w transkrypcji Lokalnie
Filtrowanie nagrań według daty lub kamery Lokalnie
Generowanie miniatur Lokalnie
Podstawowe wykrywanie ruchu Lokalnie
Tworzenie reprezentacji wektorowych prywatnego archiwum Lokalnie
Znalezienie semantycznie istotnego nagrania Lokalne wyszukiwanie może być bardzo skuteczne
Interpretacja złożonej sekwencji zdarzeń Zaawansowany model multimodalny
Zlokalizowanie subtelnego działania trwającego ułamek sekundy Agentowa analiza wideo może pomóc
Rozumowanie na podstawie obrazu, mowy i kolejności w czasie Zaawansowany model multimodalny
Wysoce wrażliwe nagrania z kamer bezpieczeństwa Pozostaw lokalnie, chyba że przetwarzanie zewnętrzne jest wyraźnie akceptowalne

W przypadku wdrożeń opartych w dużej mierze na kamerach decyzja jest szczególnie ważna, ponieważ ciągłe nagrywanie i wykrywanie w czasie rzeczywistym generują różne obciążenia. Nasz przewodnik dotyczący prywatnego przechowywania NVR i lokalnej analizy wideo osobno omawia przechowywanie oraz stale działające wykrywanie, niezależnie od chmurowego rozumowania multimodalnego.

Celem nie jest maksymalizowanie ani przetwarzania lokalnego, ani chmurowego.

Chodzi o wykorzystanie najtańszej i najbezpieczniejszej warstwy, która jest w stanie rozwiązać każdą część zadania.

Czy agentowa analiza wideo Gemini zmienia to, co powinien robić NAS AI?

Tak — ale nie przez przekształcanie serwera NAS w maszynę, która musi rozumieć każdą klatkę za pomocą największego możliwego modelu multimodalnego.

Bardziej skalowalnym rozwiązaniem jest udostępnienie kolekcji multimediów do nawigacji z pomocą AI.

Oznacza to zachowanie oryginałów przy jednoczesnym utrzymywaniu:

  • przeszukiwalne transkrypcje,
  • metadane zsynchronizowane w czasie,
  • indeksy scen,
  • OCR,
  • wektory osadzeń,
  • miniatury,
  • uprawnienia,
  • oraz wiarygodne odnośniki do materiałów źródłowych.

To szersza rola opisana w artykule AI NAS jako lokalnej warstwy inteligencji dla przechowywanych danych: pamięć masowa pozostaje fundamentem, a indeksy i usługi AI ułatwiają wyszukiwanie, rozumienie i ponowne wykorzystywanie tych danych.

Gdy ta warstwa już istnieje, model odpowiedzialny za rozumowanie można wymienić.

Dziś może to być Gemini Agentic Video. Inny przepływ pracy może wykorzystywać lokalny model multimodalny. Przyszły system może łączyć kilka modeli w zależności od wymagań dotyczących prywatności, kosztu lub dokładności.

Nie powinno być konieczne przebudowywanie archiwum dla każdego modelu.

To ta sama lekcja architektoniczna, która wyłania się w przypadku innych form danych AI: model nie potrzebuje wszystkich informacji użytkownika. Potrzebuje najmniejszego poprawnego fragmentu informacji do wykonania bieżącego zadania.

W przypadku tekstu może to oznaczać kilka pobranych dokumentów.

W przypadku pamięci agenta może to być niewielki zestaw uporządkowanych plików wiedzy.

W przypadku wideo może to oznaczać dwanaście sekund ukrytych wśród pięćdziesięciu terabajtów nagrań.

Gemini Agentic Video jest ważny, ponieważ przybliża multimodalne rozumowanie do tego modelu. Zamiast traktować wideo jako jeden ogromny blok kontekstu, system może aktywnie decydować, na które fragmenty warto poświęcić uwagę.

W przypadku dużych prywatnych bibliotek multimediów kolejny krok jest jeszcze ważniejszy:

model multimodalny nie powinien stawać się indeksem. Powinien być badaczem, który pojawia się dopiero po zawężeniu wyników przez indeks.

FAQ: Gemini Agentic Video, AI NAS i prywatne wyszukiwanie multimediów

Czym jest Gemini Agentic Video Understanding?

To tryb przetwarzania wideo Gemini, który dynamicznie porusza się po osi czasu filmu, zamiast przetwarzać wszystkie próbkowane klatki w jednym statycznym przebiegu. Model może wybiórczo analizować transkrypcję, dźwięk i klatki obrazu, a także zwiększać szczegółowość próbkowania, gdy obiecujący fragment wymaga dokładniejszej analizy.

O ile mniej tokenów zużywa Gemini Agentic Video?

Google informuje o zużyciu do 88% mniejszej liczby tokenów w testowanych zadaniach związanych z długimi materiałami wideo. Nie jest to stała redukcja. Rzeczywiste zużycie tokenów zależy od filmu, złożoności zapytania oraz ilości treści, którą model zdecyduje się przeanalizować.

Czy o 88% mniej tokenów oznacza, że Gemini Agentic Video jest o 88% tańszy?

Nie. Google informuje o redukcji kosztów analizy sięgającej 66%. Przetwarzanie agentowe nadal zużywa tokeny na nawigację, rozumowanie, dynamicznie ładowaną treść wideo i końcowy wynik.

Czy Gemini Agentic Video jest dokładniejszy niż statyczne przetwarzanie wideo?

Google informuje o poprawie jakości sięgającej około 7% w testowanych benchmarkach. Korzyść ta jest szczególnie istotna, gdy model musi znaleźć krótkie zdarzenia lub konkretne dowody w długich nagraniach.

Jaką liczbę klatek na sekundę Gemini zwykle stosuje w przypadku wideo?

Domyślny tryb statycznego przetwarzania wideo Gemini próbuje klatki wizualne z częstotliwością 1 klatki na sekundę. Deweloperzy mogą skonfigurować inne częstotliwości, natomiast Agentic Video może dynamicznie zmieniać gęstość analizy poszczególnych fragmentów.

Czy Agentic Video sprawdza się lepiej w przypadku krótkich klipów?

Nie zawsze. Zgodnie ze wskazówkami Google przetwarzanie statyczne może zapewnić krótszy czas do wygenerowania pierwszego tokena w przypadku krótkich filmów, dla których ważne są opóźnienia, ponieważ tryb agentowy dodaje przed udzieleniem odpowiedzi etapy nawigacji i rozumowania.

Czy Gemini Agentic Video zastępuje Video RAG?

Nie. Video RAG może indeksować i pobierać kandydatów z dużego, trwałego archiwum. Następnie Agentic Video może dokładniej zbadać wybrany film lub segment. Pobieranie decyduje, co należy przeanalizować, a agentowe rozumowanie wideo decyduje, jak to przeanalizować.

Czy Gemini Agentic Video może działać bezpośrednio na NAS-ie?

Nie. Gemini Agentic Video jest obecnie funkcją hostowaną przez Google. NAS może przechowywać i indeksować oryginalne multimedia, ale treści wysyłane do Gemini muszą być dostępne dla usługi chmurowej Google.

Jak długo Gemini przechowuje przesłane pliki wideo?

Zgodnie z aktualną dokumentacją Google Files API przesłane pliki są przechowywane przez 48 godzin. Deweloperzy pracujący z wrażliwymi nagraniami powinni zapoznać się z najnowszymi zasadami API, rejestrowania, przechowywania i wykorzystywania danych przed przesłaniem multimediów.

Co AI NAS powinien przechowywać oprócz oryginalnych nagrań?

Przeszukiwalna warstwa multimediów może obejmować transkrypcje, sygnatury czasowe, miniatury, tekst OCR, granice scen, tagi obiektów lub zdarzeń, embeddingi i inne metadane, które pozwalają systemowi AI pobierać odpowiednie klipy bez wielokrotnego przetwarzania całego archiwum.

Czy indeksy AI wideo wymagają pamięci SSD lub NVMe?

Nie każde archiwum wideo potrzebuje NVMe do przechowywania oryginalnych plików. Duże ilości nagrań mogą pozostać na pamięci masowej nastawionej na pojemność, podczas gdy często używane bazy danych, miniatury, embeddingi, indeksy i tymczasowe klipy robocze mogą skorzystać z szybszej warstwy SSD lub NVMe. Odpowiedni układ pamięci masowej zależy od rozmiaru biblioteki, intensywności indeksowania i równoległych obciążeń.

Czy nagrania z monitoringu należy analizować lokalnie czy w chmurze?

Materiały wrażliwe są dobrym kandydatem do lokalnego filtrowania, indeksowania i podstawowej analizy. Przetwarzanie w chmurze może być przydatne w przypadku trudniejszych pytań multimodalnych, gdy użytkownik lub organizacja wyraźnie akceptuje zewnętrzny transfer danych oraz obowiązujące zasady przechowywania.

Jaka jest najlepsza architektura dla bardzo dużej biblioteki filmów AI?

Skalowalna architektura rozdziela oryginalne archiwum, trwałą warstwę przeszukiwalnych metadanych, niewielki, szybko dostępny zestaw roboczy klipów-kandydatów oraz multimodalny model rozumowania. Dzięki temu duży przechowywany zbiór zostaje przekształcony w znacznie mniejszą ilość kontekstu istotnego dla zapytania.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.