Gemini 3.8 Live ma znaczenie wykraczające poza AI głosową. Google połączyło dźwiękowy i wizualny kontekst w czasie rzeczywistym z rozumowaniem, wywoływaniem narzędzi i dłużej trwającymi zadaniami, dzięki czemu asystent może nadal wchodzić w interakcję, podczas gdy praca trwa w tle.
Samo udostępnianie ekranu nie jest nowością - Gemini Live już w 2025 roku obsługiwało udostępnianie obrazu z kamery i ekranu. Większa zmiana polega na tym, że AI może coraz lepiej obserwować zmieniające się zadanie, nadal rozumować podczas rozmowy i działać bez wymuszania umieszczania każdego kroku w osobnym poleceniu. Zmienia to również pytanie dotyczące lokalnej AI: jeśli asystent może nieustannie słyszeć i widzieć otoczenie, co należy odfiltrować lokalnie, zanim cokolwiek trafi do chmury?
Czym jest Gemini 3.8 Live?
Google wprowadziło modele Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking we wrześniu 2026 roku.
Zgodnie z oficjalnym ogłoszeniem Google oba modele przyjmują tekst, obrazy, dźwięk i wideo, a generują odpowiedzi tekstowe lub dźwiękowe. Różnica polega na zakresie pracy, do którego wykonania zostały zaprojektowane podczas sesji na żywo.
| Gemini 3.8 Live | Rozszerzone rozumowanie na żywo | |
|---|---|---|
| Główny cel | Szybka interakcja w czasie rzeczywistym | Złożone wieloetapowe zadania na żywo |
| Rozumowanie | Rozumowanie przeplatane | Rozumowanie rozszerzone działające w tle |
| Dane wejściowe w formie wizualnej | Tak | Tak |
| Interakcja głosowa | Tak | Tak |
| Wywoływanie funkcji | Obsługiwane | Asynchroniczny przepływ pracy |
| Kontekst wejściowy | 131 072 tokeny | 131 072 tokeny |
| Najlepsze zastosowanie | Responsywni asystenci działający na żywo | Dłuższe zadania agentowe podczas trwania rozmowy |
Dokumentacja modelu Google przedstawia standardowy tryb Live jako rozwiązanie do interakcji z niewielkimi opóźnieniami. Rozszerzone rozumowanie jest ciekawsze, gdy zadanie wymaga researchu, kilku wywołań narzędzi, porównania, planowania lub innych działań, których nie da się ukończyć natychmiast.
Nowością nie jest udostępnianie ekranu - lecz rozumowanie podczas dalszej rozmowy
Wiele demonstracji sprawia, że Gemini 3.8 Live wygląda jak pierwszy asystent Google świadomy zawartości ekranu. Tak nie jest.
Google już w 2025 roku demonstrowało funkcje Gemini Live związane z udostępnianiem obrazu z kamery i ekranu. W swoim wcześniejszym przewodniku po Gemini Live pokazało użytkownikom, jak omawiać obiekty za pomocą kamery oraz treści wyświetlane na ekranie telefonu.
Dlatego najważniejsza zmiana w wersji 3.8 nie polega po prostu na tym, że Gemini potrafi widzieć.
Może korzystać z kontekstu wizualnego i dźwiękowego na żywo, podczas gdy w tle trwa dłuższy proces rozumowania lub wykonywania narzędzi.
Wyobraź sobie, że prosisz asystenta o porównanie opcji podróży, jednocześnie nadal omawiając swoje ograniczenia. System może potrzebować zrozumieć prośbę, wywołać zewnętrzne usługi, porównać wyniki i zmienić swój plan. Dzięki rozszerzonemu myśleniu ta praca nie musi zamieniać rozmowy głosowej w długą, pełną ciszy przerwę.
Dokumentacja Google dotycząca myślenia w Live API ostrzega nawet deweloperów, że turnComplete: true nie musi oznaczać ukończenia całego zadania agenta. Rozumowanie w tle lub asynchroniczna praca narzędzi może nadal trwać.
To ujawnia ważną zmianę architektoniczną:
tura rozmowy i zadanie agenta nie są już tym samym.
Ten kierunek jest już widoczny w szerszej automatyzacji agentów AI: użyteczni agenci coraz częściej zachowują stan i wykonują wieloetapową pracę, zamiast po prostu odpowiadać na jedno polecenie naraz.
Dlaczego AI świadome ekranu to coś więcej niż rozpoznawanie zrzutów ekranu
Zrzut ekranu przekazuje AI jeden zamrożony stan. Sesja wizualna na żywo przekazuje mu zmieniające się zadanie.
| AI analizujące zrzuty ekranu | Wizja AI na żywo |
|---|---|
| Użytkownik ręcznie rejestruje jeden stan | Kontekst wizualny zmienia się podczas sesji |
| Po każdej zmianie potrzebny jest nowy zrzut ekranu | Asystent może śledzić rozwijające się zadanie |
| Użytkownik wyjaśnia, co się zmieniło | Model może odbierać nowe informacje wizualne |
| Dobre rozwiązanie do pojedynczych pytań | Lepsze rozwiązanie do wskazówek i rozwiązywania problemów |
Dzięki temu kilka scenariuszy staje się znacznie bardziej naturalnych:
- wyjaśnianie odręcznie zapisanej matematyki podczas pracy uczącego się;
- przeprowadzanie kogoś przez nieznaną aplikację;
- obserwowanie zmian ustawień podczas rozwiązywania problemów;
- reagowanie na rozwijający się szkic lub projekt;
- korzystanie z kamery w celu omawiania sprzętu lub przedmiotów fizycznych.
Prezentacje premierowe Google obejmują wizualne wdrażanie pracowników, grę w szachy na żywej planszy, przekształcanie szkiców i wypowiadanych instrukcji w kod interfejsu oraz rozwiązywanie problemów krok po kroku. Wspólną korzyścią nie jest sama wizja - chodzi o wizję osadzoną w trwającym zadaniu.
Ciągły kontekst zmienia granicę prywatności
W tradycyjnym czacie granica danych jest stosunkowo oczywista. Wpisujesz coś lub jawnie przesyłasz plik.
Asystent multimodalny działający na żywo może odbierać znacznie szerszy kontekst podczas aktywnej sesji:
- dźwięk z mikrofonu;
- zawartość ekranu;
- obrazy z kamery;
- powiadomienia pojawiające się na ekranie;
- wyniki narzędzi;
- wcześniejszy kontekst rozmowy.
Pytanie dotyczące prywatności zmienia się z:
Czy przesłałem ten plik?
do:
Co było widoczne lub słyszalne, gdy sesja była aktywna?
Deweloper udostępniający ekran IDE może przypadkowo ujawnić klucz API w terminalu. Podczas udostępniania ekranu mogą na krótko pojawić się prywatne wiadomości e-mail, dane klientów, wewnętrzne pulpity lub powiadomienia, które nie mają nic wspólnego z zadaniem.
Dlatego granica prywatności aplikacji AI działającej na żywo powinna zaczynać się przed wysłaniem żądania do chmury. Lokalna warstwa może zdecydować, który obszar ekranu, plik, fragment dźwięku lub wyprowadzony kontekst rzeczywiście musi opuścić urządzenie.
Ta sama zasada ma zastosowanie, gdy agent AI korzysta z narzędzi chmurowych: dostęp do chmury nie wymaga przyznania zdalnej usłudze nieograniczonego dostępu do każdego lokalnego pliku ani czujnika.
Czy Gemini 3.8 Live zawsze nasłuchuje?
Gemini nie omija uprawnień systemu operacyjnego do korzystania z mikrofonu, a aplikacja kliencka nadal określa, kiedy sesja Live jest aktywna.
Istnieje jednak ważny szczegół na poziomie API: dokumentacja najlepszych praktyk Live API Google’a stwierdza, że proaktywny dźwięk jest na stałe włączony w Gemini 3.8 Live i Extended Thinking.
Gdy aktywna sesja Live nasłuchuje, tokeny wejściowego dźwięku nadal się kumulują.
To sprawia, że asystent „zawsze aktywny” stanowi jednocześnie dwa problemy:
| Problem projektowy | Dlaczego ma to znaczenie |
|---|---|
| Prywatność | Użytkownik musi wiedzieć, kiedy aktywne jest przechwytywanie dźwięku z mikrofonu lub obrazu |
| Koszt | Ciągłe nasłuchiwanie powoduje ciągłe zużycie danych wejściowych |
Asystent działający nieustannie potrzebuje więc czegoś więcej niż wydajnego modelu. Wymaga dobrych reguł aktywacji, lokalnego filtrowania, widocznego stanu czujników i rozsądnego zarządzania sesją.
Dlaczego długie sesje Gemini Live mogą kosztować więcej, niż sugeruje cena za minutę
Google obecnie wycenia Gemini 3.8 Live według modalności tokenów. W jego dokumentacji cenowej API podano w przybliżeniu:
| Modalność | Cena płatnego API |
|---|---|
| Wejście tekstowe | 0,75 USD / 1 mln tokenów |
| Wejście audio | 3 USD / 1 mln tokenów, około 0,005 USD/min |
| Wejście obrazu/wideo | 1 USD / 1 mln tokenów, około 0,002 USD/min |
| Wyjście tekstowe | 4,50 USD / 1 mln tokenów |
| Wyjście audio | 12 USD / 1 mln tokenów, około 0,018 USD/min |
Jednak cena multimediów naliczana za minutę to tylko część rzeczywistego kosztu.
Sesje na żywo zachowują kontekst rozmowy. W miarę rozwoju sesji wcześniejszy kontekst może nadal uczestniczyć w kolejnych turach. Dlatego Google zaleca contextWindowCompression w przypadku długotrwałych sesji, aby można było usuwać starszą historię z aktywnego okna.
Tworzy to zjawisko, które można określić jako narastanie tokenów aktywnej sesji: asystent przetwarza nie tylko najnowszą sekundę dźwięku lub obrazu, ale może też przechowywać coraz większy stan konwersacji.
Pytanie o koszt nie brzmi więc tylko:
Ile kosztuje minuta dźwięku?
To:
Ile kontekstu asystent nadal wykorzystuje, gdy sesja się wydłuża?
Z tego samego powodu koszt hybrydowej AI zależy w dużej mierze od rozmiaru kontekstu, routingu modeli i powtarzających się pętli agentów, a nie tylko od ceny tokenów.
Ciągły obraz stwarza problem z kontekstem, a nie tylko z przepustowością
Google twierdzi, że natywny dźwięk jest akumulowany w tempie około 25 tokenów na sekundę. Dokumentacja Live API Google'a również odnotowuje, że bez kompresji kontekstu ciągły dźwięk i obraz znacznie szybciej osiągają limit aktywnego kontekstu niż interakcja obejmująca wyłącznie dźwięk.
Ma to znaczenie, ponieważ asystent zwykle nie potrzebuje w każdej chwili wszystkich możliwych szczegółów wizualnych.
Na przykład jeśli użytkownik pyta o jedno okno dialogowe z błędem, przesyłanie niezwiązanych obszarów pulpitu, okien działających w tle i kolejnych niezmienionych klatek zwiększa:
- kontekst wejściowy;
- koszt;
- nieistotny szum wizualny;
- narażenie prywatności.
Lepszym rozwiązaniem nie jest po prostu większe okno kontekstu.
Lepszy dobór kontekstu.
Lokalny klient mógłby przyciąć odpowiednie okno, wykryć, kiedy ekran zmienia się w istotny sposób, zamazać poufny tekst lub przestać wysyłać klatki, gdy nic użytecznego się nie dzieje.
Dzięki temu lokalne przetwarzanie staje się warstwą kontroli kontekstu, a nie próbą zastąpienia modelu frontier.
Czy Gemini 3.8 Live może działać lokalnie?
Nie ma oficjalnie dostępnego, samodzielnie hostowanego modelu Gemini 3.8 Live.
Google udostępnia ten model za pośrednictwem swoich usług chmurowych i interfejsu Gemini API. Nie ma dostępnego do pobrania punktu kontrolnego Gemini 3.8 Live ani obsługiwanego środowiska uruchomieniowego dla konsumenckich procesorów GPU.
Jednak stwierdzenia „samo Gemini nie może działać lokalnie” i „cały asystent musi działać w chmurze” nie są równoważne.
Wiele pomocniczych zadań może pozostać lokalnych:
| Obciążenie | Czy lokalne przetwarzanie ma sens? |
|---|---|
| Wykrywanie słowa aktywującego | Tak |
| Wykrywanie aktywności głosowej | Tak |
| Wykrywanie zmian na ekranie | Tak |
| Wybór obszaru ekranu | Tak |
| Wykrywanie poufnych danych | Tak |
| OCR | Często |
| Pobieranie prywatnych plików | Najlepiej |
| Pamięć osobista | Silny argument za lokalną prywatnością |
| Proste polecenia | Często |
| Zaawansowane rozumowanie multimodalne | Chmurowy model klasy frontier może znacząco zwiększyć wartość |
Dlatego prywatny asystent AI może przechowywać osobiste pliki, indeksy, pamięć i rutynowe przetwarzanie lokalnie, wysyłając do modelu takiego jak Gemini tylko wybrany kontekst, gdy zadanie wymaga zaawansowanego rozumowania.
Dlaczego przyszli asystenci działający w czasie rzeczywistym prawdopodobnie będą korzystać z wielu modeli
Korzystanie z Gemini 3.8 Live w każdej sekundzie każdego zadania byłoby potężne, ale rzadko byłoby najwydajniejszym rozwiązaniem.
Asystent działający w czasie rzeczywistym ma wiele mniejszych zadań:
| Zadanie | Wydajny punkt wyjścia |
|---|---|
| Wykrywanie mowy | Mały lokalny model audio |
| Decydowanie, czy żądanie wymaga działania | Mały klasyfikator |
| Identyfikowanie wrażliwych treści na ekranie | Lokalne widzenie komputerowe lub reguły |
| Przeszukiwanie plików osobistych | Lokalne wyszukiwanie |
| Wykonanie znanego polecenia | Lokalna automatyzacja |
| Rozumienie trudnej sceny na żywo | Zaawansowany multimodalny model |
| Koordynowanie długiego, złożonego zadania | Agent z rozszerzonym trybem rozumowania |
Przypomina to szerszą strategię stojącą za zaawansowaną sztuczną inteligencją w chmurze z prywatnymi danymi lokalnymi: system domowy nie musi odtwarzać zaawansowanego modelu. Musi decydować, jakie informacje powinien otrzymać zaawansowany model.
Rezultatem nie jest sztuczna inteligencja wyłącznie chmurowa ani wyłącznie lokalna.
Jest to system z routingiem, w którym przetwarzanie lokalne obsługuje częste, prywatne i proste zadania, a kosztowna inteligencja w chmurze jest rezerwowana na przypadki, w których znacząco poprawia wynik.
Dlaczego lokalna sztuczna inteligencja staje się ważniejsza wraz z rozwojem AI działającej na żywo
Może się wydawać, że wydajniejszy model w chmurze sprawia, iż lokalna sztuczna inteligencja staje się mniej istotna. Gemini 3.8 Live sugeruje coś przeciwnego.
Im więcej kontekstu może przetwarzać asystent w chmurze, tym ważniejsza staje się kontrola nad tym kontekstem.
Przydatna warstwa lokalna może przechowywać:
- pliki osobiste;
- długoterminowa pamięć;
- prywatne indeksy wyszukiwania;
- filtrowanie danych z czujników;
- proste automatyzacje;
- decyzje niskiego ryzyka
blisko użytkownika.
Model w chmurze otrzymuje wybrany kontekst tylko wtedy, gdy zadanie wymaga silniejszego rozumowania.
Poprawia to również odporność systemu. Naprawdę lokalny przepływ pracy AI działający bez połączenia z internetem może nadal obsługiwać lokalne wyszukiwanie, automatyzacje, dostęp do pamięci i podstawowe polecenia, nawet gdy zaawansowane rozumowanie w chmurze jest tymczasowo niedostępne.
W przypadku zadań działających stale przetwarzanie lokalne może również ograniczyć niepotrzebne wykorzystanie chmury. Ma to znaczenie, ponieważ powtarzające się wywołania mikrofonu, ekranu, wyszukiwania i agentów mogą z czasem sprawić, że pozornie niedrogi przepływ pracy oparty na API stanie się kosztowny.
Gemini 3.8 Live zmienia sposób korzystania ze sztucznej inteligencji
Najważniejsza zmiana nie polega na tym, że Gemini mówi bardziej naturalnie lub dokładniej rozpoznaje obrazy.
Chodzi o to, że sztuczna inteligencja coraz częściej nie wymaga od użytkownika przekształcania bieżącej sytuacji w starannie przygotowany prompt.
Zamiast opisywać interfejs:
„Jestem na stronie ustawień. Druga opcja jest wyłączona. Co mam kliknąć?”
użytkownik może coraz częściej pytać:
„Dlaczego nie mogę kontynuować stąd?”
Model ma już część brakującego kontekstu.
To usuwa tarcie, ale jednocześnie poszerza obszar obserwacji asystenta. Osobista sztuczna inteligencja działająca w czasie rzeczywistym potrzebuje więc czegoś więcej niż wydajnego modelu. Potrzebuje jasnych zasad określających, które czujniki są aktywne, jaki kontekst jest zachowywany, co opuszcza urządzenie i kiedy warto wywołać rozumowanie w chmurze.
Dlatego osobiste agenty AI będą coraz częściej stanowić problem infrastrukturalny w takim samym stopniu jak problem modelu.
Większa zmiana: lokalna sztuczna inteligencja staje się granicą wokół inteligencji frontier
Gemini 3.8 Live pokazuje, co się dzieje, gdy sztuczna inteligencja frontier staje się bardziej trwała i spostrzegawcza.
Asystent może więcej słyszeć, więcej widzieć, zapamiętywać więcej kontekstu, korzystać z narzędzi i kontynuować rozumowanie podczas interakcji z Tobą.
Dzięki temu inteligencja chmurowa staje się bardziej użyteczna, ale rośnie też znaczenie lokalnej granicy wokół niej.
| Warstwa lokalna | Warstwa chmurowa Frontier |
|---|---|
| Prywatne pliki | Złożone rozumowanie multimodalne |
| Pamięć osobista | Długie planowanie wieloetapowe |
| Filtrowanie ekranu i dźwięku | Zaawansowana rozmowa na żywo |
| Lokalne wyszukiwanie | Trudna synteza |
| Proste automatyzacje | Zadania agentowe o wysokiej wartości |
| Wykrywanie poufnych danych | Zadania uzasadniające wnioskowanie w chmurze |
Celem nie jest wykluczenie Gemini z procesu. Chodzi o to, by nie wysyłać Gemini informacji, których od początku nie potrzebował.
Gdy sztuczna inteligencja potrafi stale widzieć, słuchać, rozumować i działać, lokalna sztuczna inteligencja przestaje oznaczać wyłącznie uruchamianie modeli offline. Staje się warstwą filtrowania, prywatności, pamięci i routingu między Twoim prywatnym światem a inteligencją frontier.
Najczęściej zadawane pytania dotyczące Gemini 3.8 Live
Jaka jest różnica między Gemini 3.8 Live a Extended Thinking?
Gemini 3.8 Live stawia na responsywną interakcję w czasie rzeczywistym. Extended Thinking służy do bardziej złożonych zadań na żywo, w których rozumowanie i asynchroniczna praca narzędzi mogą być kontynuowane w tle, podczas gdy rozmowa pozostaje aktywna.
Czy Gemini 3.8 Live może widzieć Twój ekran?
Gemini Live obsługuje udostępnianie ekranu, a Gemini 3.8 Live przyjmuje dane wizualne podczas sesji w czasie rzeczywistym. To aplikacja kliencka nadal decyduje, które dane z ekranu lub obrazu są przechwytywane i wysyłane do modelu Google w chmurze.
Czy Gemini 3.8 Live zawsze nasłuchuje?
Nie omija uprawnień urządzenia. Jednak dokumentacja API Google stwierdza, że proaktywny dźwięk jest trwale włączony podczas aktywnych sesji Gemini 3.8 Live i Extended Thinking, więc wejście audio nadal generuje tokeny, gdy sesja nasłuchuje.
Czy Gemini 3.8 Live może działać lokalnie?
Nie ma oficjalnego lokalnego checkpointu ani środowiska uruchomieniowego do samodzielnego hostowania. Jednak funkcje pomocnicze, takie jak wykrywanie słowa aktywującego, prywatne wyszukiwanie, pamięć, OCR, filtrowanie ekranu i proste polecenia, mogą być przetwarzane lokalnie, zanim wybrany kontekst zostanie wysłany do Gemini.
Dlaczego lokalna sztuczna inteligencja ma znaczenie, skoro Gemini 3.8 Live jest bardziej zaawansowany?
Ponieważ bardziej zaawansowane modele działające na żywo mogą pochłaniać więcej prywatnego kontekstu. Lokalna warstwa może przechowywać dane osobowe, filtrować obraz z ekranu i dźwięk, wykonywać rutynowe zadania oraz wysyłać do chmury tylko ten kontekst, który rzeczywiście wymaga rozumowania na poziomie modeli frontier.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego obsługa wielojęzycznych osadzeń usprawnia prywatne wyszukiwanie domowe w 2026 roku?
Zobacz, jak współdzielone przestrzenie umożliwiają wyszukiwanie międzyjęzykowe, dlaczego równowaga danych treningowych ma znaczenie oraz gdzie wciąż zawodzą dokładne terminy i języki o niewielkich zasobach.

Dlaczego kompresja baz wektorowych staje się coraz ważniejsza dla domowej sztucznej inteligencji w 2026 roku?
Zobacz, jak kwantyzacja zmniejsza rozmiar wektorów, dlaczego lokalność pamięci może przyspieszyć wyszukiwanie oraz gdzie kompresja obniża odzyskiwanie wyników lub zwiększa złożoność odbudowy.

Dlaczego odzyskiwanie domowej sztucznej inteligencji w 2026 roku zmierza w kierunku skoordynowanych punktów kontrolnych modeli i indeksów?
Dowiedz się, dlaczego kopie zapasowe tworzą stan AI z mieszanymi wersjami, jak skoordynowane punkty kontrolne przywracają spójność oraz kiedy odbudowa jest lepszą metodą odzyskiwania.

