Gemini 3.8 Live is om meer redenen belangrijk dan alleen spraak-AI. Google heeft realtime audio- en visuele context gecombineerd met redeneren, toolaanroepen en langer durende taken, waardoor een assistent kan blijven communiceren terwijl het werk op de achtergrond doorgaat.
Het delen van het scherm zelf is niet nieuw - Gemini Live ondersteunde het delen van de camera en het scherm al in 2025. De grotere verschuiving is dat AI steeds beter een veranderende taak kan observeren, kan blijven redeneren terwijl je praat en kan handelen zonder elke stap in een afzonderlijke prompt te moeten zetten. Dat verandert ook de vraag rond lokale AI: als een assistent je omgeving continu kan horen en zien, wat moet er dan lokaal worden gefilterd voordat er iets naar de cloud gaat?
Wat is Gemini 3.8 Live?
Google introduceerde Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking in september 2026.
Volgens de officiële aankondiging accepteren beide modellen tekst, afbeeldingen, audio en video en produceren ze tekst- of audioantwoorden. Het verschil zit in de hoeveelheid werk die ze tijdens de livesessie moeten uitvoeren.
| Gemini 3.8 Live | Live Extended Thinking | |
|---|---|---|
| Hoofddoel | Snelle realtime-interactie | Complexe live-taken met meerdere stappen |
| Redeneren | Geïnterlinieerd redeneren | Uitgebreid redeneren op de achtergrond |
| Visuele invoer | Ja | Ja |
| Audio-interactie | Ja | Ja |
| Functieaanroepen | Ondersteund | Asynchrone workflow |
| Invoercontext | 131.072 tokens | 131.072 tokens |
| Beste toepassing | Responsieve liveassistenten | Langere agenttaken terwijl het gesprek doorgaat |
Google positioneert de modeldocumentatie standaard Live voor interactie met lage latentie. Extended Thinking is interessanter wanneer een taak onderzoek, meerdere toolaanroepen, vergelijking, planning of ander werk vereist dat niet direct kan worden voltooid.
Het nieuwe onderdeel is niet het delen van het scherm - maar redeneren terwijl je blijft praten
Veel demonstraties doen Gemini 3.8 Live lijken op de eerste schermbewuste assistent van Google. Dat is het niet.
Google demonstreerde in 2025 al het delen van de camera en het scherm in Gemini Live. In de eerdere handleiding voor Gemini Live konden gebruikers objecten via de camera bespreken en inhoud bekijken die op een telefoonscherm werd weergegeven.
De belangrijke verandering in 3.8 is dus niet simpelweg dat Gemini kan zien.
Het kan live visuele en audiocontext gebruiken terwijl een langer redeneer- of tooluitvoeringsproces doorgaat.
Stel je voor dat je een assistent vraagt om reisopties te vergelijken terwijl je je vereisten verder bespreekt. Het systeem moet de vraag mogelijk begrijpen, externe diensten aanroepen, resultaten vergelijken en zijn plan aanpassen. Met uitgebreid denken hoeft dat werk de stemervaring niet te veranderen in een lange stille pauze.
Google's documentatie over denken in de Live API waarschuwt ontwikkelaars zelfs dat turnComplete: true niet noodzakelijk betekent dat de volledige agenttaak is voltooid. Redenering op de achtergrond of asynchroon toolwerk kan nog steeds worden uitgevoerd.
Dat legt een belangrijke architectuurwijziging bloot:
een gespreksbeurt en een agenttaak zijn niet langer hetzelfde.
Dit is de richting die al zichtbaar is in bredere AI-agentautomatisering: nuttige agenten houden steeds vaker de toestand bij en voeren werk in meerdere stappen uit, in plaats van telkens slechts één prompt te beantwoorden.
Waarom schermbewuste AI meer is dan herkenning van schermafbeeldingen
Een schermafbeelding geeft een AI één bevroren toestand. Een live visuele sessie geeft het een veranderende taak.
| AI voor schermafbeeldingen | Live visuele AI |
|---|---|
| De gebruiker legt handmatig één toestand vast | De visuele context verandert tijdens de sessie |
| Na elke wijziging is een nieuwe schermafbeelding nodig | De assistent kan een evoluerende taak volgen |
| De gebruiker legt uit wat er is veranderd | Het model kan nieuwe visuele informatie ontvangen |
| Goed voor geïsoleerde vragen | Beter geschikt voor begeleiding en probleemoplossing |
Dit maakt verschillende scenario's veel natuurlijker:
- handgeschreven wiskunde uitleggen terwijl de leerling werkt;
- iemand door een onbekende applicatie begeleiden;
- kijken hoe instellingen tijdens probleemoplossing veranderen;
- reageren op een evoluerende schets of een ontwerp;
- een camera gebruiken om apparatuur of fysieke objecten te bespreken.
De lanceringsdemo's van Google omvatten visuele onboarding voor werknemers, schaken vanaf een livebord, het omzetten van schetsen en gesproken instructies in interfacecode en stapsgewijze probleemoplossing. De gemeenschappelijke verbetering is niet alleen visie - het is visie die in een doorlopende taak is ingebed.
Continue context verandert de privacygrens
Bij traditionele chat is de gegevensgrens relatief duidelijk. Je typt iets of uploadt expliciet een bestand.
Een live multimodale assistent kan tijdens een actieve sessie veel bredere context ontvangen:
- microfoonaudio;
- scherminhoud;
- camerabeelden;
- meldingen die op het scherm verschijnen;
- toolresultaten;
- eerdere gesprekscontext.
De privacyvraag verandert dus van:
Heb ik dit bestand geüpload?
naar:
Wat was zichtbaar of hoorbaar terwijl de sessie actief was?
Een ontwikkelaar die een IDE deelt, kan per ongeluk een API-sleutel in een terminal blootleggen. Tijdens een sessie voor het delen van het scherm kunnen kort privé-e-mails, klantgegevens, interne dashboards of meldingen worden weergegeven die niets met de taak te maken hebben.
Daarom moet de privacygrens van een live-AI-toepassing vóór het cloudverzoek beginnen. Een lokale laag kan bepalen welke schermregio, welk bestand, welk audiosegment of welke afgeleide context het apparaat daadwerkelijk moet verlaten.
Hetzelfde principe geldt wanneer een AI-agent cloudtools gebruikt: toegang tot de cloud vereist niet dat de externe dienst onbeperkte toegang krijgt tot elk lokaal bestand of elke sensor.
Luistert Gemini 3.8 Live altijd?
Gemini omzeilt de microfoonmachtigingen van het besturingssysteem niet, en een clientapplicatie bepaalt nog steeds wanneer een Livesessie actief is.
Maar er is een belangrijk detail op API-niveau: in de documentatie met best practices voor de Live API staat dat proactieve audio permanent is ingeschakeld voor Gemini 3.8 Live en Extended Thinking.
Zolang een actieve Livesessie luistert, blijven er audio-inputtokens bijkomen.
Daardoor vormt een “altijd actieve” assistent twee problemen tegelijk:
| Ontwerpprobleem | Waarom dit belangrijk is |
|---|---|
| Privacy | De gebruiker moet weten wanneer de microfoon- of visuele opname actief is |
| Kosten | Continu luisteren zorgt voor voortdurend invoergebruik |
Een assistent die altijd actief is, heeft daarom meer nodig dan alleen een krachtig model. Er zijn goede activeringsregels, lokale filtering, een zichtbare sensorstatus en verstandig sessiebeheer nodig.
Waarom lange Gemini Live-sessies meer kunnen kosten dan de prijs per minuut doet vermoeden
Google berekent momenteel de prijs van Gemini 3.8 Live per tokenmodaliteit. In de prijsdocumentatie van de API staat ongeveer:
| Modaliteit | Betaalde API-prijs |
|---|---|
| Tekstinvoer | $0,75 / 1 miljoen tokens |
| Audio-invoer | $3 / 1 miljoen tokens, ongeveer $0,005/min |
| Afbeeldings-/video-invoer | $1 / 1 miljoen tokens, ongeveer $0,002/min |
| Tekstuitvoer | $4,50 / 1 miljoen tokens |
| Audio-uitvoer | $12 / 1 miljoen tokens, ongeveer $0,018/min |
Maar de mediaprijs per minuut is slechts een deel van de werkelijke kosten.
Livesessies behouden de gesprekscontext. Naarmate de sessie langer duurt, kan eerdere context blijven meedoen in latere beurten. Google raadt daarom contextWindowCompression voor langlopende sessies, zodat oudere geschiedenis uit het actieve venster kan worden verwijderd.
Dit leidt tot wat kan worden gezien als tokenuitbreiding van de livesessie: de assistent verwerkt niet alleen de nieuwste seconde audio of video, maar kan ook een steeds grotere gesprekscontext meenemen.
De kostenkwestie is daarom niet alleen:
Wat kost één minuut audio?
Het is:
Hoeveel context blijft de assistent hergebruiken naarmate de sessie langer wordt?
Dit is dezelfde reden waarom de kosten van hybride AI sterk afhangen van contextgrootte, modelroutering en herhaalde agentlussen, en niet alleen van de prijs per token.
Continue video zorgt voor een contextprobleem, niet alleen voor een bandbreedteprobleem
Google zegt dat native audio zich ophoopt met ongeveer 25 tokens per seconde. In de documentatie van de Live API staat ook dat continue audio-video, zonder contextcompressie, de actieve contextlimiet veel sneller bereikt dan interactie die alleen audio gebruikt.
Dat is belangrijk omdat een assistent meestal niet op elk moment elk mogelijk visueel detail nodig heeft.
Als de gebruiker bijvoorbeeld naar één foutdialoogvenster vraagt, leidt het verzenden van niet-gerelateerde delen van het bureaublad, vensters op de achtergrond en herhaaldelijk ongewijzigde frames tot meer:
- invoercontext;
- kosten;
- irrelevante visuele ruis;
- blootstelling van privacygevoelige gegevens.
De betere oplossing is niet simpelweg een groter contextvenster.
Het gaat om een betere contextselectie.
Een lokale client kan het relevante venster bijsnijden, detecteren wanneer het scherm wezenlijk verandert, gevoelige tekst redigeren of stoppen met het verzenden van frames wanneer er niets nuttigs gebeurt.
Daarmee wordt lokale verwerking een laag voor contextbeheer, in plaats van een poging om het geavanceerde model te vervangen.
Kan Gemini 3.8 Live lokaal draaien?
Er is geen officieel zelf te hosten Gemini 3.8 Live-model beschikbaar.
Google levert het model via zijn clouddiensten en de Gemini API. Er is geen downloadbaar Gemini 3.8 Live-checkpoint of ondersteunde runtime voor GPU's voor consumenten beschikbaar.
Maar “Gemini zelf kan niet lokaal worden uitgevoerd” en “de volledige assistent moet in de cloud draaien” zijn twee verschillende uitspraken.
Veel ondersteunende taken kunnen lokaal blijven:
| Werklast | Is lokale verwerking zinvol? |
|---|---|
| Detectie van een activeringswoord | Ja |
| Detectie van spraakactiviteit | Ja |
| Detectie van schermwijzigingen | Ja |
| Selectie van een schermgebied | Ja |
| Detectie van gevoelige gegevens | Ja |
| OCR | Vaak |
| Privébestanden ophalen | Bij voorkeur |
| Persoonlijk geheugen | Sterke argumenten voor lokale privacy |
| Eenvoudige opdrachten | Vaak |
| Complexe multimodale redenering | Een cloudmodel voor geavanceerde taken kan aanzienlijke meerwaarde bieden |
Een privé AI-assistent kan persoonlijke bestanden, indexen, geheugen en routinematige verwerking daarom lokaal houden en alleen geselecteerde context naar een model zoals Gemini sturen wanneer de taak geavanceerde redeneermogelijkheden vereist.
Waarom toekomstige realtime-assistenten waarschijnlijk meerdere modellen gebruiken
Gemini 3.8 Live voor elke seconde van elke taak gebruiken zou krachtig zijn, maar dit zou zelden het efficiëntste ontwerp zijn.
Een realtime-assistent heeft veel kleinere taken:
| Taak | Efficiënt startpunt |
|---|---|
| Spraak detecteren | Klein lokaal audiomodel |
| Bepalen of een verzoek actie vereist | Kleine classificator |
| Gevoelige scherminhoud identificeren | Lokale beeldverwerking of regels |
| Persoonlijke bestanden doorzoeken | Lokaal ophalen |
| Een bekende opdracht uitvoeren | Lokale automatisering |
| Een moeilijke live scène begrijpen | Geavanceerd multimodaal model |
| Een lange, complexe taak coördineren | Agent met uitgebreid denkvermogen |
Dit lijkt op de bredere strategie achter geavanceerde cloud-AI met privé lokale gegevens: het thuissysteem hoeft het geavanceerde model niet na te bootsen. Het moet bepalen welke informatie het geavanceerde model ontvangt.
Het resultaat is geen cloud-only of local-only AI.
Het is een gerouteerd systeem waarin lokale verwerking frequente, privé- en eenvoudige workloads afhandelt, terwijl dure cloudintelligentie wordt gereserveerd voor gevallen waarin die het resultaat wezenlijk verbetert.
Waarom lokale AI belangrijker wordt naarmate live AI beter wordt
Het lijkt misschien dat een sterker cloudmodel lokale AI minder relevant maakt. Gemini 3.8 Live suggereert het tegenovergestelde.
Hoe meer context een cloudassistent kan verwerken, hoe belangrijker het wordt om die context te beheersen.
Een nuttige lokale laag kan het volgende bewaren:
- persoonlijke bestanden;
- langetermijngeheugen;
- privé-retrievalindexen;
- sensorfiltering;
- eenvoudige automatiseringen;
- beslissingen met laag risico
dicht bij de gebruiker.
Het cloudmodel ontvangt alleen geselecteerde context wanneer een taak sterkere redenering vereist.
Dit verbetert ook de veerkracht. Een daadwerkelijk offline-geschikte lokale AI-workflow kan lokale retrieval, automatiseringen, geheugentoegang en basisopdrachten blijven uitvoeren, zelfs wanneer geavanceerde cloudredenering tijdelijk niet beschikbaar is.
Voor workloads die altijd actief zijn, kan lokale verwerking ook onnodig cloudgebruik verminderen. Dat is belangrijk omdat herhaalde microfoon-, scherm-, retrieval- en agentaanroepen een op het eerste gezicht goedkope API-workflow na verloop van tijd duur kunnen maken.
Gemini 3.8 Live verandert de interface naar AI
De belangrijkste verandering is niet dat Gemini natuurlijker praat of afbeeldingen nauwkeuriger herkent.
Het gaat erom dat AI steeds minder vereist dat de gebruiker een live situatie vertaalt naar een zorgvuldig voorbereide prompt.
In plaats van een interface te beschrijven:
‘Ik ben op een instellingenpagina. De tweede optie is uitgeschakeld. Waar moet ik op klikken?’
de gebruiker kan steeds vaker vragen:
‘Waarom kan ik vanaf hier niet verdergaan?’
Het model beschikt al over een deel van de ontbrekende context.
Dat vermindert de wrijving, maar vergroot ook het observatieoppervlak van de assistent. Real-time persoonlijke AI heeft daarom meer nodig dan alleen een capabel model. Er zijn duidelijke regels nodig voor welke sensoren actief zijn, welke context wordt bewaard, wat het apparaat verlaat en wanneer het de moeite waard is om cloudredenering in te schakelen.
Daarom zullen persoonlijke AI-agenten steeds vaker evenzeer infrastructuurproblemen als modelproblemen zijn.
De grotere verschuiving: lokale AI wordt de grens rond frontier-intelligentie
Gemini 3.8 Live laat zien wat er gebeurt wanneer frontier-AI persistenter en opmerkzamer wordt.
De assistent kan meer horen, meer zien, meer context onthouden, hulpmiddelen gebruiken en doorgaan met redeneren terwijl je ermee communiceert.
Dat maakt cloudintelligentie nuttiger, maar verhoogt ook de waarde van een lokale grens eromheen.
| Lokale laag | Frontier-cloudlaag |
|---|---|
| Privébestanden | Complex multimodaal redeneren |
| Persoonlijk geheugen | Lange planning in meerdere stappen |
| Scherm- en audiofiltering | Geavanceerd livegesprek |
| Lokaal ophalen | Moeilijke synthese |
| Eenvoudige automatiseringen | Waardevolle agenttaken |
| Detectie van gevoelige gegevens | Taken die cloudinferentie rechtvaardigen |
Het doel is niet om Gemini buiten de workflow te houden. Het doel is te voorkomen dat je informatie naar Gemini stuurt die het in de eerste plaats nooit nodig had.
Zodra AI continu kan zien, luisteren, redeneren en handelen, gaat lokale AI niet langer alleen over het offline uitvoeren van modellen. Het wordt de filter-, privacy-, geheugen- en routeringslaag tussen je privéwereld en frontier-intelligentie.
Veelgestelde vragen over Gemini 3.8 Live
Wat is het verschil tussen Gemini 3.8 Live en Extended Thinking?
Gemini 3.8 Live geeft prioriteit aan responsieve realtime-interactie. Extended Thinking is ontworpen voor complexere live taken waarbij redeneren en asynchroon hulpmiddelenwerk op de achtergrond kunnen doorgaan terwijl het gesprek actief blijft.
Kan Gemini 3.8 Live je scherm zien?
Gemini Live ondersteunt scherm delen, terwijl Gemini 3.8 Live visuele invoer accepteert tijdens realtime sessies. De clientapplicatie bepaalt nog steeds welk scherm of welke visuele gegevens worden vastgelegd en naar het cloudmodel van Google worden gestuurd.
Luistert Gemini 3.8 Live altijd?
Het omzeilt apparaatmachtigingen niet. Volgens de API-documentatie van Google is proactieve audio echter permanent ingeschakeld tijdens actieve Gemini 3.8 Live- en Extended Thinking-sessies, waardoor audio-invoer tokens blijft genereren zolang de sessie luistert.
Kan Gemini 3.8 Live lokaal draaien?
Er is geen officieel lokaal checkpoint of zelf te hosten runtime beschikbaar. Ondersteunende functies zoals wake-worddetectie, privé-ophalen, geheugen, OCR, schermfiltering en eenvoudige opdrachten kunnen echter lokaal worden verwerkt voordat geselecteerde context naar Gemini wordt gestuurd.
Waarom is lokale AI belangrijk als Gemini 3.8 Live capabeler is?
Omdat krachtigere live modellen meer privécontext kunnen verwerken. Een lokale laag kan persoonlijke gegevens opslaan, schermen en audio filteren, routinetaken uitvoeren en alleen de context doorsturen waarvoor daadwerkelijk redeneervermogen van frontier-cloudmodellen nodig is.
Tech & AI HUB
Meer om te lezen

Wat het nog nooit heeft gezien? Talkie-1930 en de Einstein-test
Talkie-1930 test of AI kan generaliseren buiten zijn trainingsperiode en onderscheidt redeneren van memoriseren met een kennisgrens van 1930.

ZCode Git Snapshot-incident: wat AI-codeeragenten kunnen zien, uploaden en onthouden
Het Git-snapshotincident van ZCode laat zien waarom AI-codeeragenten duidelijke datagrenzen nodig hebben voor broncode, Git-geschiedenis, geheimen, uploads naar de cloud en privacy waarbij lokale...

Grok 4.8 is een model van 2,5T - maar de nieuwe C++-stack is het grotere verhaal
Grok 4.8 combineert naar verluidt een model van 2,5 biljoen parameters met een nieuwe C++-trainingsstack en laat zien waarom frontier-AI steeds meer een infrastructuurwedstrijd...

