Gemini 3.8 Live spiegato: quando l’IA può guardare, parlare e pensare allo stesso tempo

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

Gemini 3.8 Live è importante per qualcosa di più dell'IA vocale. Google ha combinato il contesto audio e visivo in tempo reale con il ragionamento, le chiamate agli strumenti e le attività di più lunga durata, consentendo a un assistente di continuare a interagire mentre il lavoro prosegue in background.

La condivisione dello schermo di per sé non è una novità - Gemini Live supportava già la condivisione della fotocamera e dello schermo nel 2025. Il cambiamento più significativo è che l'IA può sempre più osservare un'attività in evoluzione, continuare a ragionare mentre parli e agire senza costringere ogni passaggio in un prompt separato. Questo cambia anche la questione dell'IA locale: se un assistente può ascoltare e vedere continuamente l'ambiente circostante, cosa dovrebbe essere filtrato localmente prima che qualsiasi dato raggiunga il cloud?

Che cos'è Gemini 3.8 Live?

Google ha introdotto Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking a settembre 2026.

Secondo l'annuncio ufficiale di Google, entrambi i modelli accettano testo, immagini, audio e video, producendo risposte testuali o audio. La differenza sta nella quantità di lavoro che sono progettati per svolgere durante la sessione live.

Gemini 3.8 Live Ragionamento esteso Live
Obiettivo principale Interazione rapida in tempo reale Attività live complesse in più passaggi
Ragionamento Ragionamento intercalato Ragionamento esteso in background
Input visivo
Interazione audio
Chiamata di funzioni Supportato Flusso di lavoro asincrono
Contesto di input 131,072 token 131,072 token
Ideale per Assistenti live reattivi Attività agentiche più lunghe mentre la conversazione continua

La documentazione del modello di Google presenta la modalità Live standard come un'interazione a bassa latenza. Il Ragionamento esteso è più interessante quando un'attività richiede ricerca, diverse chiamate agli strumenti, confronto, pianificazione o altro lavoro che non può essere completato istantaneamente.

La novità non è la condivisione dello schermo - è il ragionamento mentre continui a parlare

Molte dimostrazioni fanno sembrare Gemini 3.8 Live il primo assistente di Google in grado di comprendere lo schermo. Non lo è.

Google aveva già mostrato la condivisione della fotocamera e dello schermo in Gemini Live nel 2025. La sua precedente guida a Gemini Live mostrava agli utenti come discutere degli oggetti attraverso la fotocamera e dei contenuti visualizzati sullo schermo di un telefono.

Pertanto, l'aspetto importante del cambiamento 3.8 non è semplicemente che Gemini sia in grado di vedere.

Può utilizzare il contesto visivo e audio in tempo reale mentre continua un processo di ragionamento più lungo o l'esecuzione di strumenti.

Immagina di chiedere a un assistente di confrontare diverse opzioni di viaggio mentre continui a discutere i tuoi vincoli. Il sistema potrebbe dover comprendere la richiesta, chiamare servizi esterni, confrontare i risultati e rivedere il proprio piano. Con il ragionamento esteso, questo lavoro non deve trasformare l'esperienza vocale in una lunga pausa di silenzio.

La documentazione sul ragionamento della Live API di Google avverte persino gli sviluppatori che turnComplete: true non significa necessariamente che l'attività completa dell'agente sia terminata. Il ragionamento in background o il lavoro asincrono degli strumenti potrebbero essere ancora in corso.

Questo espone un importante cambiamento architetturale:

un turno di conversazione e un'attività dell'agente non sono più la stessa cosa.

Questa è la direzione già visibile nella più ampia automazione tramite agenti IA: gli agenti utili mantengono sempre più spesso lo stato e completano attività in più passaggi, invece di limitarsi a rispondere a una richiesta alla volta.

Perché l'IA consapevole dello schermo è più di un semplice riconoscimento degli screenshot

Uno screenshot fornisce all'IA un'unica istantanea. Una sessione visiva in tempo reale le fornisce un'attività in evoluzione.

IA basata su screenshot IA visiva in tempo reale
L'utente acquisisce manualmente uno stato Il contesto visivo cambia durante la sessione
Dopo ogni modifica serve un nuovo screenshot L'assistente può seguire un'attività in evoluzione
L'utente spiega cosa è cambiato Il modello può ricevere nuove informazioni visive
Ideale per domande isolate Più adatta alla guida e alla risoluzione dei problemi

Questo rende molto più naturali diversi scenari:

  • spiegare la matematica scritta a mano mentre lo studente lavora;
  • guidare qualcuno attraverso un'applicazione sconosciuta;
  • osservare le modifiche alle impostazioni durante la risoluzione dei problemi;
  • rispondere a uno schizzo o a un progetto in evoluzione;
  • usare una videocamera per discutere di apparecchiature o oggetti fisici.

Le demo di lancio di Google includono l'onboarding visivo dei dipendenti, una partita a scacchi su una scacchiera reale, la conversione di schizzi e istruzioni vocali in codice per interfacce e la risoluzione guidata dei problemi passo dopo passo. Il miglioramento comune non è solo la visione, ma è la visione integrata in un'attività in corso.

Il contesto continuo cambia il confine della privacy

La chat tradizionale rende il confine dei dati relativamente evidente. Digiti qualcosa o carichi esplicitamente un file.

Un assistente multimodale in tempo reale può ricevere un contesto molto più ampio durante una sessione attiva:

  • audio del microfono;
  • contenuto dello schermo;
  • fotogrammi della videocamera;
  • notifiche visualizzate sullo schermo;
  • risultati degli strumenti;
  • contesto della conversazione precedente.

La domanda sulla privacy cambia quindi da:

Ho caricato questo file?

a:

Che cosa era visibile o udibile mentre la sessione era attiva?

Uno sviluppatore che condivide un IDE potrebbe esporre accidentalmente una chiave API in un terminale. Una sessione di condivisione dello schermo potrebbe mostrare per un breve periodo email private, dati dei clienti, dashboard interne o notifiche che non hanno nulla a che fare con l'attività.

Ecco perché il limite di privacy di un'applicazione IA in tempo reale dovrebbe iniziare prima della richiesta al cloud. Un livello locale può decidere quale area dello schermo, file, segmento audio o contesto derivato debba effettivamente lasciare il dispositivo.

Lo stesso principio si applica quando un agente IA utilizza strumenti cloud: l'accesso al cloud non richiede di concedere al servizio remoto un accesso indiscriminato a ogni file o sensore locale.

Gemini 3.8 Live è sempre in ascolto?

Gemini non aggira i permessi del microfono del sistema operativo e un'applicazione client determina comunque quando una sessione Live è attiva.

Ma c'è un dettaglio importante a livello di API: la documentazione sulle procedure consigliate dell'API Live di Google afferma che l'audio proattivo è abilitato permanentemente per Gemini 3.8 Live e il ragionamento esteso.

Mentre una sessione Live attiva è in ascolto, i token dell'audio in input continuano ad accumularsi.

Questo trasforma un assistente “sempre attivo” in due problemi contemporaneamente:

Problema di progettazione Perché è importante
Privacy L'utente deve sapere quando il microfono o l'acquisizione visiva sono attivi
Costo L'ascolto continuo comporta un consumo continuo di input

Un assistente sempre attivo ha quindi bisogno di qualcosa di più di un modello potente. Servono buone regole di attivazione, filtraggio locale, stato dei sensori visibile e una gestione ragionevole della sessione.

Perché le sessioni Gemini Live prolungate possono costare più di quanto suggerisca il prezzo al minuto

Attualmente Google applica il prezzo di Gemini 3.8 Live in base alla modalità dei token. La sua documentazione sui prezzi delle API indica approssimativamente:

Modalità Prezzo API a pagamento
Input testuale 0,75 $ / 1 milione di token
Input audio 3 $ / 1 milione di token, circa 0,005 $/min
Input di immagini/video 1 $ / 1 milione di token, circa 0,002 $/min
Output testuale 4,50 $ / 1 milione di token
Output audio 12 $ / 1 milione di token, circa 0,018 $/min

Ma il prezzo dei contenuti multimediali al minuto è solo una parte del costo reale.

Le sessioni in tempo reale mantengono il contesto della conversazione. Man mano che la sessione cresce, il contesto precedente può continuare a partecipare ai turni successivi. Per questo Google consiglia compressioneDellaFinestraDiContesto per le sessioni di lunga durata, in modo da rimuovere la cronologia meno recente dalla finestra attiva.

Questo crea quello che può essere definito accumulo dei token della sessione in tempo reale: l'assistente non sta elaborando soltanto l'ultimo secondo di audio o video; potrebbe anche mantenere uno stato conversazionale sempre più ampio.

La questione dei costi quindi non riguarda soltanto:

Quanto costa un minuto di audio?

È:

Quanto contesto continua a riutilizzare l'assistente man mano che la sessione diventa più lunga?

Questo è lo stesso motivo per cui il costo dell'AI ibrida dipende fortemente dalle dimensioni del contesto, dall'instradamento dei modelli e dai cicli ripetuti degli agenti, anziché dal solo prezzo dei token.

Il video continuo crea un problema di contesto, non solo di larghezza di banda

Google afferma che l'audio nativo accumula circa 25 token al secondo. La documentazione della Live API indica inoltre che, senza compressione del contesto, l'audio-video continuo raggiunge il limite del contesto attivo molto più rapidamente rispetto all'interazione basata solo sull'audio.

Questo è importante perché un assistente generalmente non ha bisogno di ogni possibile dettaglio visivo in ogni momento.

Ad esempio, se l'utente chiede informazioni su una finestra di errore, trasmettere regioni del desktop non pertinenti, finestre sullo sfondo e fotogrammi ripetuti e invariati aumenta:

  • contesto di input;
  • costo;
  • rumore visivo irrilevante;
  • esposizione della privacy.

La soluzione migliore non consiste semplicemente in una finestra di contesto più ampia.

È una selezione migliore del contesto.

Un client locale potrebbe ritagliare la finestra pertinente, rilevare quando lo schermo cambia in modo significativo, oscurare il testo sensibile o interrompere l'invio dei fotogrammi quando non accade nulla di utile.

Ciò trasforma l'elaborazione locale in un livello di controllo del contesto, anziché in un tentativo di sostituire il modello di frontiera.

Gemini 3.8 Live può essere eseguito localmente?

Non è disponibile alcun modello Gemini 3.8 Live ufficiale per l'hosting autonomo.

Google fornisce il modello tramite i propri servizi cloud e l'API Gemini. Non esiste un checkpoint Gemini 3.8 Live scaricabile né un runtime supportato per GPU consumer.

Ma “Gemini stesso non può essere eseguito localmente” e “l'intero assistente deve essere eseguito nel cloud” sono due affermazioni diverse.

Molti carichi di lavoro di supporto possono rimanere locali:

Carico di lavoro L'elaborazione locale è sensata?
Rilevamento della parola di attivazione
Rilevamento dell'attività vocale
Rilevamento dei cambiamenti dello schermo
Selezione di una regione dello schermo
Rilevamento dei dati sensibili
OCR Spesso
Recupero di file privati Preferibilmente
Memoria personale Forte esigenza di privacy locale
Comandi semplici Spesso
Ragionamento multimodale complesso Un modello cloud di frontiera può aggiungere un valore significativo

Un assistente AI privato può quindi mantenere localmente file personali, indici, memoria ed elaborazione di routine, inviando a un modello come Gemini solo il contesto selezionato quando l'attività richiede un ragionamento di frontiera.

Perché i futuri assistenti in tempo reale probabilmente utilizzeranno più modelli

Usare Gemini 3.8 Live per ogni secondo di ogni attività sarebbe potente, ma raramente sarebbe la soluzione più efficiente.

Un assistente in tempo reale svolge molti compiti secondari:

Attività Punto di partenza efficiente
Rilevamento vocale Piccolo modello audio locale
Decidere se una richiesta richiede un'azione Piccolo classificatore
Identificare contenuti sensibili sullo schermo Visione locale o regole
Cercare nei file personali Recupero locale
Eseguire un comando noto Automazione locale
Comprendere una scena reale complessa Modello multimodale avanzato
Coordinare un'attività lunga e complessa Agente con ragionamento esteso

Questo ricorda la strategia più ampia alla base di IA cloud avanzata con dati locali privati: il sistema domestico non deve riprodurre il modello avanzato. Deve decidere quali informazioni il modello avanzato debba ricevere.

Il risultato non è un'IA esclusivamente cloud o esclusivamente locale.

È un sistema instradato in cui l'elaborazione locale gestisce i carichi frequenti, privati e semplici, mentre l'intelligenza costosa nel cloud viene riservata ai casi in cui migliora concretamente il risultato.

Perché l'IA locale diventa più importante man mano che l'IA in tempo reale migliora

Potrebbe sembrare che un modello cloud più potente renda meno rilevante l'IA locale. Gemini 3.8 Live suggerisce il contrario.

Più contesto può consumare un assistente cloud, più diventa importante controllare quel contesto.

Un utile livello locale può conservare:

  • file personali;
  • memoria a lungo termine;
  • indici di recupero privati;
  • filtraggio dei sensori;
  • automazioni semplici;
  • decisioni a basso rischio

vicino all'utente.

Il modello cloud riceve solo il contesto selezionato quando un'attività richiede un ragionamento più avanzato.

Questo migliora anche la resilienza. Un vero flusso di lavoro di IA locale in grado di funzionare offline può continuare a gestire il recupero locale, le automazioni, l'accesso alla memoria e i comandi di base anche quando il ragionamento avanzato nel cloud diventa temporaneamente indisponibile.

Per i carichi di lavoro sempre attivi, l'elaborazione locale può anche ridurre l'uso superfluo del cloud. È importante perché le chiamate ripetute a microfono, schermo, recupero dati e agenti possono rendere costoso nel tempo un flusso di lavoro API apparentemente economico.

Gemini 3.8 Live cambia l'interfaccia dell'IA

Il cambiamento più importante non è che Gemini parli in modo più naturale o riconosca le immagini con maggiore precisione.

Il punto è che l'IA richiede sempre meno che l'utente traduca una situazione reale in un prompt preparato con cura.

Invece di descrivere un'interfaccia:

«Sono in una pagina delle impostazioni. La seconda opzione è disabilitata. Su cosa devo fare clic?»

l'utente può chiedere sempre più spesso:

«Perché non posso continuare da qui?»

Il modello dispone già di parte del contesto mancante.

Questo elimina gli attriti, ma amplia anche la superficie di osservazione dell'assistente. L'IA personale in tempo reale richiede quindi più di un modello capace. Servono regole chiare su quali sensori siano attivi, quale contesto venga conservato, quali dati escano dal dispositivo e quando valga la pena ricorrere al ragionamento nel cloud.

Ecco perché gli agenti IA personali saranno sempre più problemi di infrastruttura, oltre che di modelli.

Il cambiamento più importante: l'IA locale diventa il confine attorno all'intelligenza all'avanguardia

Gemini 3.8 Live mostra cosa succede quando l'IA all'avanguardia diventa più persistente e percettiva.

L'assistente può ascoltare di più, vedere di più, ricordare più contesto, usare strumenti e continuare a ragionare mentre interagisci con lui.

Questo rende l'intelligenza cloud più utile, ma aumenta anche il valore di un confine locale che la circonda.

Livello locale Livello cloud all'avanguardia
File privati Ragionamento multimodale complesso
Memoria personale Pianificazione articolata in più passaggi
Filtraggio dello schermo e dell'audio Conversazioni live avanzate
Recupero locale Sintesi complesse
Automazioni semplici Attività agentiche ad alto valore
Rilevamento dei dati sensibili Attività che giustificano l'inferenza cloud

L'obiettivo non è tenere Gemini fuori dal flusso di lavoro. È evitare di inviargli informazioni di cui non ha mai avuto bisogno.

Quando l'IA sarà in grado di vedere, ascoltare, ragionare e agire continuamente, l'IA locale non riguarderà più soltanto l'esecuzione offline dei modelli. Diventerà il livello di filtraggio, privacy, memoria e instradamento tra il tuo mondo privato e l'intelligenza all'avanguardia.

Domande frequenti su Gemini 3.8 Live

Qual è la differenza tra Gemini 3.8 Live ed Extended Thinking?

Gemini 3.8 Live dà priorità all'interazione reattiva in tempo reale. Extended Thinking è progettato per attività live più complesse, in cui il ragionamento e il lavoro asincrono degli strumenti possono continuare in background mentre la conversazione rimane attiva.

Gemini 3.8 Live può vedere il tuo schermo?

Gemini Live supporta la condivisione dello schermo, mentre Gemini 3.8 Live accetta input visivi durante le sessioni in tempo reale. L'applicazione client determina comunque quale schermo o quali dati visivi vengono acquisiti e inviati al modello cloud di Google.

Gemini 3.8 Live ascolta sempre?

Non bypassa le autorizzazioni del dispositivo. Tuttavia, la documentazione API di Google afferma che l'audio proattivo è permanentemente abilitato durante le sessioni attive di Gemini 3.8 Live e Extended Thinking, quindi l'input audio continua a generare token mentre la sessione è in ascolto.

Gemini 3.8 Live può essere eseguito localmente?

Non è disponibile alcun checkpoint locale ufficiale né alcun runtime self-hosted. Tuttavia, funzioni di supporto come il rilevamento della parola di attivazione, il recupero privato, la memoria, l'OCR, il filtraggio dello schermo e i comandi semplici possono essere elaborati localmente prima che il contesto selezionato venga inviato a Gemini.

Perché l'IA locale è importante se Gemini 3.8 Live è più potente?

Perché i modelli live più potenti possono consumare più contesto privato. Un livello locale può archiviare dati personali, filtrare schermo e audio, eseguire attività di routine e inviare solo il contesto che richiede realmente un ragionamento cloud all'avanguardia.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.