Gemini 3.8 Live est important au-delà de l'IA vocale. Google a combiné un contexte audio et visuel en temps réel avec le raisonnement, les appels d'outils et les tâches de plus longue durée, permettant à un assistant de continuer à interagir tandis que le travail se poursuit en arrière-plan.
Le partage d'écran en lui-même n'est pas nouveau - Gemini Live prenait déjà en charge le partage de caméra et d'écran en 2025. Le changement le plus important est que l'IA peut de plus en plus observer une tâche qui évolue, continuer à raisonner pendant que vous parlez et agir sans imposer que chaque étape fasse l'objet d'une invite distincte. Cela change également la question de l'IA locale : si un assistant peut entendre et voir en continu votre environnement, que faut-il filtrer localement avant que quoi que ce soit n'atteigne le cloud ?
Qu'est-ce que Gemini 3.8 Live ?
Google a présenté Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking en septembre 2026.
Selon l'annonce officielle de Google, les deux modèles acceptent du texte, des images, de l'audio et de la vidéo, tout en produisant des réponses textuelles ou audio. La différence tient à la quantité de travail qu'ils sont conçus pour effectuer pendant la session Live.
| Gemini 3.8 Live | Raisonnement étendu Live | |
|---|---|---|
| Objectif principal | Interaction rapide en temps réel | Tâches Live complexes en plusieurs étapes |
| Raisonnement | Raisonnement entrelacé | Raisonnement étendu en arrière-plan |
| Entrée visuelle | Oui | Oui |
| Interaction audio | Oui | Oui |
| Appel de fonctions | Pris en charge | Flux de travail asynchrone |
| Contexte d'entrée | 131,072 jetons | 131,072 jetons |
| Idéal pour | Assistants Live réactifs | Tâches d'agent plus longues tandis que la conversation se poursuit |
La documentation du modèle de Google présente la version Live standard comme conçue pour les interactions à faible latence. Le raisonnement étendu est plus intéressant lorsqu'une tâche nécessite des recherches, plusieurs appels d'outils, des comparaisons, une planification ou un autre travail qui ne peut pas être effectué instantanément.
La nouveauté n'est pas le partage d'écran - c'est le raisonnement pendant que vous continuez à parler
De nombreuses démonstrations donnent l'impression que Gemini 3.8 Live est le premier assistant de Google capable de comprendre l'écran. Ce n'est pas le cas.
Google avait déjà présenté le partage de caméra et d'écran de Gemini Live en 2025. Son guide Gemini Live précédent montrait des utilisateurs discutant d'objets via la caméra et du contenu affiché sur l'écran d'un téléphone.
Le changement important de la version 3.8 n'est donc pas simplement que Gemini peut voir.
Il peut utiliser un contexte visuel et audio en direct tandis qu'un processus de raisonnement plus long ou d'exécution d'outils se poursuit.
Imaginez que vous demandiez à un assistant de comparer des options de voyage tout en continuant à discuter de vos contraintes. Le système peut devoir comprendre la demande, appeler des services externes, comparer les résultats et réviser son plan. Avec la réflexion étendue, ce travail n'a pas besoin de transformer l'expérience vocale en une longue pause silencieuse.
La documentation de Google sur la réflexion de l'API Live avertit même les développeurs que turnComplete: true ne signifie pas nécessairement que la tâche complète de l'agent est terminée. Un raisonnement en arrière-plan ou un travail asynchrone avec des outils peut toujours être en cours.
Cela révèle un changement architectural important :
un tour de conversation et une tâche d'agent ne sont plus la même chose.
C'est la direction déjà visible dans l'automatisation plus large des agents IA : les agents utiles conservent de plus en plus leur état et accomplissent des tâches en plusieurs étapes au lieu de simplement répondre à une seule invite à la fois.
Pourquoi l'IA capable de comprendre l'écran va au-delà de la reconnaissance des captures d'écran
Une capture d'écran fournit à une IA un état figé. Une session visuelle en direct lui fournit une tâche qui évolue.
| IA basée sur les captures d'écran | IA visuelle en direct |
|---|---|
| L'utilisateur capture manuellement un état | Le contexte visuel change pendant la session |
| Une nouvelle capture d'écran est nécessaire après chaque changement | L'assistant peut suivre une tâche en évolution |
| L'utilisateur explique ce qui a changé | Le modèle peut recevoir de nouvelles informations visuelles |
| Adapté aux questions isolées | Mieux adapté à l'accompagnement et au dépannage |
Cela rend plusieurs scénarios beaucoup plus naturels :
- expliquer des calculs manuscrits pendant que l'apprenant travaille ;
- guider quelqu'un dans une application inconnue ;
- observer les changements de paramètres pendant un dépannage ;
- réagir à l'évolution d'un croquis ou d'une conception ;
- utiliser une caméra pour discuter d'équipements ou d'objets physiques.
Les démonstrations de lancement de Google incluent l'intégration visuelle de nouveaux employés, une partie d'échecs à partir d'un échiquier en direct, la conversion de croquis et d'instructions vocales en code d'interface, ainsi que le dépannage étape par étape. L'amélioration commune ne réside pas uniquement dans la vision : c'est la vision intégrée à une tâche en cours.
Le contexte continu redéfinit la limite de la confidentialité
Dans une conversation classique, la limite des données est relativement claire. Vous saisissez quelque chose ou téléversez explicitement un fichier.
Un assistant multimodal en direct peut recevoir un contexte bien plus large pendant une session active :
- audio du microphone ;
- contenu de l'écran ;
- images de la caméra ;
- notifications apparaissant à l'écran ;
- résultats des outils ;
- contexte de conversation antérieur.
La question de la confidentialité passe donc de :
Ai-je téléversé ce fichier ?
à :
Qu'est-ce qui était visible ou audible pendant que la session était active ?
Un développeur qui partage un environnement de développement peut accidentellement exposer une clé d’API dans un terminal. Une session de partage d’écran peut afficher brièvement des e-mails privés, des dossiers clients, des tableaux de bord internes ou des notifications sans aucun rapport avec la tâche.
C’est pourquoi la limite de confidentialité d’une application d’IA en direct devrait commencer avant la requête envoyée au cloud. Une couche locale peut déterminer quelle zone de l’écran, quel fichier, quel segment audio ou quel contexte dérivé doit réellement quitter l’appareil.
Le même principe s’applique lorsqu’un agent IA utilise des outils cloud : l’accès au cloud n’exige pas d’accorder au service distant un accès général à chaque fichier ou capteur local.
Gemini 3.8 Live est-il toujours à l’écoute ?
Gemini ne contourne pas les autorisations du microphone du système d’exploitation, et une application cliente détermine toujours quand une session Live est active.
Mais il existe un détail important au niveau de l’API : la documentation sur les bonnes pratiques de l’API Live de Google indique que l’audio proactif est activé en permanence pour Gemini 3.8 Live et Extended Thinking.
Lorsqu’une session Live active écoute, les jetons d’entrée audio continuent de s’accumuler.
Cela transforme un assistant « toujours activé » en deux problèmes à la fois :
| Problème de conception | Pourquoi c’est important |
|---|---|
| Confidentialité | L’utilisateur doit savoir quand le microphone ou la capture visuelle est actif |
| Coût | L’écoute continue entraîne une utilisation continue des entrées |
Un assistant toujours activé a donc besoin de plus qu’un modèle puissant. Il lui faut de bonnes règles d’activation, un filtrage local, un état des capteurs visible et une gestion raisonnable des sessions.
Pourquoi les longues sessions Gemini Live peuvent coûter plus cher que ne le laisse penser le tarif à la minute
Google facture actuellement Gemini 3.8 Live selon la modalité des jetons. Sa documentation sur les tarifs de l’API indique approximativement :
| Modalité | Tarif de l’API payante |
|---|---|
| Entrée texte | 0,75 $ / 1 M de jetons |
| Entrée audio | 3 $ / 1 M de jetons, soit environ 0,005 $/min |
| Entrée image/vidéo | 1 $ / 1 M de jetons, soit environ 0,002 $/min |
| Sortie texte | 4,50 $ / 1 M de jetons |
| Sortie audio | 12 $ / 1 M de jetons, soit environ 0,018 $/min |
Mais la tarification des médias à la minute ne représente qu’une partie du coût réel.
Les sessions en direct conservent le contexte de la conversation. À mesure que la session s’allonge, le contexte précédent peut continuer à intervenir dans les échanges suivants. Google recommande donc Compression de la fenêtre de contexte pour les sessions de longue durée, afin que l’historique plus ancien puisse être supprimé de la fenêtre active.
Cela crée ce que l’on peut considérer comme une accumulation de jetons de session en direct : l’assistant ne traite pas seulement la toute dernière seconde d’audio ou de vidéo ; il peut également conserver un état conversationnel de plus en plus volumineux.
La question du coût n'est donc pas seulement :
Combien coûte une minute d'audio ?
C'est :
Quelle quantité de contexte l'assistant continue-t-il de réutiliser à mesure que la session se prolonge ?
C'est la même raison pour laquelle le coût de l'IA hybride dépend fortement de la taille du contexte, du routage des modèles et des boucles répétées de l'agent, plutôt que du seul prix des jetons.
La vidéo continue crée un problème de contexte, pas seulement un problème de bande passante
Google indique que l'audio natif s'accumule à raison d'environ 25 jetons par seconde. Sa documentation sur l'API Live précise également que, sans compression du contexte, un flux audio-vidéo continu atteint la limite de contexte actif bien plus rapidement qu'une interaction audio uniquement.
C'est important, car un assistant n'a généralement pas besoin de chaque détail visuel possible à chaque instant.
Par exemple, si l'utilisateur pose une question sur une seule boîte de dialogue d'erreur, transmettre les zones non pertinentes du bureau, les fenêtres en arrière-plan et des images répétées et inchangées augmente :
- le contexte d'entrée ;
- le coût ;
- le bruit visuel non pertinent ;
- l'exposition des données privées.
La meilleure solution n'est pas simplement une fenêtre de contexte plus grande.
Il s'agit d'une meilleure sélection du contexte.
Un client local pourrait recadrer la fenêtre pertinente, détecter les changements significatifs à l'écran, masquer les informations sensibles ou cesser d'envoyer des images lorsqu'aucune information utile n'est présentée.
Cela fait du traitement local une couche de contrôle du contexte plutôt qu'une tentative de remplacer le modèle de pointe.
Gemini 3.8 Live peut-il fonctionner localement ?
Aucun modèle Gemini 3.8 Live officiel auto-hébergé n'est disponible.
Google fournit le modèle via ses services cloud et l'API Gemini. Il n'existe aucun point de contrôle Gemini 3.8 Live téléchargeable ni aucun environnement d'exécution pris en charge pour les GPU grand public.
Mais « Gemini lui-même ne peut pas fonctionner localement » et « l'assistant entier doit fonctionner dans le cloud » sont deux affirmations différentes.
De nombreuses tâches auxiliaires peuvent rester locales :
| Charge de travail | Le traitement local est-il pertinent ? |
|---|---|
| Détection du mot d'activation | Oui |
| Détection de l'activité vocale | Oui |
| Détection des changements à l'écran | Oui |
| Sélection d'une zone de l'écran | Oui |
| Détection des données sensibles | Oui |
| OCR | Souvent |
| Récupération de fichiers privés | De préférence |
| Mémoire personnelle | La confidentialité locale est un argument majeur |
| Commandes simples | Souvent |
| Raisonnement multimodal complexe | Le modèle cloud de pointe peut apporter une valeur considérable |
Un assistant IA privé peut donc conserver localement les fichiers personnels, les index, la mémoire et le traitement courant, tout en n'envoyant à un modèle tel que Gemini que le contexte sélectionné lorsque la tâche nécessite un raisonnement de pointe.
Pourquoi les futurs assistants en temps réel utiliseront probablement plusieurs modèles
Utiliser Gemini 3.8 Live pour chaque seconde de chaque tâche serait puissant, mais ce serait rarement la conception la plus efficace.
Un assistant en temps réel a de nombreuses tâches secondaires :
| Tâche | Point de départ efficace |
|---|---|
| Détecter la parole | Petit modèle audio local |
| Déterminer si une demande nécessite une action | Petit classificateur |
| Identifier le contenu sensible à l’écran | Vision locale ou règles |
| Rechercher dans les fichiers personnels | Recherche locale |
| Exécuter une commande connue | Automatisation locale |
| Comprendre une scène en direct difficile | Modèle multimodal avancé |
| Coordonner une tâche longue et complexe | Agent à raisonnement approfondi |
Cela ressemble à la stratégie plus large qui sous-tend l’IA cloud avancée avec des données locales privées : le système domestique n’a pas besoin de reproduire le modèle avancé. Il doit décider quelles informations le modèle avancé doit recevoir.
Le résultat n’est ni une IA exclusivement cloud ni une IA exclusivement locale.
Il s’agit d’un système à routage dans lequel le traitement local gère les tâches fréquentes, privées et simples, tandis que l’intelligence cloud coûteuse est réservée aux cas où elle améliore réellement le résultat.
Pourquoi l’IA locale devient plus importante à mesure que l’IA en direct progresse
Il peut sembler qu’un modèle cloud plus puissant rende l’IA locale moins pertinente. Gemini 3.8 Live suggère le contraire.
Plus un assistant cloud peut exploiter de contexte, plus il devient important de contrôler ce contexte.
Une couche locale utile peut conserver :
- fichiers personnels ;
- mémoire à long terme ;
- index de récupération privés ;
- filtrage des capteurs ;
- automatisations simples ;
- décisions à faible risque
à proximité de l’utilisateur.
Le modèle cloud ne reçoit le contexte sélectionné que lorsqu’une tâche nécessite un raisonnement plus puissant.
Cela améliore également la résilience. Un flux de travail d’IA local capable de fonctionner hors ligne peut continuer à assurer la récupération locale, les automatisations, l’accès à la mémoire et les commandes de base, même lorsque le raisonnement avancé dans le cloud devient temporairement indisponible.
Pour les charges de travail permanentes, le traitement local peut également réduire l’utilisation inutile du cloud. Cela compte, car les appels répétés au microphone, à l’écran, à la récupération et aux agents peuvent rendre coûteux au fil du temps un flux de travail d’API apparemment peu onéreux.
Gemini 3.8 Live change l’interface de l’IA
Le changement le plus important n’est pas que Gemini parle plus naturellement ou reconnaisse les images avec davantage de précision.
L’IA n’a de plus en plus pas besoin que l’utilisateur traduise une situation en direct en une invite soigneusement préparée.
Au lieu de décrire une interface :
« Je suis sur une page de paramètres. La deuxième option est désactivée. Sur quoi dois-je cliquer ? »
l’utilisateur peut de plus en plus demander :
« Pourquoi ne puis-je pas continuer à partir d’ici ? »
Le modèle dispose déjà d’une partie du contexte manquant.
Cela supprime les frictions, mais élargit aussi la surface d’observation de l’assistant. L’IA personnelle en temps réel a donc besoin de plus qu’un modèle performant. Elle a besoin de règles claires concernant les capteurs actifs, le contexte conservé, les données qui quittent l’appareil et les situations où il est pertinent de faire appel au raisonnement dans le cloud.
C'est pourquoi les agents IA personnels deviendront de plus en plus des problèmes d'infrastructure autant que de modèles.
Le changement majeur : l'IA locale devient la limite autour de l'intelligence de pointe
Gemini 3.8 Live montre ce qui se produit lorsque l'IA de pointe devient plus persistante et plus perceptive.
L'assistant peut entendre davantage, voir davantage, mémoriser davantage de contexte, utiliser des outils et poursuivre son raisonnement pendant que vous interagissez avec lui.
Cela rend l'intelligence cloud plus utile, mais augmente également la valeur d'une limite locale autour d'elle.
| Couche locale | Couche cloud de pointe |
|---|---|
| Fichiers privés | Raisonnement multimodal complexe |
| Mémoire personnelle | Planification longue en plusieurs étapes |
| Filtrage de l'écran et de l'audio | Conversation avancée en direct |
| Recherche locale | Synthèse complexe |
| Automatisations simples | Tâches d'agent à forte valeur ajoutée |
| Détection des données sensibles | Tâches justifiant l'inférence cloud |
L'objectif n'est pas d'exclure Gemini du flux de travail. Il s'agit d'éviter de lui envoyer des informations dont il n'avait pas besoin au départ.
Une fois que l'IA peut voir, écouter, raisonner et agir en continu, l'IA locale ne consiste plus seulement à exécuter des modèles hors ligne. Elle devient la couche de filtrage, de confidentialité, de mémoire et de routage entre votre univers privé et l'intelligence de pointe.
Foire aux questions sur Gemini 3.8 Live
Quelle est la différence entre Gemini 3.8 Live et Extended Thinking ?
Gemini 3.8 Live privilégie une interaction réactive en temps réel. Extended Thinking est conçu pour les tâches en direct plus complexes, où le raisonnement et l'exécution asynchrone d'outils peuvent se poursuivre en arrière-plan tandis que la conversation reste active.
Gemini 3.8 Live peut-il voir votre écran ?
Gemini Live prend en charge le partage d'écran, tandis que Gemini 3.8 Live accepte les entrées visuelles pendant les sessions en temps réel. L'application cliente détermine toujours quel écran ou quelles données visuelles sont capturés et envoyés au modèle cloud de Google.
Gemini 3.8 Live écoute-t-il en permanence ?
Il ne contourne pas les autorisations de l'appareil. Cependant, la documentation de l'API de Google indique que l'audio proactif est activé en permanence pendant les sessions actives Gemini 3.8 Live et Extended Thinking ; l'entrée audio continue donc de générer des jetons pendant que la session écoute.
Gemini 3.8 Live peut-il fonctionner localement ?
Aucun point de contrôle local officiel ni environnement d'exécution auto-hébergé n'est disponible. Cependant, des fonctions de support telles que la détection du mot d'activation, la recherche privée, la mémoire, l'OCR, le filtrage de l'écran et les commandes simples peuvent être traitées localement avant que le contexte sélectionné ne soit envoyé à Gemini.
Pourquoi l'IA locale est-elle importante si Gemini 3.8 Live est plus performant ?
Parce que les modèles en direct plus performants peuvent consommer davantage de contexte privé. Une couche locale peut stocker les données personnelles, filtrer l'écran et l'audio, exécuter les tâches courantes et n'envoyer que le contexte qui nécessite réellement le raisonnement avancé du cloud.
Centre Tech & IA
Plus à lire

Pourquoi la prise en charge des embeddings multilingues améliore-t-elle la recherche privée à domicile en 2026 ?
Découvrez comment les espaces partagés permettent la recherche multilingue, pourquoi l’équilibre de l’entraînement est important et dans quels cas les termes exacts et les...

Pourquoi la compression des bases de données vectorielles devient-elle plus importante pour l’IA domestique en 2026 ?
Découvrez comment la quantification réduit la taille des vecteurs, pourquoi la localité mémoire peut accélérer la recherche, et où la compression diminue le rappel...

Pourquoi la récupération de l’IA à domicile s’oriente-t-elle vers des points de contrôle coordonnés des modèles et des index en 2026 ?
Découvrez pourquoi les sauvegardes créent un état d’IA composé de versions différentes, comment les points de contrôle coordonnés rétablissent la cohérence et quand une...

