Gemini 3.8 Live explicado: quando a IA consegue ver, falar e pensar ao mesmo tempo

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

O Gemini 3.8 Live é importante por mais do que apenas a IA de voz. A Google combinou contexto de áudio e visual em tempo real com raciocínio, chamadas de ferramentas e tarefas de maior duração, permitindo que um assistente continue a interagir enquanto o trabalho prossegue em segundo plano.

A partilha de ecrã, por si só, não é uma novidade - o Gemini Live já suportava a partilha da câmara e do ecrã em 2025. A mudança mais significativa é que a IA consegue cada vez mais observar uma tarefa em constante mudança, continuar a raciocinar enquanto falamos e agir sem obrigar a introduzir cada passo num pedido separado. Isto também altera a questão da IA local: se um assistente consegue ouvir e ver continuamente o seu ambiente, o que deve ser filtrado localmente antes de chegar à nuvem?

O que é o Gemini 3.8 Live?

A Google apresentou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking em setembro de 2026.

Segundo o anúncio oficial da Google, ambos os modelos aceitam texto, imagens, áudio e vídeo, produzindo respostas em texto ou áudio. A diferença está na quantidade de trabalho que foram concebidos para realizar durante a sessão em direto.

Gemini 3.8 Live Live Extended Thinking
Objetivo principal Interação rápida em tempo real Tarefas complexas em direto com várias etapas
Raciocínio Raciocínio intercalado Raciocínio prolongado em segundo plano
Entrada visual Sim Sim
Interação por áudio Sim Sim
Chamadas de funções Suportado Fluxo de trabalho assíncrono
Contexto de entrada 131,072 tokens 131,072 tokens
Mais adequado para Assistentes em direto responsivos Tarefas de agente mais longas enquanto a conversa continua

A documentação do modelo da Google apresenta o Live normal como uma solução para interação de baixa latência. O Extended Thinking é mais interessante quando uma tarefa exige pesquisa, várias chamadas de ferramentas, comparação, planeamento ou outro trabalho que não pode ser concluído instantaneamente.

A novidade não é a partilha de ecrã — é o raciocínio enquanto continua a falar

Muitas demonstrações fazem o Gemini 3.8 Live parecer o primeiro assistente da Google capaz de compreender o ecrã. Não é.

A Google já demonstrava a utilização da câmara e da partilha de ecrã do Gemini Live em 2025. O seu guia anterior do Gemini Live mostrava utilizadores a discutir objetos através da câmara e conteúdos apresentados no ecrã de um telemóvel.

A mudança importante da versão 3.8 não é, portanto, simplesmente o facto de o Gemini conseguir ver.

Pode utilizar o contexto visual e áudio em direto enquanto um processo mais longo de raciocínio ou execução de ferramentas continua.

Imagine pedir a um assistente para comparar opções de viagem enquanto continua a discutir as suas restrições. O sistema pode precisar de compreender o pedido, chamar serviços externos, comparar resultados e rever o seu plano. Com o Extended Thinking, esse trabalho não tem de transformar a experiência de voz numa longa pausa silenciosa.

A documentação sobre o raciocínio da API Live da Google até avisa os programadores de que turnComplete: true não significa necessariamente que a tarefa completa do agente tenha terminado. O raciocínio em segundo plano ou o trabalho assíncrono das ferramentas pode ainda estar em execução.

Isso revela uma alteração arquitetónica importante:

um turno de conversa e uma tarefa de agente já não são a mesma coisa.

Esta é a direção já visível numa automação mais ampla de agentes de IA: os agentes úteis mantêm cada vez mais o estado e concluem tarefas com várias etapas, em vez de simplesmente responderem a uma solicitação de cada vez.

Porque é que a IA com conhecimento do ecrã é mais do que reconhecimento de capturas de ecrã

Uma captura de ecrã fornece à IA um único estado congelado. Uma sessão visual em direto fornece-lhe uma tarefa em mudança.

IA baseada em capturas de ecrã IA visual em direto
O utilizador captura manualmente um estado O contexto visual muda durante a sessão
É necessária uma nova captura de ecrã após cada alteração O assistente pode acompanhar uma tarefa em evolução
O utilizador explica o que mudou O modelo pode receber novas informações visuais
Bom para perguntas isoladas Mais adequado para orientação e resolução de problemas

Isto torna vários cenários muito mais naturais:

  • explicar matemática manuscrita enquanto o aluno trabalha;
  • orientar alguém numa aplicação desconhecida;
  • acompanhar alterações nas definições durante a resolução de problemas;
  • responder a um esboço ou design em evolução;
  • utilizar uma câmara para falar sobre equipamento ou objetos físicos.

As demonstrações de lançamento da Google incluem integração visual de funcionários, jogar xadrez a partir de um tabuleiro em direto, converter esboços e instruções faladas em código de interface e resolver problemas passo a passo. A melhoria comum não é apenas a visão - é a visão integrada numa tarefa em curso.

O contexto contínuo altera o limite da privacidade

Num chat tradicional, o limite dos dados é relativamente evidente. Escreve algo ou carrega explicitamente um ficheiro.

Um assistente multimodal em direto pode receber um contexto muito mais amplo durante uma sessão ativa:

  • áudio do microfone;
  • conteúdo do ecrã;
  • imagens da câmara;
  • notificações que aparecem no ecrã;
  • resultados das ferramentas;
  • contexto da conversa anterior.

A questão da privacidade muda, portanto, de:

Fui eu que carreguei este ficheiro?

para:

O que estava visível ou audível enquanto a sessão estava ativa?

Um programador que partilhe um IDE pode expor acidentalmente uma chave de API num terminal. Uma sessão de partilha de ecrã pode apresentar brevemente e-mails privados, registos de clientes, painéis internos ou notificações sem qualquer relação com a tarefa.

É por isso que o limite de privacidade de uma aplicação de IA em direto deve começar antes do pedido à nuvem. Uma camada local pode decidir que região do ecrã, ficheiro, segmento de áudio ou contexto derivado precisa realmente de sair do dispositivo.

O mesmo princípio aplica-se quando um agente de IA utiliza ferramentas na nuvem: o acesso à nuvem não exige conceder ao serviço remoto acesso indiscriminado a todos os ficheiros ou sensores locais.

O Gemini 3.8 Live está sempre a ouvir?

O Gemini não contorna as permissões do sistema operativo para o microfone, e uma aplicação cliente continua a determinar quando uma sessão Live está ativa.

Mas há um detalhe importante ao nível da API: a documentação de boas práticas da API Live da Google afirma que o áudio proativo está permanentemente ativado para o Gemini 3.8 Live e o Extended Thinking.

Enquanto uma sessão Live ativa está a escutar, os tokens de áudio de entrada continuam a acumular-se.

Isto faz com que um assistente “sempre ativo” seja, na verdade, dois problemas ao mesmo tempo:

Problema de design Porque é importante
Privacidade O utilizador precisa de saber quando o microfone ou a captação visual estão ativos
Custo A escuta contínua cria um consumo contínuo de entrada

Por isso, um assistente sempre ativo precisa de mais do que um modelo potente. Precisa de boas regras de ativação, filtragem local, estado visível dos sensores e uma gestão sensata das sessões.

Porque é que as sessões longas do Gemini Live podem custar mais do que o preço por minuto sugere

Atualmente, a Google define o preço do Gemini 3.8 Live por modalidade de token. A sua documentação de preços da API indica aproximadamente:

Modalidade Preço da API paga
Entrada de texto 0,75 $ / 1 M de tokens
Entrada de áudio 3 $ / 1 M de tokens, cerca de 0,005 $/min
Entrada de imagem/vídeo 1 $ / 1 M de tokens, cerca de 0,002 $/min
Saída de texto 4,50 $ / 1 M de tokens
Saída de áudio 12 $ / 1 M de tokens, cerca de 0,018 $/min

Mas o preço dos conteúdos multimédia por minuto é apenas parte do custo real.

As sessões em direto mantêm o contexto da conversa. À medida que a sessão cresce, o contexto anterior pode continuar a participar em interações posteriores. Por isso, a Google recomenda compressãoDaJanelaDeContexto para sessões prolongadas, de modo a que o histórico mais antigo possa ser removido da janela ativa.

Isto cria aquilo a que se pode chamar acumulação de tokens da sessão em direto: o assistente não está apenas a processar o segundo mais recente de áudio ou vídeo; pode também estar a manter um estado conversacional cada vez maior.

A questão do custo não é, portanto, apenas:

Quanto custa um minuto de áudio?

É:

Quanto contexto é que o assistente continua a reutilizar à medida que a sessão se prolonga?

Esta é a mesma razão pela qual o custo da IA híbrida depende fortemente do tamanho do contexto, do encaminhamento do modelo e dos ciclos repetidos dos agentes, e não apenas do preço dos tokens.

O vídeo contínuo cria um problema de contexto, não apenas um problema de largura de banda

A Google afirma que o áudio nativo se acumula a cerca de 25 tokens por segundo. A documentação da Live API também indica que, sem compressão do contexto, o áudio-vídeo contínuo atinge o limite de contexto ativo muito mais rapidamente do que uma interação apenas com áudio.

Isto é importante porque um assistente normalmente não precisa de todos os detalhes visuais possíveis em cada momento.

Por exemplo, se o utilizador perguntar sobre uma caixa de diálogo de erro, transmitir regiões não relacionadas do ambiente de trabalho, janelas em segundo plano e imagens repetidas sem alterações aumenta:

  • contexto de entrada;
  • custo;
  • ruído visual irrelevante;
  • exposição da privacidade.

A melhor solução não é simplesmente uma janela de contexto maior.

É uma melhor seleção de contexto.

Um cliente local poderia recortar a janela relevante, detetar quando o ecrã muda significativamente, ocultar texto sensível ou deixar de enviar imagens quando nada de útil está a acontecer.

Isso transforma o processamento local numa camada de controlo do contexto, em vez de numa tentativa de substituir o modelo de vanguarda.

O Gemini 3.8 Live pode ser executado localmente?

Não está disponível nenhum modelo oficial Gemini 3.8 Live autoalojado.

A Google disponibiliza o modelo através dos seus serviços na nuvem e da API Gemini. Não existe um checkpoint transferível do Gemini 3.8 Live nem um runtime compatível com GPUs de consumo.

Mas “o próprio Gemini não pode ser executado localmente” e “todo o assistente tem de ser executado na nuvem” são afirmações diferentes.

Muitas cargas de trabalho de suporte podem permanecer locais:

Carga de trabalho O processamento local faz sentido?
Deteção da palavra de ativação Sim
Deteção de atividade de voz Sim
Deteção de alterações no ecrã Sim
Seleção de uma região do ecrã Sim
Deteção de dados sensíveis Sim
OCR Frequentemente
Obtenção de ficheiros privados De preferência
Memória pessoal Forte argumento a favor da privacidade local
Comandos simples Frequentemente
Raciocínio multimodal complexo O modelo de vanguarda na nuvem pode acrescentar um valor significativo

Um assistente de IA privado pode, por isso, manter localmente ficheiros pessoais, índices, memória e processamento de rotina, enviando apenas o contexto selecionado para um modelo como o Gemini quando a tarefa exige raciocínio de vanguarda.

Porque é que os futuros assistentes em tempo real irão provavelmente utilizar vários modelos

Usar o Gemini 3.8 Live em cada segundo de todas as tarefas seria poderoso, mas raramente seria a solução mais eficiente.

Um assistente em tempo real tem muitas tarefas menores:

Tarefa Ponto de partida eficiente
Detetar fala Modelo de áudio local pequeno
Decidir se um pedido requer uma ação Classificador pequeno
Identificar conteúdo sensível no ecrã Visão local ou regras
Pesquisar ficheiros pessoais Recuperação local
Executar um comando conhecido Automatização local
Compreender uma cena real difícil Modelo multimodal avançado
Coordenar uma tarefa longa e complexa Agente com raciocínio prolongado

Isto é semelhante à estratégia mais ampla por detrás da IA avançada na cloud com dados locais privados: o sistema doméstico não precisa de reproduzir o modelo mais avançado. Precisa de decidir que informações o modelo mais avançado deve receber.

O resultado não é uma IA apenas na cloud nem apenas local.

É um sistema encaminhado em que o processamento local trata das cargas de trabalho frequentes, privadas e simples, enquanto a inteligência dispendiosa na cloud fica reservada para os casos em que melhora significativamente o resultado.

Porque é que a IA local se torna mais importante à medida que a IA em tempo real melhora

Pode parecer que um modelo mais avançado na cloud torna a IA local menos relevante. O Gemini 3.8 Live sugere o contrário.

Quanto mais contexto um assistente na cloud consegue consumir, mais importante se torna controlar esse contexto.

Uma camada local útil pode manter:

  • ficheiros pessoais;
  • memória de longo prazo;
  • índices de pesquisa privados;
  • filtragem de sensores;
  • automatizações simples;
  • decisões de baixo risco

próximo do utilizador.

O modelo na cloud recebe apenas o contexto selecionado quando uma tarefa exige um raciocínio mais avançado.

Isto também melhora a resiliência. Um fluxo de trabalho de IA local com capacidade offline pode continuar a fazer pesquisas locais, executar automatizações, aceder à memória e processar comandos básicos mesmo quando o raciocínio avançado na cloud fica temporariamente indisponível.

Para cargas de trabalho sempre ativas, o processamento local também pode reduzir a utilização desnecessária da cloud. Isso é importante porque chamadas repetidas ao microfone, ao ecrã, à pesquisa e aos agentes podem tornar dispendioso, ao longo do tempo, um fluxo de trabalho de API aparentemente barato.

O Gemini 3.8 Live muda a interface da IA

A mudança mais importante não é o Gemini falar de forma mais natural ou reconhecer imagens com maior precisão.

A questão é que a IA exige cada vez menos que o utilizador traduza uma situação real num prompt cuidadosamente preparado.

Em vez de descrever uma interface:

«Estou numa página de definições. A segunda opção está desativada. Em que devo clicar?»

o utilizador pode perguntar cada vez mais:

«Porque não posso continuar a partir daqui?»

O modelo já tem parte do contexto em falta.

Isso remove obstáculos, mas também amplia a superfície de observação do assistente. Por isso, uma IA pessoal em tempo real precisa de mais do que um modelo capaz. Precisa de regras claras sobre quais sensores estão ativos, que contexto é retido, o que sai do dispositivo e quando vale a pena recorrer ao raciocínio na cloud.

É por isso que os agentes de IA pessoais serão cada vez mais problemas de infraestrutura, tanto quanto problemas de modelos.

A grande mudança: a IA local torna-se a fronteira em torno da inteligência de vanguarda

O Gemini 3.8 Live mostra o que acontece quando a IA de vanguarda se torna mais persistente e percetiva.

O assistente consegue ouvir mais, ver mais, recordar mais contexto, utilizar ferramentas e continuar a raciocinar enquanto interage com ele.

Isto torna a inteligência na nuvem mais útil - mas também aumenta o valor de uma fronteira local em torno dela.

Camada local Camada de nuvem de vanguarda
Ficheiros privados Raciocínio multimodal complexo
Memória pessoal Planeamento longo com várias etapas
Filtragem do ecrã e do áudio Conversação avançada em tempo real
Recuperação local Síntese difícil
Automações simples Tarefas de agentes de elevado valor
Deteção de dados sensíveis Tarefas que justificam a inferência na nuvem

O objetivo não é manter o Gemini fora do fluxo de trabalho. É evitar enviar ao Gemini informações de que nunca precisou, à partida.

Quando a IA conseguir ver, ouvir, raciocinar e agir continuamente, a IA local deixará de se limitar à execução de modelos offline. Tornar-se-á a camada de filtragem, privacidade, memória e encaminhamento entre o seu mundo privado e a inteligência de vanguarda.

Perguntas frequentes sobre o Gemini 3.8 Live

Qual é a diferença entre o Gemini 3.8 Live e o Extended Thinking?

O Gemini 3.8 Live dá prioridade a uma interação responsiva em tempo real. O Extended Thinking foi concebido para tarefas em tempo real mais complexas, nas quais o raciocínio e o trabalho assíncrono com ferramentas podem continuar em segundo plano enquanto a conversa permanece ativa.

O Gemini 3.8 Live consegue ver o seu ecrã?

O Gemini Live suporta a partilha do ecrã, enquanto o Gemini 3.8 Live aceita entradas visuais durante sessões em tempo real. A aplicação cliente continua a determinar que ecrã ou dados visuais são capturados e enviados para o modelo da Google na nuvem.

O Gemini 3.8 Live está sempre a ouvir?

Não contorna as permissões do dispositivo. No entanto, a documentação da API da Google indica que o áudio proativo está permanentemente ativado durante as sessões ativas do Gemini 3.8 Live e do Extended Thinking, pelo que a entrada de áudio continua a gerar tokens enquanto a sessão está a ouvir.

O Gemini 3.8 Live pode ser executado localmente?

Não está disponível nenhum checkpoint local oficial nem runtime para autoalojamento. No entanto, funções de suporte, como a deteção da palavra de ativação, a recuperação privada, a memória, o OCR, a filtragem do ecrã e os comandos simples, podem ser processadas localmente antes de o contexto selecionado ser enviado para o Gemini.

Porque é que a IA local é importante se o Gemini 3.8 Live é mais capaz?

Porque os modelos em tempo real mais avançados podem consumir mais contexto privado. Uma camada local pode armazenar dados pessoais, filtrar ecrãs e áudio, executar tarefas de rotina e enviar apenas o contexto que requer genuinamente raciocínio na nuvem de vanguarda.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.