Gemini 3.8 Live explicado: cuando la IA puede observar, hablar y pensar al mismo tiempo

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Gemini 3.8 Live es importante por algo más que la IA de voz. Google ha combinado el contexto audiovisual en tiempo real con el razonamiento, las llamadas a herramientas y las tareas de mayor duración, lo que permite que un asistente siga interactuando mientras el trabajo continúa en segundo plano.

Compartir la pantalla no es algo nuevo: Gemini Live ya permitía compartir la cámara y la pantalla en 2025. El cambio más importante es que la IA puede observar cada vez más una tarea que cambia, seguir razonando mientras hablas y actuar sin obligarte a introducir cada paso en un mensaje independiente. Esto también cambia la cuestión de la IA local: si un asistente puede oír y ver continuamente tu entorno, ¿qué debería filtrarse localmente antes de que algo llegue a la nube?

¿Qué es Gemini 3.8 Live?

Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking en septiembre de 2026.

Según el anuncio oficial de Google, ambos modelos aceptan texto, imágenes, audio y vídeo, y producen respuestas de texto o audio. La diferencia es cuánto trabajo están diseñados para realizar durante la sesión interactiva.

Gemini 3.8 Live Razonamiento extendido en Live
Objetivo principal Interacción rápida en tiempo real Tareas interactivas complejas de varios pasos
Razonamiento Razonamiento intercalado Razonamiento extendido en segundo plano
Entrada visual
Interacción de audio
Llamadas a funciones Compatible Flujo de trabajo asíncrono
Contexto de entrada 131.072 tokens 131.072 tokens
Mejor opción para Asistentes interactivos y receptivos Tareas de agente más largas mientras la conversación continúa

La documentación del modelo de Google presenta Live estándar como una opción para la interacción de baja latencia. El razonamiento extendido resulta más interesante cuando una tarea requiere investigación, varias llamadas a herramientas, comparación, planificación u otro trabajo que no puede completarse al instante.

La novedad no es compartir la pantalla: es razonar mientras sigues hablando

Muchas demostraciones hacen que Gemini 3.8 Live parezca el primer asistente de Google capaz de interpretar la pantalla. No lo es.

Google ya estaba demostrando el uso de la cámara y el uso compartido de la pantalla de Gemini Live en 2025. Su guía anterior de Gemini Live mostraba a los usuarios hablando sobre objetos a través de la cámara y sobre el contenido mostrado en la pantalla de un teléfono.

Por lo tanto, el cambio importante de 3.8 no es simplemente que Gemini pueda ver.

Puede utilizar el contexto visual y de audio en directo mientras continúa un proceso más largo de razonamiento o ejecución de herramientas.

Imagina pedirle a un asistente que compare opciones de viaje mientras sigues explicando tus condiciones. El sistema puede tener que comprender la solicitud, llamar a servicios externos, comparar los resultados y revisar su plan. Con el razonamiento ampliado, ese trabajo no tiene por qué convertir la experiencia de voz en una larga pausa silenciosa.

La documentación sobre el razonamiento de la API Live de Google incluso advierte a los desarrolladores de que turnComplete: true no significa necesariamente que la tarea completa del agente haya terminado. El razonamiento en segundo plano o el trabajo asíncrono de las herramientas aún pueden estar ejecutándose.

Eso deja al descubierto un cambio arquitectónico importante:

un turno conversacional y una tarea de agente ya no son lo mismo.

Esta es la dirección que ya se aprecia en la automatización más amplia de los agentes de IA: los agentes útiles mantienen cada vez más el estado y completan trabajos de varios pasos en lugar de limitarse a responder a una indicación cada vez.

Por qué la IA consciente de la pantalla es más que el reconocimiento de capturas de pantalla

Una captura de pantalla proporciona a una IA un único estado congelado. Una sesión visual en directo le proporciona una tarea cambiante.

IA basada en capturas de pantalla IA visual en directo
El usuario captura manualmente un estado El contexto visual cambia durante la sesión
Se necesita una nueva captura de pantalla después de cada cambio El asistente puede seguir una tarea en evolución
El usuario explica qué ha cambiado El modelo puede recibir nueva información visual
Bueno para preguntas aisladas Más adecuado para la orientación y la resolución de problemas

Esto hace que varios escenarios resulten mucho más naturales:

  • explicar matemáticas escritas a mano mientras el estudiante trabaja;
  • guiar a alguien por una aplicación desconocida;
  • observar cómo cambian los ajustes durante la resolución de problemas;
  • responder a un boceto o diseño en evolución;
  • usar una cámara para hablar sobre equipos u objetos físicos.

Las demostraciones de lanzamiento de Google incluyen la incorporación visual de empleados, jugar al ajedrez con un tablero en directo, convertir bocetos e instrucciones habladas en código de interfaz y ofrecer asistencia paso a paso para solucionar problemas. La mejora común no es solo la visión, sino la visión integrada en una tarea en curso.

El contexto continuo cambia el límite de la privacidad

El chat tradicional hace que el límite de los datos sea relativamente obvio. Escribes algo o subes un archivo explícitamente.

Un asistente multimodal en directo puede recibir un contexto mucho más amplio durante una sesión activa:

  • audio del micrófono;
  • contenido de la pantalla;
  • fotogramas de la cámara;
  • notificaciones que aparecen en pantalla;
  • resultados de herramientas;
  • contexto de conversaciones anteriores.

Por lo tanto, la pregunta sobre la privacidad cambia de:

¿Subí este archivo?

a:

¿Qué era visible o audible mientras la sesión estaba activa?

Un desarrollador que comparte un IDE puede exponer accidentalmente una clave de API en un terminal. Una sesión de uso compartido de pantalla puede mostrar brevemente correos electrónicos privados, registros de clientes, paneles internos o notificaciones que no tienen nada que ver con la tarea.

Por eso, el límite de privacidad de una aplicación de IA en vivo debería comenzar antes de la solicitud a la nube. Una capa local puede decidir qué región de la pantalla, archivo, segmento de audio o contexto derivado debe realmente salir del dispositivo.

El mismo principio se aplica cuando un agente de IA utiliza herramientas en la nube: el acceso a la nube no requiere conceder al servicio remoto acceso general a todos los archivos o sensores locales.

¿Gemini 3.8 Live escucha siempre?

Gemini no elude los permisos de micrófono del sistema operativo, y una aplicación cliente sigue determinando cuándo está activa una sesión Live.

Pero hay un detalle importante a nivel de la API: la documentación de prácticas recomendadas de la API Live de Google indica que el audio proactivo está habilitado permanentemente para Gemini 3.8 Live y el razonamiento extendido.

Mientras una sesión Live activa está escuchando, los tokens de audio de entrada siguen acumulándose.

Eso convierte a un asistente “siempre activo” en dos problemas a la vez:

Problema de diseño Por qué importa
Privacidad El usuario debe saber cuándo están activos el micrófono o la captura visual
Coste La escucha continua genera un uso de entrada continuo

Por tanto, un asistente siempre activo necesita algo más que un modelo potente. Necesita buenas reglas de activación, filtrado local, un estado visible de los sensores y una gestión sensata de las sesiones.

Por qué las sesiones prolongadas de Gemini Live pueden costar más de lo que sugiere el precio por minuto

Actualmente, Google establece el precio de Gemini 3.8 Live según la modalidad de tokens. Su documentación de precios de la API indica aproximadamente:

Modalidad Precio de la API de pago
Entrada de texto 0,75 $ / 1 M de tokens
Entrada de audio 3 $ / 1 M de tokens, aproximadamente 0,005 $/min
Entrada de imagen/video 1 $ / 1 M de tokens, aproximadamente 0,002 $/min
Salida de texto 4,50 $ / 1 M de tokens
Salida de audio 12 $ / 1 M de tokens, aproximadamente 0,018 $/min

Pero el precio de los medios por minuto es solo una parte del coste real.

Las sesiones en vivo mantienen el contexto de la conversación. A medida que la sesión crece, el contexto anterior puede seguir participando en turnos posteriores. Por ello, Google recomienda Compresión de la ventana de contexto para sesiones de larga duración, de modo que el historial más antiguo pueda eliminarse de la ventana activa.

Esto crea lo que podría denominarse crecimiento progresivo de los tokens de la sesión en vivo: el asistente no solo procesa el segundo más reciente de audio o video, sino que también puede mantener un estado conversacional cada vez mayor.

Por lo tanto, la cuestión del coste no es solo:

¿Cuánto cuesta un minuto de audio?

Es:

¿Cuánto contexto sigue reutilizando el asistente a medida que la sesión se alarga?

Esta es la misma razón por la que el coste de la IA híbrida depende en gran medida del tamaño del contexto, del enrutamiento de modelos y de los bucles repetidos del agente, y no solo del precio de los tokens.

El vídeo continuo crea un problema de contexto, no solo de ancho de banda

Google afirma que el audio nativo acumula aproximadamente 25 tokens por segundo. Su documentación de Live API también señala que, sin compresión del contexto, el audio y vídeo continuos alcanzan el límite de contexto activo mucho más rápido que una interacción basada únicamente en audio.

Esto importa porque un asistente normalmente no necesita todos los detalles visuales posibles en cada momento.

Por ejemplo, si el usuario pregunta por un cuadro de diálogo de error, transmitir regiones del escritorio no relacionadas, ventanas en segundo plano y fotogramas repetidos sin cambios aumenta:

  • contexto de entrada;
  • coste;
  • ruido visual irrelevante;
  • exposición de la privacidad.

La mejor solución no consiste simplemente en usar una ventana de contexto más grande.

Es una mejor selección del contexto.

Un cliente local podría recortar la ventana relevante, detectar cuándo la pantalla cambia de forma significativa, ocultar texto confidencial o dejar de enviar fotogramas cuando no ocurre nada útil.

Eso convierte el procesamiento local en una capa de control del contexto, en lugar de un intento de reemplazar el modelo avanzado.

¿Puede Gemini 3.8 Live ejecutarse localmente?

No existe ningún modelo oficial de Gemini 3.8 Live para autoalojamiento.

Google ofrece el modelo a través de sus servicios en la nube y la API de Gemini. No existe un punto de control descargable de Gemini 3.8 Live ni un entorno de ejecución compatible para GPU de consumo.

Pero «Gemini no puede ejecutarse localmente» y «todo el asistente debe ejecutarse en la nube» son afirmaciones diferentes.

Muchas cargas de trabajo auxiliares pueden permanecer en local:

Carga de trabajo ¿Tiene sentido el procesamiento local?
Detección de palabra de activación
Detección de actividad de voz
Detección de cambios en la pantalla
Selección de una región de la pantalla
Detección de datos confidenciales
OCR A menudo
Recuperación de archivos privados Preferiblemente
Memoria personal Fuerte argumento a favor de la privacidad local
Comandos simples A menudo
Razonamiento multimodal complejo El modelo avanzado en la nube puede aportar un valor significativo

Por lo tanto, un asistente de IA privado puede mantener localmente los archivos personales, los índices, la memoria y el procesamiento rutinario, y enviar solo el contexto seleccionado a un modelo como Gemini cuando la tarea requiera razonamiento avanzado.

Por qué los futuros asistentes en tiempo real probablemente usarán varios modelos

Usar Gemini 3.8 Live durante cada segundo de cada tarea sería potente, pero rara vez sería el diseño más eficiente.

Un asistente en tiempo real tiene muchas tareas pequeñas:

Tarea Punto de partida eficiente
Detectar voz Modelo de audio local diminuto
Decidir si una solicitud requiere una acción Clasificador pequeño
Identificar contenido sensible en pantalla Visión local o reglas
Buscar en archivos personales Recuperación local
Ejecutar un comando conocido Automatización local
Comprender una escena difícil en directo Modelo multimodal avanzado
Coordinar una tarea larga y compleja Agente con razonamiento extendido

Esto se parece a la estrategia más amplia detrás de la IA avanzada en la nube con datos locales privados: el sistema doméstico no necesita reproducir el modelo avanzado. Necesita decidir qué información debe recibir el modelo avanzado.

El resultado no es una IA solo en la nube ni solo local.

Es un sistema con enrutamiento en el que el procesamiento local gestiona las cargas de trabajo frecuentes, privadas y sencillas, mientras que la inteligencia costosa en la nube se reserva para los casos en los que mejora significativamente el resultado.

Por qué la IA local cobra más importancia a medida que mejora la IA en directo

Puede parecer que un modelo más potente en la nube hace que la IA local sea menos relevante. Gemini 3.8 Live sugiere lo contrario.

Cuanto más contexto puede consumir un asistente en la nube, más importante se vuelve controlar ese contexto.

Una capa local útil puede mantener:

  • archivos personales;
  • memoria a largo plazo;
  • índices de recuperación privados;
  • filtrado de sensores;
  • automatizaciones sencillas;
  • decisiones de bajo riesgo

cerca del usuario.

El modelo en la nube recibe solo el contexto seleccionado cuando una tarea requiere un razonamiento más potente.

Esto también mejora la resiliencia. Un flujo de trabajo de IA local capaz de funcionar sin conexión puede continuar con la recuperación local, las automatizaciones, el acceso a la memoria y los comandos básicos incluso cuando el razonamiento avanzado en la nube desaparece temporalmente.

Para las cargas de trabajo siempre activas, el procesamiento local también puede reducir el uso innecesario de la nube. Esto es importante porque las llamadas repetidas al micrófono, la pantalla, la recuperación y los agentes pueden hacer que un flujo de trabajo de API aparentemente económico resulte costoso con el tiempo.

Gemini 3.8 Live cambia la interfaz de la IA

El cambio más importante no es que Gemini hable de forma más natural o reconozca imágenes con mayor precisión.

La cuestión es que la IA cada vez requiere menos que el usuario traduzca una situación en directo en un prompt cuidadosamente preparado.

En lugar de describir una interfaz:

«Estoy en una página de configuración. La segunda opción está desactivada. ¿En qué debo hacer clic?»

el usuario puede preguntar cada vez más:

«¿Por qué no puedo continuar desde aquí?»

El modelo ya cuenta con parte del contexto que faltaba.

Eso elimina fricciones, pero también amplía la superficie de observación del asistente. Por eso, la IA personal en tiempo real necesita algo más que un modelo capaz. Necesita reglas claras sobre qué sensores están activos, qué contexto se conserva, qué sale del dispositivo y cuándo vale la pena recurrir al razonamiento en la nube.

Por eso los agentes de IA personales serán cada vez más problemas de infraestructura, tanto como de modelos.

El cambio más importante: la IA local se convierte en la frontera alrededor de la inteligencia de vanguardia

Gemini 3.8 Live muestra lo que ocurre cuando la IA de vanguardia se vuelve más persistente y perceptiva.

El asistente puede oír más, ver más, recordar más contexto, usar herramientas y seguir razonando mientras interactúas con él.

Eso hace que la inteligencia en la nube sea más útil, pero también aumenta el valor de una frontera local a su alrededor.

Capa local Capa de nube de vanguardia
Archivos privados Razonamiento multimodal complejo
Memoria personal Planificación larga de varios pasos
Filtrado de pantalla y audio Conversación avanzada en directo
Recuperación local Síntesis compleja
Automatizaciones simples Tareas de agentes de alto valor
Detección de datos confidenciales Tareas que justifican la inferencia en la nube

El objetivo no es mantener a Gemini fuera del flujo de trabajo. Es evitar enviarle información que nunca necesitó en primer lugar.

Una vez que la IA puede ver, escuchar, razonar y actuar continuamente, la IA local deja de consistir únicamente en ejecutar modelos sin conexión. Se convierte en la capa de filtrado, privacidad, memoria y enrutamiento entre tu mundo privado y la inteligencia de vanguardia.

Preguntas frecuentes sobre Gemini 3.8 Live

¿Cuál es la diferencia entre Gemini 3.8 Live y Extended Thinking?

Gemini 3.8 Live prioriza una interacción receptiva en tiempo real. Extended Thinking está diseñado para tareas en directo más complejas, en las que el razonamiento y el trabajo asíncrono con herramientas pueden continuar en segundo plano mientras la conversación permanece activa.

¿Puede Gemini 3.8 Live ver tu pantalla?

Gemini Live admite compartir la pantalla, mientras que Gemini 3.8 Live acepta entradas visuales durante las sesiones en tiempo real. La aplicación cliente sigue determinando qué pantalla o datos visuales se capturan y se envían al modelo en la nube de Google.

¿Gemini 3.8 Live está escuchando siempre?

No elude los permisos del dispositivo. Sin embargo, la documentación de la API de Google indica que el audio proactivo está habilitado permanentemente durante las sesiones activas de Gemini 3.8 Live y Extended Thinking, por lo que la entrada de audio sigue generando tokens mientras la sesión escucha.

¿Puede Gemini 3.8 Live ejecutarse localmente?

No hay disponible ningún checkpoint local oficial ni ningún runtime autohospedado. Sin embargo, funciones auxiliares como la detección de palabras de activación, la recuperación privada, la memoria, el OCR, el filtrado de pantalla y los comandos simples pueden procesarse localmente antes de enviar el contexto seleccionado a Gemini.

¿Por qué importa la IA local si Gemini 3.8 Live es más capaz?

Porque los modelos en directo más potentes pueden consumir más contexto privado. Una capa local puede almacenar datos personales, filtrar pantallas y audio, ejecutar tareas rutinarias y enviar solo el contexto que realmente requiere el razonamiento de vanguardia en la nube.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.