Gemini Agentic Video cambia la IA de vídeo al permitir que el modelo decida qué momentos merecen atención, en lugar de procesar todo el vídeo con una frecuencia de muestreo fija. Google informa de que sus cargas de trabajo probadas pueden utilizar hasta un 88 % menos de tokens, costar hasta un 66 % menos y mejorar la calidad hasta un 7 %. El cambio importante no consiste simplemente en abaratar el análisis de vídeo: Gemini puede buscar en la línea de tiempo, inspeccionar un momento prometedor y volver a analizarlo con mayor detalle cuando la pregunta lo requiera.
Para un NAS que almacena años de grabaciones de vigilancia, vídeos familiares, reuniones o archivos de creadores, eso no significa que Gemini pueda de repente «ver» toda la biblioteca de forma local. Gemini sigue ejecutándose en la nube de Google. La arquitectura más interesante consiste en acotar localmente un gran archivo privado y después proporcionar a un modelo multimodal solo los clips o intervalos de tiempo que merezcan una inspección más profunda. En otras palabras, el problema de infraestructura se convierte en transformar el vídeo a escala de almacenamiento en contexto a escala de consulta.
¿Qué es Gemini Agentic Video Understanding?
Gemini Agentic Video Understanding es un modo de procesamiento de vídeo que permite a Gemini navegar activamente por un vídeo en lugar de cargar fotogramas a una frecuencia fija en una sola pasada.
Google presentó esta capacidad el 1 de septiembre de 2026. El anuncio de lanzamiento abarcaba inicialmente Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite; la documentación actual para desarrolladores de Google también incluye Gemini 3.8 Flash entre los modelos compatibles con el procesamiento agéntico de vídeos.
Según el anuncio de Google sobre la comprensión agéntica de vídeos, el modelo combina el razonamiento con herramientas de vídeo nativas para buscar, escanear e inspeccionar las partes relevantes de los fotogramas, el audio y las transcripciones.
| Modo de procesamiento | Cómo ve el vídeo | Más adecuado para |
|---|---|---|
| Estático | Muestrea fotogramas a una frecuencia fija, de 1 FPS de forma predeterminada, y los incorpora al contexto en una sola pasada | Clips cortos o predecibles |
| Agentivo | Navega dinámicamente por la línea de tiempo y carga solo los fotogramas, la transcripción o el audio relevantes | Vídeos largos y consultas dirigidas a momentos específicos |
La distinción es importante porque el modelo ya no es un espectador pasivo.
Puede preguntarse internamente: ¿Dónde debería buscar ahora?
¿Por qué es ineficiente ver un video a una frecuencia fija de 1 FPS?
El procesamiento estático de video es sencillo y predecible. Gemini muestrea el video a una frecuencia de fotogramas fija —1 fotograma por segundo de forma predeterminada— y procesa esos fotogramas muestreados junto con el audio.
Funciona bien cuando el video es corto. Resulta mucho menos atractivo cuando la entrada dura una hora o varias horas.
PROCESAMIENTO ESTÁTICO DE VIDEO
Video
|
v
Muestreo fijo a 1 FPS
|
v
Fotograma 1
Fotograma 2
Fotograma 3
Fotograma 4
...
|
v
Contexto amplio
|
v
Modelo
|
v
Respuesta
La documentación actual de tokens de Gemini de Google ofrece un ejemplo útil: una conferencia de una hora que podría requerir aproximadamente 1,08 millones de tokens con procesamiento estático de alta resolución podría usar alrededor de 108.000 tokens con procesamiento agéntico, según la pregunta y el contenido.
Esa diferencia existe porque la mayoría de las preguntas no requieren cada segundo de un video.
Si el usuario pregunta: «¿A qué conclusión llegó el orador sobre los costos de almacenamiento?», la evidencia útil puede ocupar 90 segundos en una presentación de una hora.
Procesar los otros 58 minutos no mejora automáticamente la respuesta.
¿Por qué el muestreo fijo de fotogramas puede seguir perdiéndose eventos importantes?
El consumo de tokens es solo la mitad del problema. El muestreo fijo también puede observar los momentos equivocados.
Imagina una grabación de una cámara de seguridad en la que alguien deja un paquete en un porche entre dos fotogramas muestreados:
00:10.0
Porche vacío
|
| paquete colocado aquí
|
00:11.0
Paquete en el porche
Una vista a 1 FPS puede capturar el estado anterior y posterior a la acción, pero perderse la acción en sí.
Google destaca específicamente la recuperación de momentos de menos de un segundo como una de las nuevas capacidades de Agentic Video. El modelo puede identificar un intervalo de tiempo prometedor y volver a muestrear esa ventana con mayor densidad, en lugar de aplicar una alta frecuencia de fotogramas a toda la grabación.
Este tipo de inspección dirigida es especialmente relevante para los eventos y las grabaciones de cámaras de seguridad almacenados localmente, donde un evento útil puede ocupar solo unos segundos dentro de horas de metraje.
El principio es sencillo:
Dedica más capacidad visual allí donde probablemente esté la respuesta.
¿Cómo decide Gemini qué partes de un video ver?
Agentic Video convierte la comprensión de videos en un proceso iterativo. En lugar de comprometerse con una estrategia de muestreo antes de comenzar el razonamiento, Gemini puede cambiar la forma en que inspecciona la entrada a medida que se desarrolla la tarea.
Google describe el sistema como una herramienta que elige qué ver, a qué velocidad y mediante qué modalidad.
USER QUERY
|
v
CONSULTA DEL USUARIO
|
v
Razonar sobre qué evidencia se necesita
|
+---------------------+
| | |
Navegar por la línea de tiempo del video
v v v
| | |
+----------+----------+
|
v
Transcripción Audio Fotogramas
|
+----+----+
| |
¿Se encontró el momento relevante?
| |
No Sí
Buscar de nuevo Inspeccionar más a fondo
Mayor FPS
Mayor detalle
|
v
Respuesta
Esto crea un ciclo más parecido a una investigación que a una indicación multimodal ordinaria.
Una transcripción puede revelar primero, de forma aproximada, dónde se habla de un tema. Después, los fotogramas pueden verificar qué apareció en pantalla. Si importa un evento visual rápido, el modelo puede inspeccionar esa sección específica con una frecuencia de fotogramas más alta.
La propia modalidad pasa a formar parte de la decisión de razonamiento.
¿Por qué Agentic Video puede usar hasta un 88 % menos de tokens?
Agentic Video ahorra tokens al evitar el contenido multimedia que no contribuye a la respuesta. No comprime simplemente todo el video en un 88 %.
Las notas de precios actuales de Google indican que el consumo de tokens es variable porque depende de lo que el modelo cargue dinámicamente. La complejidad de la consulta, el contenido del video y la profundidad del muestreo influyen en el resultado.
| Resultado comunicado por Google | Significado |
|---|---|
| Hasta un 88 % menos de tokens | La carga selectiva puede reducir drásticamente el contenido multimedia incorporado al contexto del modelo |
| Hasta un 66 % menos de costo de análisis | Un menor uso de tokens puede reducir el costo total, pero no en una proporción de uno a uno |
| Hasta un 7 % de mejora en la calidad | La inspección dinámica también puede recuperar evidencia que el muestreo estático pasa por alto |
Estos son los resultados de Google en las cargas de trabajo de video que probó, no garantías fijas para cada entrada.
Las notas de precios actuales de la API de Gemini indican explícitamente que el recuento de tokens de Agentic Video depende del contenido cargado por el modelo, no simplemente de la duración total del video de origen.
Una pregunta difícil que hace que el modelo revise muchas secciones puede consumir mucho más que una consulta simple que pida un momento específico.
¿Por qué un 88 % menos de tokens no significa un 88 % menos de costo?
El video agéntico sigue realizando razonamiento y navegación. Puede inspeccionar transcripciones, cargar fotogramas, volver a muestrear un segmento y producir una respuesta final.
Por eso, la mayor reducción de tokens comunicada por Google es del 88 %, mientras que su mayor reducción comunicada en los costos de análisis es del 66 %.
La factura de tokens puede incluir varios tipos de trabajo:
- el mensaje de texto original,
- razonamiento de navegación,
- transcripción cargada dinámicamente,
- fotogramas cargados para su inspección,
- audio cargado cuando es necesario,
- y la respuesta final generada.
Por lo tanto, el objetivo no es eliminar el procesamiento, sino destinarlo allí donde tenga el mayor valor informativo.
¿Qué puede encontrar el análisis de video agéntico que el análisis estático podría pasar por alto?
Google destaca varias cargas de trabajo en las que la inspección temporal adaptativa importa más que simplemente reducir los tokens.
| Caso de uso | Por qué ayuda la inspección agéntica |
|---|---|
| Recuperación de momentos de menos de un segundo | Vuelve a revisar ventanas temporales estrechas que una muestra de 1 FPS podría pasar por alto |
| Búsqueda de una aguja en un pajar | Busca en grabaciones de varias horas sin cargar todos los momentos por igual |
| Detección de anomalías | Vuelve a muestrear los periodos sospechosos a una frecuencia de fotogramas por segundo más alta |
| Conteo de acciones rápidas | Puede volver a reproducir la actividad con distintas frecuencias de muestreo |
| Edición de video | Puede localizar transiciones visuales y límites de eventos precisos |
Estas capacidades son especialmente relevantes para cámaras de seguridad, grabaciones deportivas, tutoriales, archivos de reuniones, grabaciones de pantalla y contenido de creadores.
En cada caso, el momento útil puede ser diminuto en comparación con la duración total del recurso.
¿El procesamiento agentivo de videos siempre es mejor que el procesamiento estático?
No. Los videos cortos aún pueden ser mejores candidatos para el procesamiento estático.
La guía de optimización de Google indica que el modo estático puede ofrecer un tiempo más rápido hasta el primer token en clips sensibles a la latencia de menos de unos cinco minutos, porque el procesamiento agentivo debe razonar, navegar y realizar rondas internas de herramientas antes de generar una respuesta.
| Situación | Mejor punto de partida |
|---|---|
| Clip de producto de 30 segundos | Estático |
| Clip corto en el que la latencia de respuesta es lo más importante | Estático |
| Conferencia de 90 minutos | Agentivo |
| Encontrar un evento en horas de grabación | Agentivo |
| Inspeccionar una acción rápida alrededor de una marca de tiempo | Agentivo |
| Resumen sencillo de un video corto | El procesamiento estático puede ser suficiente |
La lección útil no es «el procesamiento agentivo reemplaza al video estático».
La estrategia de procesamiento de videos ahora puede adaptarse a la carga de trabajo.
¿Gemini Agentic Video reemplaza al RAG de video?
No. La navegación de videos en el momento de la consulta y la recuperación persistente de videos resuelven problemas distintos.
Gemini Agentic Video comienza con una entrada de video y decide qué partes de ella merecen una inspección más detallada. Un sistema de RAG de video normalmente comienza un paso antes: ayuda a determinar qué videos o segmentos de una colección mucho más grande deben llegar al modelo multimodal.
| RAG de video | Comprensión agentiva de videos |
|---|---|
| Indexa una colección persistente | Investiga el video proporcionado en el momento de la consulta |
| Recupera videos o segmentos candidatos | Decide cómo inspeccionar esos candidatos |
| Puede usar transcripciones, OCR, metadatos y embeddings | Usa dinámicamente la transcripción, el audio y los fotogramas |
| Útil en archivos muy grandes | Útil para el razonamiento profundo sobre medios seleccionados |
La distinción está respaldada por investigaciones sobre la comprensión de videos largos.
La investigación LongVideoBench sobre el razonamiento en videos de una hora contiene 3.763 videos y 6.678 preguntas anotadas por humanos en 17 categorías. Sus autores plantean el desafío central como la recuperación y el razonamiento sobre información multimodal detallada a partir de entradas extensas.
Ese texto es importante: recuperar y razonar, no simplemente «encajar el video en su contexto».
¿En qué se diferencia Video RAG de simplemente darle a Gemini un video largo?
Video RAG resulta especialmente útil cuando la colección es mucho más grande que una sola grabación.
La investigación de VideoRAG sobre colecciones de videos extremadamente largas explora este problema en un conjunto de referencia que contiene más de 160 videos, con un total de más de 134 horas.
El sistema propuesto combina la fundamentación del conocimiento textual con la recuperación multimodal, en lugar de esperar que una sola invocación del modelo ingiera toda la biblioteca.
Esto sugiere una arquitectura útil de dos etapas:
ETAPA 1
RECUPERACIÓN PERSISTENTE DE VIDEO
Archivo de video
|
v
Transcripciones
Metadatos
Escenas
OCR
Embeddings
Marcas de tiempo
|
v
Videos candidatos
Intervalos de tiempo candidatos
|
v
ETAPA 2
INSPECCIÓN AGÉNTICA DE VIDEO
Segmento seleccionado
|
v
Navegar
Volver a ver
Cambiar los FPS
Inspeccionar audio / transcripción / fotogramas
|
v
Respuesta profunda
Las dos capas se complementan.
La recuperación decide qué video inspeccionar; la comprensión agéntica del video decide con qué profundidad inspeccionarlo.
¿Por qué las grandes bibliotecas de videos deberían buscar antes de realizar un análisis de IA profundo?
Un servidor multimedia personal puede almacenar 20 TB de video. Un archivo de seguridad puede crecer mucho más. Sin embargo, la pregunta de un usuario puede depender, en última instancia, de ocho segundos de metraje.
Esa diferencia cambia la arquitectura.
El modelo multimodal no debería tener que convertirse en el índice de todo el archivo.
En su lugar:
ARCHIVO DE VIDEO DE 50 TB
|
v
Índice local con capacidad de búsqueda
|
v
20 videos candidatos
|
v
3 intervalos de tiempo candidatos
|
v
45 segundos de video relevante
|
v
Razonamiento multimodal profundo
Las cifras exactas son ilustrativas, pero el principio es escalable.
El problema de infraestructura consiste en convertir videos a escala de almacenamiento en contexto a escala de consulta.
A medida que crece el archivo, esta capa de selección se vuelve más importante, no menos. Nuestra guía sobre hardware de AI NAS para indexación, procesamiento multimedia y grandes conjuntos de datos locales explica por qué el almacenamiento, la capa SSD activa, la red y la capacidad de cómputo de IA deben dimensionarse como recursos independientes, en lugar de tratarse como un único requisito genérico de IA.
¿Cómo sería una canalización de video con AI NAS?
Un AI NAS que indexa y comprende los archivos multimedia almacenados no necesita ejecutar Gemini para aportar inteligencia útil. Puede encargarse del trabajo persistente y repetitivo más cercano a los archivos multimedia originales.
Una arquitectura híbrida práctica podría ser así:
ARCHIVO DE VIDEOS NAS
Videos originales
|
v
PROCESAMIENTO LOCAL
Metadatos de archivos
Transcripciones
Límites de escenas
Marcas de tiempo
OCR
Miniaturas
Etiquetas de objetos
Embeddings
|
v
BÚSQUEDA LOCAL
|
v
Video candidato
Intervalo de tiempo candidato
|
v
POLÍTICA / DECISIÓN DEL USUARIO
|
+--------------------+
| |
v v
MODELO LOCAL MODELO EN LA NUBE
|
v
Video agéntico de Gemini
|
v
Razonamiento profundo sobre videos
Este es un patrón de arquitectura, no una integración anunciada de Google con productos NAS.
La ventaja es que el almacenamiento, la indexación y el razonamiento del modelo ya no tienen que ejecutarse en la misma máquina.
Un NAS de nube personal con varias unidades, como ZimaCube 2, puede seguir siendo la capa multimedia duradera. Una CPU o GPU local puede generar metadatos. Un modelo multimodal en la nube puede reservarse para preguntas en las que su mejor razonamiento temporal justifique la transferencia y el costo de la API.
En una configuración dividida, un servidor local compacto de indexación y preprocesamiento, como ZimaBoard 2 también puede ejecutar servicios adyacentes al almacenamiento sin que la máquina de inferencia de alto rendimiento tenga que permanecer activa para cada tarea en segundo plano.
¿Deben estar los metadatos de video y los índices de IA junto a los archivos originales?
No es obligatorio, pero mantener la capa de búsqueda cerca del archivo puede simplificar varios aspectos de un flujo de trabajo de contenido multimedia privado.
| Capa de datos local | ¿Por qué mantenerlo cerca del archivo? |
|---|---|
| Metadatos de archivos | Son fáciles de regenerar y actualizar cuando cambia el contenido multimedia |
| Transcripciones | Se pueden buscar sin volver a abrir cada video |
| Marcas de tiempo de las escenas | Proporcionan rutas directas al metraje original |
| Miniaturas | Permiten una exploración visual ligera |
| Embeddings | Permiten la recuperación semántica en toda la colección |
| Texto OCR | Hace que los letreros, las diapositivas, las interfaces y los subtítulos puedan realizar búsquedas |
Las rutas estables también son importantes. Si el índice indica que ocurrió un evento en camera-02/2026-09-01.mp4 a las 18:41:12, el sistema de recuperación necesita una forma confiable de encontrar ese recurso original más adelante.
Por lo tanto, en las colecciones multimedia de larga duración, el índice y el archivo están estrechamente relacionados, aunque técnicamente se almacenen en bases de datos o volúmenes separados.
La misma división del almacenamiento aparece en los sistemas de fotos y videos autoalojados. Por ejemplo, nuestra guía de hardware de Immich para bibliotecas de fotos y videos separa los originales en grandes cantidades de las cargas de trabajo sensibles a la latencia, como la base de datos, las miniaturas, el aprendizaje automático y el procesamiento de video.
¿Qué es una arquitectura de IA de video activa, templada y fría?
Los archivos de vídeo grandes tampoco necesitan que cada dato se almacene con el mismo nivel de procesamiento.
Un diseño útil separa tres niveles:
| Nivel | Contenido | Prioridad |
|---|---|---|
| Archivo frío | Grabaciones originales en 4K, grabaciones antiguas, archivo de vigilancia | Capacidad y durabilidad |
| Índice de IA templado | Transcripciones, marcas de tiempo, miniaturas, OCR, embeddings, etiquetas | Capacidad de búsqueda |
| Conjunto de trabajo activo | Clips candidatos, recortes temporales y segmentos con alta frecuencia de fotogramas | Análisis rápido de IA |
FRÍO
20 TB de contenido multimedia original
|
v
TEMPLADO
Metadatos e índices consultables
|
v
ACTIVO
Clip relevante de 10–60 segundos
|
v
MODELO DE IA
Esta arquitectura concentra el análisis costoso en una fracción mínima de los datos originales.
Además, evita tener que reconstruir los mismos metadatos básicos cada vez que llega una pregunta nueva.
Por lo general, los niveles activo y templado necesitan mucha menos capacidad que el archivo de vídeo original, pero pueden beneficiarse de un almacenamiento SSD ágil para bases de datos, miniaturas, embeddings, índices y clips temporales. En un servidor doméstico ampliable, la ampliación PCIe a SSD NVMe para índices y cachés activos de IA puede mantener estos datos de trabajo separados del almacenamiento masivo en discos duros.
¿Puede Gemini Agentic Video analizar grabaciones privadas de un NAS sin subirlas?
No. Gemini Agentic Video es una capacidad de la nube, por lo que el contenido de vídeo que analiza Gemini debe ser accesible para el servicio de Google.
Actualmente, Google admite varias vías de entrada de vídeo, incluidos archivos multimedia subidos, el registro en Cloud Storage, datos insertados para entradas pequeñas y URL públicas de YouTube.
La documentación de procesamiento de vídeo de Gemini recomienda la API de archivos para muchas entradas multimedia grandes o reutilizables.
Según la documentación actual de Google, los archivos subidos mediante la API de archivos de Gemini se almacenan durante 48 horas antes de eliminarse automáticamente.
Eso es muy distinto de afirmar que las grabaciones permanecen dentro de la red doméstica.
La documentación actual sobre los precios de la API para niveles de pago de Google también indica que, de forma predeterminada, los datos de los niveles de pago no se utilizan para mejorar sus productos. Aun así, los desarrolladores deben evaluar los requisitos de retención, registro, región, organización y cumplimiento antes de enviar grabaciones sensibles a un servicio externo.
¿Cómo puede un archivo de vídeo privado usar la IA en la nube de forma más selectiva?
Un flujo de trabajo híbrido puede reducir la cantidad de contenido multimedia privado que necesita procesamiento externo.
La primera pasada puede mantenerse local:
- identificar el archivo,
- buscar en la transcripción,
- filtrar por cámara o fecha,
- detectar movimiento o cambios de escena,
- recuperar las marcas de tiempo candidatas,
- y generar un clip candidato breve.
Este tipo de separación sigue el mismo principio que se analiza en nuestra guía sobre mantener cerca de los datos privados el procesamiento de IA asociado al almacenamiento: el NAS puede seguir siendo una capa de datos estable incluso cuando la inferencia más pesada se realiza en otro lugar.
Solo entonces el flujo de trabajo decide si es necesario recurrir al razonamiento en la nube.
ARCHIVO DE VIDEO PRIVADO
|
v
BÚSQUEDA + FILTRADO LOCALES
|
v
Segmento relevante encontrado
|
v
¿Esta pregunta requiere
¿Se necesita un razonamiento multimodal más avanzado?
|
+---+---+
| |
No Sí
| |
v v
Local Clip aprobado
respuesta |
v
Video agéntico de Gemini
Esto no hace que Gemini sea local. Hace que el límite de datos sea más estrecho.
En lugar de tratar todo un archivo privado como posible contexto para la nube, el sistema puede decidir qué contenido multimedia merece escalarse.
¿Cuándo debe mantenerse local el análisis de video y cuándo debe recurrirse a Gemini?
La respuesta adecuada depende de la privacidad, la dificultad, la escala, el hardware y del nivel de razonamiento multimodal que requiera la tarea.
| Tarea de video | Punto de partida probable |
|---|---|
| Buscar una frase en la transcripción | Local |
| Filtrar grabaciones por fecha o cámara | Local |
| Generar miniaturas | Local |
| Detección básica de movimiento | Local |
| Crear embeddings para un archivo privado | Local |
| Encontrar un video semánticamente relevante | La recuperación local puede ser eficaz |
| Interpretar una secuencia compleja de eventos | Modelo multimodal avanzado |
| Localizar una acción sutil de menos de un segundo | El análisis de video agéntico puede ser útil |
| Razonar sobre elementos visuales, habla y orden temporal | Modelo multimodal avanzado |
| Grabaciones de seguridad altamente sensibles | Mantenerlo local salvo que el procesamiento externo sea aceptable explícitamente |
En implementaciones con muchas cámaras, la decisión es especialmente importante porque la grabación continua y la detección en tiempo real generan cargas de trabajo diferentes. Nuestra guía sobre almacenamiento NVR privado e inteligencia de video local aborda por separado el almacenamiento y la detección permanente frente al razonamiento multimodal en la nube.
El objetivo no es maximizar el procesamiento local ni el procesamiento en la nube.
Consiste en usar la capa más económica y segura capaz de resolver cada parte de la tarea.
¿La función de video agéntico de Gemini cambia lo que debería hacer un NAS con IA?
Sí, pero no convirtiendo el NAS en una máquina que tenga que entender cada fotograma con el modelo multimodal más grande posible.
La función más escalable es hacer que la colección multimedia sea navegable mediante IA.
Eso significa conservar los originales y mantener:
- transcripciones con capacidad de búsqueda,
- metadatos alineados temporalmente,
- índices de escenas,
- OCR,
- incrustaciones,
- miniaturas,
- permisos,
- y enlaces confiables de vuelta al metraje original.
Este es el papel más amplio que se describe en un NAS con IA como capa de inteligencia local para los datos almacenados: el almacenamiento sigue siendo la base, mientras que los índices y los servicios de IA facilitan la búsqueda, la comprensión y la reutilización de esos datos.
Una vez que existe esa capa, el modelo de razonamiento se vuelve reemplazable.
Hoy podría ser Gemini Agentic Video. Otro flujo de trabajo podría utilizar un modelo multimodal local. Un sistema futuro podría combinar varios modelos según la privacidad, el costo o la precisión.
El archivo no debería tener que reconstruirse para cada modelo.
Esta es la misma lección arquitectónica que está surgiendo en otras formas de datos de IA: el modelo no necesita toda la información del usuario. Necesita la pieza de información correcta más pequeña para la tarea actual.
En el caso del texto, puede significar un puñado de documentos recuperados.
En el caso de la memoria agéntica, puede significar un pequeño conjunto de archivos de conocimiento estructurados.
En el caso del video, puede significar doce segundos ocultos dentro de cincuenta terabytes de grabaciones.
Gemini Agentic Video es importante porque acerca el razonamiento multimodal a ese modelo. En lugar de tratar el video como un bloque de contexto gigantesco, el sistema puede decidir activamente dónde vale la pena dedicar atención.
Para las grandes bibliotecas privadas de contenido multimedia, el siguiente paso es aún más importante:
el modelo multimodal no debería convertirse en el índice. Debería convertirse en el investigador que llega después de que el índice haya acotado la búsqueda.
Preguntas frecuentes: Gemini Agentic Video, NAS con IA y búsqueda privada de contenido multimedia
¿Qué es Gemini Agentic Video Understanding?
Es un modo de procesamiento de video de Gemini que navega dinámicamente por la línea de tiempo de un video en lugar de procesar todos los fotogramas muestreados en una sola pasada estática. El modelo puede inspeccionar de forma selectiva la transcripción, el audio y los fotogramas visuales, y aumentar el nivel de detalle del muestreo cuando un segmento prometedor requiere un análisis más minucioso.
¿Cuántos tokens menos utiliza Gemini Agentic Video?
Google informa de hasta un 88 % menos de tokens en las cargas de trabajo de video de larga duración que probó. No se trata de una reducción fija. El uso real de tokens depende del video, la complejidad de la consulta y la cantidad de contenido que el modelo decida inspeccionar.
¿Tener un 88 % menos de tokens significa que Gemini Agentic Video es un 88 % más barato?
No. Google informa de reducciones de hasta un 66 % en los costos de análisis. El procesamiento agéntico sigue utilizando tokens para la navegación, el razonamiento, el contenido de video cargado dinámicamente y el resultado final.
¿Gemini Agentic Video es más preciso que el procesamiento de video estático?
Google informa de mejoras de calidad de hasta aproximadamente un 7 % en sus pruebas comparativas. El beneficio es especialmente relevante cuando el modelo necesita encontrar eventos breves o pruebas específicas dentro de grabaciones largas.
¿Qué frecuencia de fotogramas utiliza normalmente Gemini para los vídeos?
El modo predeterminado de procesamiento de vídeo de Gemini toma muestras de fotogramas visuales a 1 FPS. Los desarrolladores pueden configurar distintas frecuencias, mientras que Agentic Video puede cambiar dinámicamente la densidad con la que inspecciona secciones concretas.
¿Es mejor Agentic Video para clips cortos?
No siempre. Las directrices de Google indican que el procesamiento estático puede ofrecer un tiempo más rápido hasta el primer token para vídeos cortos y sensibles a la latencia, porque el modo agéntico añade pasos de navegación y razonamiento antes de responder.
¿Sustituye Gemini Agentic Video a Video RAG?
No. Video RAG puede indexar y recuperar candidatos de un archivo persistente de gran tamaño. Después, Agentic Video puede investigar con mayor profundidad un vídeo o segmento seleccionado. La recuperación decide qué inspeccionar; el razonamiento de vídeo agéntico decide cómo inspeccionarlo.
¿Puede Gemini Agentic Video ejecutarse directamente en un NAS?
No. Gemini Agentic Video es actualmente una capacidad alojada por Google. Un NAS puede almacenar e indexar los archivos multimedia originales, pero el contenido enviado a Gemini debe estar disponible para el servicio en la nube de Google.
¿Cuánto tiempo conserva Gemini los archivos de vídeo subidos?
La documentación actual de la API Files de Google indica que los archivos subidos se almacenan durante 48 horas. Los desarrolladores que trabajen con grabaciones sensibles deben revisar las políticas más recientes de la API, registro, retención y uso de datos antes de subir archivos multimedia.
¿Qué debería almacenar un NAS de IA además de los vídeos originales?
Una capa multimedia con capacidad de búsqueda puede incluir transcripciones, marcas de tiempo, miniaturas, texto OCR, límites de escenas, etiquetas de objetos o eventos, embeddings y otros metadatos que permiten a un sistema de IA recuperar clips relevantes sin procesar repetidamente todo el archivo.
¿Necesitan almacenamiento SSD o NVMe los índices de IA de vídeo?
No todos los archivos de vídeo necesitan NVMe para sus archivos multimedia originales. Las grabaciones voluminosas pueden permanecer en un almacenamiento orientado a la capacidad, mientras que las bases de datos, miniaturas, embeddings, índices y clips de trabajo temporales a los que se accede con frecuencia pueden beneficiarse de una capa más rápida de SSD o NVMe. La distribución de almacenamiento adecuada depende del tamaño de la biblioteca, la actividad de indexación y las cargas de trabajo simultáneas.
¿Deben analizarse las grabaciones de vigilancia localmente o en la nube?
Las grabaciones sensibles son buenas candidatas para el filtrado, la indexación y el análisis básico local. El procesamiento en la nube puede ser útil para preguntas multimodales más complejas cuando el usuario o la organización acepta explícitamente la transferencia de datos externa y las políticas de retención aplicables.
¿Cuál es la mejor arquitectura para una biblioteca de vídeos de IA muy grande?
Un diseño escalable separa el archivo original, una capa persistente de metadatos con capacidad de búsqueda, un pequeño conjunto de clips candidatos de trabajo frecuente y el modelo de razonamiento multimodal. Esto convierte una gran colección almacenada en una cantidad mucho menor de contexto relevante para la consulta.
Centro de Tecnología e IA
Más para leer

Las 10 mejores interfaces web de IA local para laboratorios domésticos en 2026
Compara 10 interfaces web de IA locales autoalojadas para laboratorios domésticos, incluyendo compatibilidad con Ollama, RAG, agentes, acceso multiusuario, dificultad de configuración y casos...

¿Cuánto cuesta GPT-6 Astra con el tiempo? Cuándo tiene sentido la IA en la nube frente a la IA local
Una guía práctica sobre los costos de GPT-6 Astra que abarca el uso de tokens, las cargas de trabajo de IA a largo plazo,...

GPT-6 Astra frente a la IA local: ¿Qué partes de un agente deberían permanecer en tu servidor doméstico?
GPT-6 Astra puede permanecer en la nube mientras tu servidor doméstico mantiene localmente los archivos, la memoria, el RAG, las herramientas, los permisos y...

