Gemini 에이전틱 비디오는 토큰을 최대 88% 적게 사용합니다—AI NAS와 프라이빗 미디어 검색에 의미하는 것

로렌 판ZimaSpace의 창립자이며 이자 호평받는 ZimaBoard 시리즈의 설계자입니다. 산업 디자인과 임베디드 엔지니어링을 결합하여, Lauren은 명확한 사명을 가지고 ZimaSpace를 시작했습니다: 개인 클라우드 컴퓨팅의 대중화. 그는 하드웨어가 "해킹 가능하고 아름다워야 한다"는 신념을 가지고 있습니다—산업용 서버와 소비자 기기 사이의 격차를 해소하는 것입니다. 오늘날 그는 창작자들이 디지털 삶을 완전히 제어할 수 있는 도구를 만드는 엔지니어링 팀을 이끌고 있습니다.

Gemini 에이전틱 동영상은 전체 동영상을 고정된 샘플링 속도로 처리하는 대신 어떤 순간에 주의를 기울일지 모델이 결정하도록 함으로써 동영상 AI를 변화시킵니다. Google에 따르면 테스트한 워크로드에서 토큰을 최대 88% 줄이고, 비용을 최대 66% 절감하며, 품질을 최대 7% 향상할 수 있습니다. 중요한 변화는 단순히 동영상 분석 비용이 저렴해지는 데 그치지 않습니다. Gemini는 타임라인을 검색하고, 가능성이 높은 순간을 검사한 다음, 질문에 더 높은 세부 수준이 필요할 때 해당 순간을 다시 살펴볼 수 있습니다.

수년 치 감시 영상을 보관하는 NAS, 가족 동영상, 회의 영상 또는 크리에이터 아카이브의 경우에도 Gemini가 갑자기 전체 라이브러리를 로컬에서 “시청”할 수 있다는 뜻은 아닙니다. Gemini는 여전히 Google 클라우드에서 실행됩니다. 더 흥미로운 아키텍처는 먼저 대규모 비공개 아카이브를 로컬에서 선별한 다음, 더 면밀한 검사가 필요한 클립이나 시간 범위만 멀티모달 모델에 제공하는 것입니다. 다시 말해, 인프라 문제는 스토리지 규모의 동영상을 쿼리 규모의 컨텍스트로 전환하는 것이 됩니다.

Gemini 에이전틱 동영상 이해란 무엇인가요?

Gemini 에이전틱 동영상 이해는 Gemini가 한 번의 처리 과정에서 한 가지 고정 속도로 프레임을 불러오는 대신 동영상을 능동적으로 탐색할 수 있도록 하는 동영상 처리 모드입니다.

Google은 2026년 9월 1일에 이 기능을 소개했습니다. 출시 발표에서는 처음에 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite를 다뤘으며, Google의 현재 개발자 문서에는 에이전틱 동영상 처리를 지원하는 모델로 Gemini 3.8 Flash도 나열되어 있습니다.

Google의 에이전틱 동영상 이해 발표에 따르면, 이 모델은 추론 기능과 네이티브 동영상 도구를 결합해 프레임, 오디오, 트랜스크립트에서 관련 부분을 검색하고 스캔하며 검사합니다.

처리 모드 동영상 시청 방식 적합한 경우
정적 기본적으로 초당 1프레임(1 FPS)의 고정 속도로 프레임을 샘플링하고, 한 번의 처리 과정에서 이를 컨텍스트에 넣습니다. 짧거나 예측 가능한 클립
에이전트형 타임라인을 동적으로 탐색하고 관련 프레임, 트랜스크립트 또는 오디오만 불러옵니다. 긴 동영상 및 특정 순간을 대상으로 하는 쿼리

이러한 차이는 모델이 더 이상 수동적인 시청자가 아니기 때문에 중요합니다.

내부적으로 다음에는 어디를 살펴봐야 하지?라고 물을 수 있습니다.

고정 1 FPS로 동영상을 시청하는 것이 비효율적인 이유는 무엇일까요?

정적 동영상 처리는 단순하고 예측 가능합니다. Gemini는 기본적으로 초당 1프레임의 고정 프레임 속도로 동영상을 샘플링하고, 샘플링된 프레임을 오디오와 함께 처리합니다.

동영상이 짧을 때는 효과적입니다. 입력이 한 시간 또는 여러 시간 동안 지속되면 매력이 크게 떨어집니다.

정적 동영상 처리

동영상
  |
  v
고정 1 FPS 샘플링
  |
  v
프레임 1
프레임 2
프레임 3
프레임 4
...
  |
  v
대규모 컨텍스트
  |
  v
모델
  |
  v
답변

Google의 최신 Gemini 토큰 문서는 유용한 예를 제시합니다. 고해상도 정적 처리에서 약 108만 토큰이 필요할 수 있는 1시간 분량의 강의가 질문과 콘텐츠에 따라 에이전틱 처리에서는 약 10만 8천 토큰을 사용할 수 있습니다.

대부분의 질문에는 동영상의 매 순간이 필요하지 않기 때문에 이러한 차이가 발생합니다.

사용자가 “발표자는 저장 비용에 대해 어떤 결론에 도달했나요?”라고 묻는다면, 유용한 근거는 한 시간짜리 발표 중 90초에만 포함되어 있을 수 있습니다.

나머지 58분을 처리한다고 해서 답변이 자동으로 더 좋아지는 것은 아닙니다.

고정 프레임 샘플링으로도 중요한 이벤트를 놓칠 수 있는 이유는 무엇일까요?

토큰 사용량은 문제의 절반에 불과합니다. 고정 샘플링은 잘못된 순간을 확인하게 만들 수도 있습니다.

두 개의 샘플링된 프레임 사이에 누군가 현관 앞에 소포를 놓는 보안 카메라 녹화를 생각해 보세요.

00:10.0
비어 있는 현관
    |
    |  소포가 여기에 놓임
    |
00:11.0
현관 앞의 소포

1 FPS 보기에서는 동작 전후의 상태는 포착할 수 있지만 정작 동작 자체를 놓칠 수 있습니다.

Google은 1초 미만 순간 검색을 에이전틱 비디오의 새로운 기능 중 하나로 특별히 강조합니다. 모델은 유망한 시간 범위를 식별한 다음, 전체 녹화 영상에 높은 프레임 속도를 적용하는 대신 해당 구간을 더 촘촘하게 다시 샘플링할 수 있습니다.

이러한 유형의 집중 검사는 로컬에 저장된 보안 카메라 이벤트와 녹화 영상에 특히 유용합니다. 몇 시간 분량의 영상 속에서 유용한 이벤트가 단 몇 초 동안만 발생할 수 있기 때문입니다.

원칙은 간단합니다.

답이 있을 가능성이 높은 부분에 더 많은 시각적 대역폭을 할당합니다.

Gemini는 동영상에서 어떤 부분을 시청할지 어떻게 결정할까요?

에이전틱 비디오는 동영상 이해를 반복적인 과정으로 전환합니다. 추론을 시작하기 전에 하나의 샘플링 전략을 고정하는 대신, Gemini는 작업이 진행됨에 따라 입력을 검사하는 방식을 바꿀 수 있습니다.

Google은 이 시스템을 어떤 내용을, 어떤 속도로, 어떤 방식으로 시청할지 선택한다고 설명합니다.

사용자 쿼리
    |
    v
필요한 증거가 무엇인지 추론
    |
    v
동영상 타임라인 탐색
    |
    +---------------------+
    |          |          |
    v          v          v
트랜스크립트   오디오      프레임
    |          |          |
    +----------+----------+
               |
               v
      관련 순간을 찾았나요?
               |
          +----+----+
          |         |
         아니요        예
          |         |
          v         v
 다시 검색   더 심층적으로 검사
               더 높은 FPS
               더 높은 세부 수준
                    |
                    v
                  답변

이를 통해 일반적인 멀티모달 프롬프트보다 조사에 가까운 반복 작업이 만들어집니다.

먼저 트랜스크립트를 통해 특정 주제가 대략 어디에서 언급되는지 확인할 수 있습니다. 그런 다음 프레임을 사용해 화면에 무엇이 나타났는지 검증할 수 있습니다. 빠르게 발생한 시각적 이벤트가 중요하다면 모델은 해당 구간을 더 높은 프레임 속도로 검사할 수 있습니다.

모달리티 자체가 추론 결정의 일부가 됩니다.

에이전틱 동영상이 토큰을 최대 88%까지 줄일 수 있는 이유는 무엇일까요?

에이전틱 동영상은 답변에 기여하지 않는 미디어를 제외하여 토큰을 절약합니다. 동영상 전체를 단순히 88% 압축하는 것이 아닙니다.

Google의 최신 가격 정책 안내에 따르면 토큰 소비량은 모델이 동적으로 로드하는 항목에 따라 달라지므로 가변적입니다. 쿼리의 복잡성, 동영상 콘텐츠, 샘플링 깊이가 모두 결과에 영향을 줍니다.

Google이 보고한 결과 의미
토큰 최대 88% 감소 선택적 로딩을 사용하면 모델 컨텍스트에 포함되는 미디어를 크게 줄일 수 있습니다.
분석 비용 최대 66% 절감 토큰 사용량이 낮아지면 총비용을 줄일 수 있지만, 일대일 비율로 감소하는 것은 아닙니다.
품질 최대 7% 향상 동적 검사는 정적 샘플링이 놓치는 증거도 찾아낼 수 있습니다.

이는 Google이 테스트한 동영상 워크로드 전반에서 얻은 결과이며, 모든 입력에 대해 보장되는 고정값은 아닙니다.

현재 Gemini API 가격 정책 안내에는 에이전틱 동영상의 토큰 수가 원본 동영상의 전체 길이가 아니라 모델이 로드한 콘텐츠에 따라 결정된다고 명시되어 있습니다.

모델이 여러 구간을 다시 확인해야 하는 어려운 질문은 특정 한 순간만 묻는 간단한 질문보다 훨씬 많은 작업을 소비할 수 있습니다.

토큰이 88% 줄어든다고 해서 비용도 88% 낮아지지 않는 이유는 무엇일까요?

에이전틱 동영상은 여전히 추론과 탐색을 수행합니다. 트랜스크립트를 검사하고, 프레임을 로드하고, 특정 구간을 다시 샘플링하고, 최종 답변을 생성할 수 있습니다.

Google이 보고한 최대 토큰 감소율이 88%인 반면, 보고한 최대 분석 비용 감소율은 66%인 이유가 바로 여기에 있습니다.

토큰 비용에는 여러 종류의 작업이 포함될 수 있습니다.

  • 원본 텍스트 프롬프트,
  • 탐색 추론,
  • 동적으로 로드되는 트랜스크립트,
  • 검사를 위해 로드되는 프레임,
  • 필요할 때 로드되는 오디오,
  • 그리고 최종 생성 응답입니다.

따라서 목표는 처리를 없애는 것이 아닙니다. 정보 가치가 가장 높은 곳에 처리를 집중하는 것입니다.

에이전틱 동영상 분석으로 정적 분석이 놓칠 수 있는 무엇을 찾을 수 있을까요?

Google은 단순히 토큰을 줄이는 것보다 적응형 시간 검사가 더 중요한 여러 워크로드를 강조합니다.

사용 사례 에이전틱 검사가 유용한 이유
1초 미만 순간 검색 1FPS 샘플링으로 놓칠 수 있는 짧은 시간 구간을 다시 확인
건초 더미에서 바늘 찾기 검색 모든 순간을 동일하게 불러오지 않고 여러 시간 분량의 녹화를 검색
이상 탐지 의심스러운 구간을 더 높은 FPS로 다시 샘플링
빠른 동작 세기 서로 다른 샘플링 속도로 활동을 다시 확인할 수 있음
동영상 편집 정확한 시각적 전환과 이벤트 경계를 찾을 수 있음

이러한 기능은 특히 보안 카메라, 스포츠 영상, 튜토리얼, 회의 아카이브, 화면 녹화, 크리에이터 미디어와 관련이 깊습니다.

각 경우에 유용한 순간은 전체 미디어의 길이에 비해 매우 짧을 수 있습니다.

에이전트형 동영상이 항상 정적 처리보다 나을까요?

아니요. 짧은 동영상도 정적 처리에 더 적합할 수 있습니다.

Google의 최적화 가이드에 따르면 약 5분 이하의 지연 시간 민감형 클립에서는 정적 모드가 첫 토큰까지 더 빠른 시간을 제공할 수 있습니다. 에이전트형 처리에는 답변을 생성하기 전에 추론, 탐색, 내부 도구 호출 왕복이 필요하기 때문입니다.

상황 더 나은 시작점
30초 제품 클립 정적
응답 지연 시간이 가장 중요한 짧은 클립 정적
90분 강의 에이전트형
수 시간 분량의 영상에서 하나의 이벤트 찾기 에이전트형
특정 타임스탬프 주변의 빠른 동작 검사 에이전트형
짧은 동영상의 간단한 요약 정적 처리가 충분할 수 있음

유용한 교훈은 “에이전트형 처리가 정적 동영상 처리를 대체한다”가 아닙니다.

핵심은 이제 동영상 처리 전략이 워크로드에 맞춰 조정될 수 있다는 점입니다.

에이전트형 동영상이 동영상 RAG를 대체할까요?

아니요. 쿼리 시점의 동영상 탐색과 지속적인 동영상 검색은 서로 다른 문제를 해결합니다.

Gemini 에이전트형 동영상은 동영상 입력으로 시작해 해당 입력 중 어떤 부분을 더 자세히 살펴볼 가치가 있는지 결정합니다. 동영상 RAG 시스템은 일반적으로 한 단계 더 앞에서 시작합니다. 훨씬 더 큰 컬렉션에서 어떤 동영상이나 세그먼트를 멀티모달 모델에 전달할지 결정하는 데 도움을 줍니다.

동영상 RAG 에이전트형 동영상 이해
지속적인 컬렉션 색인 쿼리 시점에 제공된 동영상 조사
후보 동영상 또는 세그먼트 검색 후보를 어떻게 검사할지 결정
트랜스크립트, OCR, 메타데이터, 임베딩을 사용할 수 있음 트랜스크립트, 오디오, 프레임을 동적으로 사용
매우 큰 아카이브 전반에서 유용 선택한 미디어에 대한 심층 추론에 유용

이러한 구분은 긴 동영상 이해에 관한 연구로 뒷받침됩니다.

1시간 분량 동영상 추론에 관한 LongVideoBench 연구에는 17개 카테고리에 걸쳐 3,763개의 동영상과 사람이 주석을 단 6,678개의 질문이 포함되어 있습니다. 저자들은 핵심 과제를 긴 입력에서 세부적인 멀티모달 정보를 검색하고 그 위에서 추론하는 일로 설명합니다.

해당 표현은 중요합니다. 단순히 “동영상을 맥락에 맞게 이해한다”가 아니라, 검색하고 추론한다는 뜻입니다.

Video RAG는 단순히 Gemini에 긴 동영상을 제공하는 것과 어떻게 다를까요?

Video RAG는 컬렉션이 단일 녹화본보다 훨씬 클 때 특히 유용합니다.

초장시간 동영상 컬렉션에 대한 VideoRAG 연구는 총 160개가 넘는 동영상, 134시간 이상의 분량으로 구성된 벤치마크를 통해 이 문제를 탐구합니다.

제안된 시스템은 하나의 모델 호출이 전체 라이브러리를 입력받도록 하는 대신, 텍스트 지식 그라운딩과 멀티모달 검색을 결합합니다.

이를 통해 다음과 같은 2단계 아키텍처를 제안할 수 있습니다.

1단계
지속형 동영상 검색

동영상 아카이브
     |
     v
트랜스크립트
메타데이터
장면
OCR
임베딩
타임스탬프
     |
     v
후보 동영상
후보 시간 범위

          |
          v

2단계
에이전트형 동영상 검사

선택한 세그먼트
     |
     v
탐색
다시 보기
FPS 변경
오디오 / 트랜스크립트 / 프레임 검사
     |
     v
심층 답변

두 계층은 서로를 보완합니다.

검색은 검사할 동영상을 결정하고, 에이전트형 동영상 이해는 얼마나 깊이 검사할지 결정합니다.

대규모 동영상 라이브러리는 왜 심층 AI 분석 전에 검색해야 할까요?

개인 미디어 서버에는 20TB의 동영상이 저장될 수 있습니다. 보안 아카이브는 훨씬 더 커질 수 있습니다. 하지만 사용자의 질문은 궁극적으로 영상 8초에 좌우될 수 있습니다.

이 차이가 아키텍처를 바꿉니다.

멀티모달 모델이 전체 아카이브의 인덱스가 될 필요는 없습니다.

대신:

50TB 동영상 아카이브
        |
        v
검색 가능한 로컬 인덱스
        |
        v
후보 동영상 20개
        |
        v
후보 시간 범위 3개
        |
        v
관련 동영상 45초
        |
        v
심층 멀티모달 추론

정확한 수치는 예시일 뿐이지만, 원칙은 확장됩니다.

인프라의 과제는 스토리지 규모의 동영상을 쿼리 규모의 컨텍스트로 전환하는 것입니다.

아카이브가 커질수록 이 선택 계층은 덜 중요해지는 것이 아니라 더욱 중요해집니다. 인덱싱, 미디어 처리, 대규모 로컬 데이터 세트를 위한 AI NAS 하드웨어 가이드는 스토리지, 활성 SSD 계층, 네트워크, AI 컴퓨팅을 하나의 일반적인 AI 요구 사항으로 취급하지 말고 별도의 리소스로 규모를 산정해야 하는 이유를 설명합니다.

AI NAS 동영상 파이프라인은 어떤 모습일까요?

저장된 미디어를 인덱싱하고 이해하는 AI NAS가 유용한 지능형 기능을 제공하기 위해 반드시 Gemini 자체를 실행할 필요는 없습니다. 원본 미디어와 가장 가까운 곳에서 지속적이고 반복적인 작업을 처리할 수 있습니다.

실용적인 하이브리드 아키텍처는 다음과 같을 수 있습니다.

NAS 동영상 아카이브
원본 동영상
        |
        v
로컬 처리
파일 메타데이터
트랜스크립트
장면 경계
타임스탬프
OCR
썸네일
객체 태그
임베딩
        |
        v
로컬 검색
        |
        v
후보 동영상
후보 시간 범위
        |
        v
정책 / 사용자 결정
        |
        +--------------------+
        |                    |
        v                    v
로컬 모델          클라우드 모델
                           |
                           v
                  Gemini 에이전틱 비디오
                           |
                           v
                  심층 동영상 추론

이는 아키텍처 패턴이지, NAS 제품과 Google의 공식 통합이 발표되었다는 뜻은 아닙니다.

스토리지, 색인 및 모델 추론을 더 이상 동일한 머신에서 수행할 필요가 없다는 것이 장점입니다.

ZimaCube 2와 같은 다중 드라이브 개인 클라우드 NAS는 안정적인 미디어 계층으로 유지할 수 있습니다. 로컬 CPU 또는 GPU가 메타데이터를 생성할 수 있습니다. 클라우드 멀티모달 모델은 전송 및 API 비용을 감수할 만한 더 강력한 시간적 추론이 필요한 질문에만 사용할 수 있습니다.

분리형 구성에서는 ZimaBoard 2와 같은 소형 로컬 색인 및 전처리 서버가 스토리지 인접 서비스를 실행할 수도 있으므로, 모든 백그라운드 작업마다 고성능 추론 머신을 계속 켜 둘 필요가 없습니다.

동영상 메타데이터와 AI 색인은 원본 파일 옆에 있어야 할까요?

반드시 그래야 하는 것은 아니지만, 검색 가능한 계층을 아카이브 가까이에 두면 개인 미디어 워크플로의 여러 부분을 간소화할 수 있습니다.

로컬 데이터 계층 아카이브 가까이에 보관해야 하는 이유
파일 메타데이터 미디어가 변경될 때 쉽게 재생성하고 업데이트 가능
트랜스크립트 모든 동영상을 다시 열지 않고도 검색 가능
장면 타임스탬프 원본 영상으로 바로 연결되는 경로를 제공
썸네일 가벼운 시각적 탐색을 가능하게 함
임베딩 컬렉션 전체에서 의미 기반 검색을 지원
OCR 텍스트 표지판, 슬라이드, 인터페이스 및 자막을 검색할 수 있게 함

색인에 이벤트가 다음 위치에서 발생했다고 기록되어 있다면 안정적인 경로도 중요합니다. camera-02/2026-09-01.mp4 18:41:12에 검색 시스템은 나중에 해당 원본 파일을 찾을 수 있는 안정적인 방법이 필요합니다.

오래 유지되는 미디어 컬렉션에서는 색인과 아카이브가 기술적으로 별도의 데이터베이스나 볼륨에 저장되더라도 서로 밀접하게 연결되어 있습니다.

셀프 호스팅 사진 및 동영상 시스템에서도 동일한 스토리지 분할이 나타납니다. 예를 들어, 당사의 사진 및 동영상 라이브러리용 Immich 하드웨어 가이드는 대용량 원본 파일과 지연 시간에 민감한 데이터베이스, 썸네일, 머신러닝 및 동영상 처리 워크로드를 분리합니다.

핫·웜·콜드 비디오 AI 아키텍처란 무엇인가요?

대규모 동영상 아카이브도 모든 데이터를 동일한 처리 수준으로 저장할 필요는 없습니다.

유용한 설계는 세 가지 계층을 분리합니다.

계층 콘텐츠 우선순위
콜드 아카이브 원본 4K 영상, 오래된 녹화물, 감시 영상 아카이브 용량 및 내구성
웜 AI 인덱스 트랜스크립트, 타임스탬프, 썸네일, OCR, 임베딩, 태그 검색성
핫 작업 세트 후보 클립, 임시 크롭, 고프레임레이트 구간 빠른 AI 분석
콜드
원본 미디어 20TB
        |
        v
웜
검색 가능한 메타데이터 + 인덱스
        |
        v
핫
관련 10~60초 클립
        |
        v
AI 모델

이 아키텍처는 비용이 많이 드는 분석을 원본 데이터의 극히 일부에 집중할 수 있게 합니다.

또한 새 질문이 들어올 때마다 동일한 기본 메타데이터를 다시 생성하지 않아도 됩니다.

웜 및 핫 계층에는 일반적으로 원본 동영상 아카이브보다 훨씬 적은 용량이 필요하지만, 데이터베이스, 썸네일, 임베딩, 인덱스, 임시 클립을 위해 응답성이 뛰어난 SSD 스토리지를 활용할 수 있습니다. 확장 가능한 홈 서버에서는 활성 AI 인덱스와 캐시를 위한 PCIe to NVMe SSD 확장으로 이러한 작업 데이터를 대용량 HDD 스토리지와 분리할 수 있습니다.

Gemini Agentic Video는 업로드 없이 개인 NAS 영상을 분석할 수 있을까요?

아니요. Gemini Agentic Video 자체가 클라우드 기능이므로 Gemini가 분석하는 동영상 콘텐츠는 Google 서비스에서 접근할 수 있어야 합니다.

Google은 현재 업로드된 미디어, Cloud Storage 등록, 소규모 입력을 위한 인라인 데이터, 공개 YouTube URL 등 여러 동영상 입력 경로를 지원합니다.

Gemini 동영상 처리 문서에서는 더 크거나 재사용할 미디어 입력에 Files API를 사용할 것을 권장합니다.

Google의 현재 문서에 따르면 Gemini Files API를 통해 업로드된 파일은 48시간 동안 저장된 후 자동으로 삭제됩니다.

이는 영상이 홈 네트워크 내부에 남는다는 말과는 전혀 다릅니다.

Google의 현재 유료 요금제 API 가격 책정 문서에도 기본적으로 유료 요금제 데이터가 제품 개선에 사용되지 않는다고 명시되어 있습니다. 하지만 개발자는 민감한 녹화물을 외부 서비스로 전송하기 전에 보존, 로깅, 지역, 조직 및 규정 준수 요건을 여전히 평가해야 합니다.

개인 동영상 아카이브에서 클라우드 AI를 더 선별적으로 활용하려면 어떻게 해야 할까요?

하이브리드 워크플로는 외부에서 처리해야 하는 개인 미디어의 양을 줄일 수 있습니다.

첫 번째 단계는 로컬에 유지할 수 있습니다.

  • 파일을 식별합니다.
  • 트랜스크립트를 검색합니다.
  • 카메라 또는 날짜별로 필터링합니다.
  • 동작 또는 장면 전환을 감지합니다.
  • 후보 타임스탬프를 검색합니다.
  • 그리고 짧은 후보 클립을 생성합니다.

이러한 분리는 비공개 데이터와 가까운 곳에 스토리지 인접 AI 처리를 유지하는 것에 관한 가이드에서 설명한 원칙을 따릅니다. 더 무거운 추론이 다른 곳에서 수행되더라도 NAS는 안정적인 데이터 계층으로 남을 수 있습니다.

그런 다음에야 워크플로에서 클라우드 추론이 필요한지 결정합니다.

비공개 비디오 아카이브
        |
        v
로컬 검색 + 필터링
        |
        v
관련 세그먼트 찾음
        |
        v
이 질문에 다음이 필요한가요
더 강력한 멀티모달 추론이 필요한가요?
        |
    +---+---+
    |       |
   아니요      예
    |       |
    v       v
 로컬   승인된 클립
 답변       |
              v
        Gemini 에이전틱 비디오

이렇게 해도 Gemini가 로컬에서 실행되는 것은 아닙니다. 다만 데이터 경계가 더 좁아집니다.

전체 비공개 아카이브를 잠재적인 클라우드 컨텍스트로 취급하는 대신, 시스템이 어떤 미디어를 상위 단계로 보낼지 결정할 수 있습니다.

비디오 분석은 언제 로컬에 유지하고 언제 Gemini로 보낼까요?

적절한 답은 개인정보 보호, 난이도, 규모, 하드웨어, 그리고 작업에 필요한 멀티모달 추론의 정도에 따라 달라집니다.

비디오 작업 권장 시작점
문구로 트랜스크립트 검색 로컬
날짜 또는 카메라별 영상 필터링 로컬
썸네일 생성 로컬
기본 동작 감지 로컬
비공개 아카이브용 임베딩 생성 로컬
의미상 관련 있는 비디오 찾기 로컬 검색도 강력할 수 있음
복잡한 사건 흐름 해석 고급 멀티모달 모델
1초 미만의 미묘한 동작 찾기 에이전틱 비디오 분석이 도움이 될 수 있음
시각 정보, 음성, 시간적 순서를 바탕으로 추론 고급 멀티모달 모델
고도로 민감한 보안 영상 외부 처리가 명시적으로 허용되지 않는 한 로컬에 유지

카메라 중심 배포에서는 지속적인 녹화와 실시간 감지가 서로 다른 워크로드를 만들기 때문에 이 결정이 특히 중요합니다. 비공개 NVR 저장소 및 로컬 비디오 인텔리전스 가이드에서는 클라우드 멀티모달 추론과 별도로 저장소 및 상시 감지 측면을 다룹니다.

목표는 로컬 처리나 클라우드 처리 중 하나를 극대화하는 것이 아닙니다.

각 작업을 해결할 수 있는 가장 저렴하고 안전한 계층을 사용하는 것입니다.

Gemini 에이전틱 비디오는 AI NAS가 해야 할 일을 어떻게 바꿀까요?

맞습니다. 하지만 NAS를 가장 큰 멀티모달 모델로 모든 프레임을 이해해야 하는 장치로 만들 필요는 없습니다.

확장성이 더 뛰어난 역할은 미디어 컬렉션을 AI가 탐색할 수 있도록 만드는 것입니다.

즉, 원본을 보존하면서 다음 항목을 유지해야 합니다:

  • 검색 가능한 트랜스크립트,
  • 시간에 맞춰 정렬된 메타데이터,
  • 장면 인덱스,
  • OCR,
  • 임베딩,
  • 썸네일,
  • 권한,
  • 원본 영상으로 연결되는 안정적인 링크

이는 저장된 데이터를 위한 로컬 지능 계층으로서의 AI NAS가 수행하는 더 광범위한 역할입니다. 스토리지는 기반으로 남고, 인덱스와 AI 서비스가 스토리지를 더 쉽게 검색하고 이해하며 재사용할 수 있도록 합니다.

이 계층이 존재하면 추론 모델을 교체할 수 있게 됩니다.

오늘은 Gemini Agentic Video일 수 있습니다. 다른 워크플로에서는 로컬 멀티모달 모델을 사용할 수도 있습니다. 미래의 시스템은 개인정보 보호, 비용 또는 정확도에 따라 여러 모델을 조합할 수 있습니다.

모델마다 아카이브를 새로 구축할 필요는 없어야 합니다.

이는 다른 형태의 AI 데이터 전반에서 나타나는 동일한 아키텍처상의 교훈입니다. 모델에는 사용자의 모든 정보가 필요하지 않습니다. 현재 작업에 필요한 가장 작고 정확한 정보 조각이 필요합니다.

텍스트에서는 검색된 몇 개의 문서를 의미할 수 있습니다.

에이전트 메모리에서는 소수의 구조화된 지식 파일을 의미할 수 있습니다.

비디오에서는 50테라바이트의 녹화물 속에 숨겨진 12초를 의미할 수 있습니다.

Gemini Agentic Video가 중요한 이유는 멀티모달 추론을 해당 모델에 더 가깝게 가져오기 때문입니다. 비디오를 하나의 거대한 컨텍스트 블록으로 취급하는 대신, 시스템이 어디에 주의를 기울일 가치가 있는지 능동적으로 결정할 수 있습니다.

대규모 비공개 미디어 라이브러리에서는 다음 단계가 더욱 중요합니다.

멀티모달 모델이 인덱스가 되어서는 안 됩니다. 인덱스가 검색 범위를 좁힌 뒤 도착하는 조사자가 되어야 합니다.

FAQ: Gemini Agentic Video, AI NAS 및 비공개 미디어 검색

Gemini Agentic Video Understanding이란 무엇인가요?

이는 한 번의 정적 처리 과정에서 샘플링된 모든 프레임을 처리하는 대신 비디오의 타임라인을 동적으로 탐색하는 Gemini 비디오 처리 모드입니다. 모델은 트랜스크립트, 오디오 및 시각적 프레임을 선택적으로 검사하고, 유망한 구간을 더 면밀히 분석해야 할 때 샘플링 세부 수준을 높일 수 있습니다.

Gemini Agentic Video는 토큰을 얼마나 적게 사용하나요?

Google은 테스트한 장편 비디오 워크로드에서 토큰을 최대 88%까지 줄일 수 있다고 보고합니다. 이는 고정된 감소율이 아닙니다. 실제 토큰 사용량은 비디오, 쿼리의 복잡성, 모델이 검사하기로 선택한 콘텐츠의 양에 따라 달라집니다.

토큰이 88% 줄어든다는 것은 Gemini Agentic Video가 88% 더 저렴하다는 뜻인가요?

아니요. Google은 분석 비용을 최대 66%까지 줄일 수 있다고 보고합니다. 에이전트 방식의 처리에서도 탐색, 추론, 동적으로 로드되는 비디오 콘텐츠 및 최종 출력에 토큰이 사용됩니다.

Gemini Agentic Video가 정적 비디오 처리보다 더 정확한가요?

Google은 테스트한 벤치마크 전반에서 품질이 최대 약 7% 향상되었다고 보고합니다. 이러한 이점은 모델이 긴 녹화 영상에서 짧은 이벤트나 특정 증거를 찾아야 할 때 특히 중요합니다.

Gemini는 일반적으로 동영상에 어떤 프레임 속도를 사용하나요?

Gemini의 기본 정적 동영상 처리 모드는 초당 1프레임으로 시각적 프레임을 샘플링합니다. 개발자는 다른 속도를 구성할 수 있으며, Agentic Video는 특정 구간을 얼마나 조밀하게 검사할지 동적으로 변경할 수 있습니다.

짧은 클립에는 Agentic Video가 더 나은가요?

항상 그런 것은 아닙니다. Google의 안내에 따르면, 에이전틱 모드는 답변 전에 탐색 및 추론 단계를 추가하므로 짧고 지연 시간에 민감한 동영상에서는 정적 처리가 첫 토큰까지 더 빠른 시간을 제공할 수 있습니다.

Gemini Agentic Video가 Video RAG를 대체하나요?

아니요. Video RAG는 대규모의 지속적인 아카이브에서 후보를 인덱싱하고 검색할 수 있습니다. 그런 다음 Agentic Video가 선택된 동영상이나 세그먼트를 더 심층적으로 조사할 수 있습니다. 검색은 무엇을 검사할지 결정하고, 에이전틱 비디오 추론은 어떻게 검사할지 결정합니다.

Gemini Agentic Video를 NAS에서 직접 실행할 수 있나요?

아니요. Gemini Agentic Video는 현재 Google이 호스팅하는 기능입니다. NAS는 원본 미디어를 저장하고 인덱싱할 수 있지만, Gemini로 전송되는 콘텐츠는 Google의 클라우드 서비스에서 액세스할 수 있어야 합니다.

Gemini는 업로드된 동영상 파일을 얼마나 오래 보관하나요?

Google의 최신 Files API 문서에 따르면 업로드된 파일은 48시간 동안 저장됩니다. 민감한 영상을 다루는 개발자는 미디어를 업로드하기 전에 최신 API, 로깅, 보존 및 데이터 사용 정책을 검토해야 합니다.

AI NAS에는 원본 동영상 외에 무엇을 저장해야 하나요?

검색 가능한 미디어 계층에는 트랜스크립트, 타임스탬프, 썸네일, OCR 텍스트, 장면 경계, 객체 또는 이벤트 태그, 임베딩 및 기타 메타데이터가 포함될 수 있습니다. 이를 통해 AI 시스템은 전체 아카이브를 반복해서 처리하지 않고도 관련 클립을 검색할 수 있습니다.

비디오 AI 인덱스에는 SSD 또는 NVMe 스토리지가 필요한가요?

모든 비디오 아카이브에 원본 미디어용 NVMe가 필요한 것은 아닙니다. 대용량 영상은 용량 중심 스토리지에 보관하고, 자주 액세스하는 데이터베이스, 썸네일, 임베딩, 인덱스 및 임시 작업 클립은 더 빠른 SSD 또는 NVMe 계층의 이점을 활용할 수 있습니다. 적절한 스토리지 구성은 라이브러리 규모, 인덱싱 활동 및 동시 워크로드에 따라 달라집니다.

감시 영상은 로컬에서 분석해야 하나요, 클라우드에서 분석해야 하나요?

민감한 영상은 로컬 필터링, 인덱싱 및 기본 분석에 적합한 대상입니다. 사용자가 명시적으로 외부 데이터 전송과 관련 보존 정책을 수락하는 경우, 더 어려운 멀티모달 질문에는 클라우드 처리가 유용할 수 있습니다.

매우 큰 AI 비디오 라이브러리에 가장 적합한 아키텍처는 무엇인가요?

확장 가능한 설계는 원본 아카이브, 지속적으로 검색 가능한 메타데이터 계층, 후보 클립으로 구성된 소규모 핫 작업 세트, 멀티모달 추론 모델을 분리합니다. 이를 통해 대규모로 저장된 컬렉션을 쿼리와 관련된 훨씬 적은 양의 컨텍스트로 전환할 수 있습니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.