Geminiのエージェント型動画処理はトークン使用量を最大88%削減—AI NASとプライベートなメディア検索に何を意味するのか

ローレン・パンZimaSpaceの創設者です そして 高く評価されているZimaBoardシリーズの設計者です。産業デザインと組み込みエンジニアリングを融合させ、 Laurenは明確な使命を持ってZimaSpaceを立ち上げました:パーソナルクラウドコンピューティングを民主化することです 。彼はハードウェアは「ハック可能」であり美しくあるべきだと信じています—産業用サーバーと消費者向けガジェットのギャップを埋めること。現在、彼はエンジニアリングチームを率いて、クリエイターが デジタルライフを完全にコントロールできるツールを構築していますfull control over their digital lives.

Gemini Agentic Videoは、動画全体を固定のサンプリングレートで処理するのではなく、どの瞬間に注意を向ける価値があるかをモデル自身が判断できるようにすることで、動画AIを変革します。Googleによると、テストしたワークロードではトークン使用量を最大88%、コストを最大66%削減し、品質を最大7%向上できました。重要な変化は、動画分析が単に安くなったことではありません。Geminiはタイムラインを検索し、有望な瞬間を精査し、質問に応じてより高い精度で再度確認できるのです。

数年分の監視映像を保存したNAS、家族の動画、会議、クリエイターのアーカイブを扱う場合でも、Geminiがライブラリ全体を突然ローカルで「視聴」できるという意味ではありません。Geminiは依然としてGoogleのクラウド上で動作します。より興味深いアーキテクチャは、まず大規模なプライベートアーカイブをローカルで絞り込み、より詳しい調査に値するクリップや時間範囲だけをマルチモーダルモデルに渡すことです。つまり、インフラの課題はストレージ規模の動画をクエリ規模のコンテキストに変換することになります。

Gemini Agentic Video Understandingとは?

Gemini Agentic Video Understandingは、1回の処理で一定のレートでフレームを読み込むのではなく、Geminiが動画内を能動的にナビゲートできる動画処理モードです。

Googleは2026年9月1日にこの機能を導入しました。発表当初の対象モデルはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteでしたが、Googleの現在の開発者向けドキュメントには、エージェント型動画処理に対応するモデルとしてGemini 3.8 Flashも記載されています。

GoogleのAgentic Video Understandingに関する発表によると、モデルは推論とネイティブの動画ツールを組み合わせ、フレーム、音声、文字起こしの関連部分を検索、スキャン、精査します。

処理モード 動画の視聴方法 最適な用途
静的処理 デフォルトでは毎秒1フレーム(1 FPS)の固定レートでフレームをサンプリングし、1回の処理でコンテキストに配置します 短い動画や内容が予測しやすいクリップ
エージェント型 タイムラインを動的にナビゲートし、関連するフレーム、文字起こし、音声だけを読み込みます 長時間の動画や、特定の瞬間を対象とするクエリ

この違いは重要です。モデルはもはや受動的な閲覧者ではないからです。

「次はどこを調べればよいか」と内部的に問いかけることができます。

固定した1 FPSで動画を見るのはなぜ非効率なのでしょうか?

静的動画処理はシンプルで予測しやすい方法です。Geminiは固定フレームレート(デフォルトでは毎秒1フレーム)で動画をサンプリングし、サンプリングしたフレームを音声とともに処理します。

動画が短い場合にはうまく機能します。しかし、入力が1時間、あるいは数時間に及ぶと、魅力が大幅に低下します。

静的動画処理

動画
  |
  v
固定1 FPSサンプリング
  |
  v
フレーム1
フレーム2
フレーム3
フレーム4
...
  |
  v
大規模コンテキスト
  |
  v
モデル
  |
  v
回答

Googleの現在のGeminiトークンのドキュメントには、分かりやすい例があります。高解像度の静的処理では約108万トークンが必要になる可能性がある1時間の講義でも、質問と内容によっては、エージェント型処理なら約108,000トークンで済む場合があります。

この違いが生じるのは、ほとんどの質問で動画の1秒ごとを確認する必要がないためです。

ユーザーが「話者はストレージコストについてどのような結論に達しましたか?」と尋ねた場合、役立つ証拠は1時間のプレゼンテーションのうち90秒にしか存在しない可能性があります。

残りの58分を処理しても、自動的に答えが良くなるわけではありません。

固定フレームサンプリングでは、重要なイベントを見逃すことがあるのはなぜでしょうか?

トークン消費は問題の半分にすぎません。固定サンプリングでは、間違った瞬間を見てしまうこともあります。

2つのサンプリングフレームの間で、誰かが玄関先に荷物を置く防犯カメラの録画を考えてみてください。

00:10.0
荷物のない玄関先
    |
    |  ここに荷物が置かれました
    |
00:11.0
玄関先の荷物

1 FPSの表示では、動作の前後の状態は捉えられても、動作そのものを見逃す可能性があります。

Googleは、Agentic Videoの新機能の1つとして1秒未満の瞬間の検索を明確に挙げています。モデルは有望な時間範囲を特定し、その区間全体に高いフレームレートを適用するのではなく、その範囲をより高密度に再サンプリングできます。

このような対象を絞った検査は、ローカルに保存された防犯カメラのイベントや録画に特に関係します。数時間に及ぶ映像の中で、役立つイベントが数秒しか続かない場合があるためです。

原則はシンプルです。

答えがありそうな部分に、より多くの視覚的な帯域幅を割り当てます。

Geminiは動画のどの部分を見るかをどのように決めるのでしょうか?

Agentic Videoは、動画の理解を反復的なプロセスに変えます。推論を始める前に1つのサンプリング戦略を決めてしまうのではなく、Geminiはタスクの進行に応じて入力をどのように調べるかを変更できます。

Googleは、システムが何を見るか、どの速度で見るか、どのモダリティを通じて見るかを選択すると説明しています。

ユーザークエリ
    |
    v
必要な証拠について推論
    |
    v
動画のタイムラインを移動
    |
    +---------------------+
    |          |          |
    v          v          v
トランスクリプト 音声 フレーム
    |          |          |
    +----------+----------+
               |
               v
      関連する瞬間が見つかりましたか?
               |
          +----+----+
          |         |
         いいえ        はい
          |         |
          v         v
 再検索  さらに詳しく検査
               より高いFPS
               より高い詳細度
                    |
                    v
                  回答

これにより、通常のマルチモーダルプロンプトよりも、調査に近いループが形成されます。

まずトランスクリプトから、ある話題がおおよそどこで扱われているかが分かることがあります。次にフレームで、画面上に何が表示されたかを確認できます。短時間の視覚イベントが重要な場合は、モデルがその狭い区間をより高いフレームレートで検査できます。

モダリティ自体が推論上の判断材料になります。

エージェント型動画解析でトークンを最大88%削減できるのはなぜですか?

エージェント型動画解析は、回答に寄与しないメディアを避けることでトークンを節約します。動画全体を単純に88%圧縮するわけではありません。

Googleの最新の料金情報によると、トークン消費量はモデルが動的に読み込む内容に左右されるため、変動します。クエリの複雑さ、動画の内容、サンプリングの深度がすべて結果に影響します。

Googleが報告した結果 意味
トークンを最大88%削減 選択的な読み込みによって、モデルのコンテキストに入るメディアを大幅に減らせます
分析コストを最大66%削減 トークン使用量の削減によって総コストを下げられますが、1対1の割合で下がるわけではありません
品質が最大7%向上 動的な検査によって、静的サンプリングでは見逃す証拠も捉えられます

これらはGoogleがテストした動画ワークロード全体での結果であり、すべての入力に対する固定的な保証ではありません。

現在のGemini APIの料金情報には、エージェント型動画解析のトークン数は、元の動画の全長ではなく、モデルが読み込んだコンテンツに応じて決まると明記されています。

モデルに多くのセクションを再確認させる難しい質問では、特定の瞬間を1つ尋ねるだけの単純なクエリよりも、はるかに多くの処理を消費する可能性があります。

トークンが88%減っても、コストが88%下がるわけではないのはなぜですか?

エージェント型動画解析でも、推論とナビゲーションは引き続き行われます。トランスクリプトを検査したり、フレームを読み込んだり、特定区間を再サンプリングしたり、最終回答を生成したりすることがあります。

そのため、Googleが報告したトークン削減率の最高値は88%である一方、分析コスト削減率の最高値は66%となっています。

トークン料金には、次のような複数の作業が含まれる場合があります。

  • 元のテキストプロンプト、
  • ナビゲーションに関する推論、
  • 動的に読み込まれるトランスクリプト、
  • 検査のために読み込まれるフレーム、
  • 必要に応じて読み込まれる音声、
  • そして最終的に生成される回答。

したがって、目標は処理をゼロにすることではありません。情報価値が最も高い箇所に処理を割り当てることです。

静的解析では見逃す可能性があるものを、エージェント型動画解析は何を見つけられるのか?

Googleは、単にトークン数を削減するよりも、適応型の時間的検査が重要となるワークロードをいくつか強調しています。

ユースケース エージェント型検査が役立つ理由
1秒未満の瞬間の検索 1FPSのサンプルでは見逃す可能性がある短い時間枠を再確認する
干し草の山から針を探す検索 すべての瞬間を均等に読み込むことなく、数時間に及ぶ録画を検索する
異常検知 疑わしい時間帯をより高いFPSで再サンプリングする
素早い動作のカウント 異なるサンプリングレートでアクティビティを再視聴できる
動画編集 正確な映像の切り替わりやイベントの境界を特定できる

これらの機能は、特に防犯カメラ、スポーツ映像、チュートリアル、会議アーカイブ、画面録画、クリエイター向けメディアに関連します。

いずれの場合も、役立つ瞬間はアセット全体の長さに比べてごく短い可能性があります。

エージェント型動画は常に静的処理より優れているのか?

いいえ。短い動画でも、静的処理のほうが適している場合があります。

Googleの最適化ガイダンスによると、静的モードは、エージェント型処理では回答を生成する前に推論、ナビゲーション、内部ツールの往復を行う必要があるため、長さが約5分未満でレイテンシーが重視されるクリップでは、最初のトークンが生成されるまでの時間を短縮できる可能性があります。

状況 より良い出発点
30秒の商品紹介クリップ 静的処理
応答速度が最も重視される短いクリップ 静的処理
90分の講義 エージェント型
数時間分の映像から1つの出来事を見つける エージェント型
ある1つのタイムスタンプ周辺の急速な動きを詳しく調べる エージェント型
短い動画の簡単な要約 静的処理で十分な場合

有用な教訓は、「エージェント型処理が静的な動画処理に取って代わる」ということではありません。

重要なのは、動画処理の戦略をワークロードに合わせて適応できるようになったことです。

Gemini Agentic Videoは動画RAGに取って代わるのか?

いいえ。クエリ実行時の動画ナビゲーションと永続的な動画検索は、異なる問題を解決します。

Gemini Agentic Videoは動画入力から開始し、その入力のどの部分を詳しく調べる価値があるかを判断します。一方、動画RAGシステムは通常、1段階前から開始します。つまり、はるかに大規模なコレクションから、マルチモーダルモデルに渡すべき動画やセグメントを特定するのに役立ちます。

動画RAG エージェント型動画理解
永続的なコレクションにインデックスを付与 クエリ実行時に提供された動画を調査
候補となる動画やセグメントを検索 候補をどのように調べるかを決定
トランスクリプト、OCR、メタデータ、埋め込みを使用する場合がある トランスクリプト、音声、フレームを動的に使用
非常に大規模なアーカイブ全体で有用 選択したメディアを深く推論するのに有用

この違いは、長時間動画の理解に関する研究によって裏付けられています。

1時間に及ぶ動画の推論に関するLongVideoBenchの研究には、17カテゴリーにわたる3,763本の動画と、人手でアノテーションされた6,678件の質問が収録されています。著者らは、中核となる課題を、長い入力から詳細なマルチモーダル情報を検索し、その上で推論することだと位置づけています。

その表現は重要です。単に「動画を文脈に当てはめる」のではなく、検索して推論するということです。

Video RAGは、Geminiに長いビデオをそのまま渡す場合と、どのように異なるのでしょうか?

Video RAGは、コレクションが1本の録画よりもはるかに大きい場合に、特に役立ちます。

非常に長いビデオコレクションを対象としたVideoRAGの研究では、合計134時間を超える160本以上のビデオを含むベンチマークを用いて、この問題を検討しています。

提案システムは、1回のモデル呼び出しでライブラリ全体を取り込むのではなく、テキストによる知識グラウンディングとマルチモーダル検索を組み合わせます。

これは、次のような2段階アーキテクチャが有効であることを示しています。

ステージ1
永続的なビデオ検索

ビデオアーカイブ
     |
     v
文字起こし
メタデータ
シーン
OCR
埋め込み
タイムスタンプ
     |
     v
候補ビデオ
候補となる時間範囲

          |
          v

ステージ2
エージェント型ビデオ調査

選択されたセグメント
     |
     v
移動
再視聴
FPSを変更
音声/トランスクリプト/フレームを調査
     |
     v
深い回答

この2つのレイヤーは互いに補完し合います。

検索は調査するビデオを決め、エージェント型ビデオ理解はどこまで深く調査するかを決めます。

大規模なビデオライブラリでは、なぜ深いAI分析の前に検索を行うべきなのでしょうか?

個人用メディアサーバーには20 TBのビデオを保存できる場合があります。監視映像のアーカイブは、さらに大きくなる可能性があります。それでも、ユーザーの質問への回答に最終的に必要なのは、映像の8秒間だけかもしれません。

この違いによって、アーキテクチャは変わります。

マルチモーダルモデルがアーカイブ全体のインデックスになる必要はありません。

その代わりに:

50 TBのビデオアーカイブ
        |
        v
検索可能なローカルインデックス
        |
        v
候補ビデオ20本
        |
        v
候補となる時間範囲3件
        |
        v
関連するビデオ45秒
        |
        v
深いマルチモーダル推論

正確な数値は例示ですが、この原則は規模を拡大しても適用できます。

インフラの課題は、ストレージ規模のビデオをクエリ規模のコンテキストに変換することです。

アーカイブが拡大するほど、この選別レイヤーの重要性は増します。インデックス作成、メディア処理、大規模なローカルデータセットに必要なAI NASハードウェアについてのガイドでは、ストレージ、アクティブSSD層、ネットワーク、AIコンピューティングを、1つの一般的なAI要件として扱うのではなく、それぞれ別のリソースとしてサイジングすべき理由を説明しています。

AI NASのビデオパイプラインはどのようなものになるでしょうか?

保存されたメディアにインデックスを付けて内容を理解するAI NASは、それ自体でGeminiを実行しなくても、役立つインテリジェンスを提供できます。元のメディアに最も近い場所で、永続的かつ反復的な処理を担えるからです。

実用的なハイブリッドアーキテクチャは、次のようになります。

NAS動画アーカイブ
オリジナル動画
        |
        v
ローカル処理
ファイルメタデータ
文字起こし
シーンの境界
タイムスタンプ
OCR
サムネイル
オブジェクトタグ
埋め込み
        |
        v
ローカル検索
        |
        v
候補動画
候補となる時間範囲
        |
        v
ポリシー/ユーザーの判断
        |
        +--------------------+
        |                    |
        v                    v
ローカルモデル          クラウドモデル
                           |
                           v
                  Gemini Agentic Video
                           |
                           v
                  高度な動画推論

これはアーキテクチャのパターンであり、NAS製品とのGoogleの統合が発表されたという意味ではありません。

この利点により、ストレージ、インデックス作成、モデルによる推論を同じマシンで行う必要がなくなります。

ZimaCube 2のような複数ドライブ対応のパーソナルクラウドNASを、永続的なメディアレイヤーとして維持できます。ローカルCPUまたはGPUでメタデータを生成できます。クラウドのマルチモーダルモデルは、より高度な時間的推論に転送コストやAPIコストをかける価値がある質問のために使用できます。

分割構成では、ZimaBoard 2のようなコンパクトなローカルインデックス作成・前処理サーバーで、バックグラウンドジョブのたびに高性能な推論マシンを稼働させることなく、ストレージに近接したサービスも実行できます。

動画メタデータとAIインデックスはオリジナルファイルの隣に置くべきか?

必須ではありませんが、検索可能なレイヤーをアーカイブの近くに保持すると、プライベートメディアのワークフローのいくつかの部分を簡素化できます。

ローカルデータレイヤー アーカイブの近くに保持する理由
ファイルメタデータ メディアの変更時に簡単に再生成・更新できる
文字起こし すべての動画を再度開かずに検索できる
シーンのタイムスタンプ オリジナル映像への直接パスを提供する
サムネイル 軽量なビジュアルブラウジングを可能にする
埋め込み コレクション全体でセマンティック検索を可能にする
OCRテキスト 看板、スライド、インターフェース、字幕を検索可能にする

インデックスがイベントの発生場所を記録している場合、安定したパスも重要です。 camera-02/2026-09-01.mp4 18:41:12の時点で、検索システムには後からそのオリジナルアセットを確実に見つける方法が必要です。

長期保存するメディアコレクションでは、インデックスとアーカイブは、技術的に別々のデータベースやボリュームに保存されている場合でも、密接に関連しています。

同じストレージの分割は、セルフホスト型の写真・動画システムにも見られます。たとえば、写真・動画ライブラリ向けのImmichハードウェアガイドでは、大容量のオリジナルデータと、レイテンシーの影響を受けやすいデータベース、サムネイル、機械学習、動画処理のワークロードを分離しています。

ホット・ウォーム・コールドの動画AIアーキテクチャとは?

大規模な動画アーカイブでも、すべてのデータを同じ処理レベルで保存する必要はありません。

実用的な設計では、3つの層に分けます。

内容 優先度
コールドアーカイブ 元の4K映像、古い録画、監視アーカイブ 容量と耐久性
ウォームAIインデックス 文字起こし、タイムスタンプ、サムネイル、OCR、埋め込み、タグ 検索性
ホット作業セット 候補クリップ、一時クロップ、高フレームレートのセグメント 高速AI分析
コールド
元の20 TBのメディア
        |
        v
ウォーム
検索可能なメタデータ+インデックス
        |
        v
ホット
関連する10~60秒のクリップ
        |
        v
AIモデル

このアーキテクチャにより、高コストな分析を元データのごく一部に集中させられます。

また、新しい質問が届くたびに同じ基本メタデータを再構築する必要もなくなります。

ウォーム層とホット層に必要な容量は通常、元の動画アーカイブよりはるかに少なくて済みますが、データベース、サムネイル、埋め込み、インデックス、一時クリップには応答性の高いSSDストレージが役立ちます。拡張可能なホームサーバーでは、アクティブなAIインデックスとキャッシュ用のPCIe to NVMe SSD拡張により、この作業データを大容量HDDストレージから分離できます。

Gemini Agentic Videoは、アップロードせずにプライベートNASの映像を分析できますか?

いいえ。Gemini Agentic Video自体がクラウド機能であるため、Geminiが分析する動画コンテンツはGoogleのサービスからアクセス可能な状態にする必要があります。

Googleは現在、アップロードしたメディア、Cloud Storageへの登録、小容量入力向けのインラインデータ、公開YouTube URLなど、複数の動画入力経路をサポートしています。

Geminiの動画処理ドキュメントでは、大容量または再利用するメディア入力の多くにFiles APIを推奨しています。

Googleの現在のドキュメントによると、Gemini Files API経由でアップロードされたファイルは48時間保存され、その後自動的に削除されます。

これは、映像がホームネットワーク内に留まるという意味とは大きく異なります。

Googleの現在の有料プラン向けAPI料金ドキュメントには、有料プランのデータはデフォルトでは製品改善に使用されないとも記載されています。それでも開発者は、機密性の高い録画を外部サービスに送信する前に、保持、ログ記録、地域、組織、コンプライアンスに関する要件を評価すべきです。

プライベートな動画アーカイブで、クラウドAIをより選択的に利用するには?

ハイブリッドなワークフローにより、外部処理が必要なプライベートメディアの量を減らせます。

最初の処理はローカルに留められます:

  • ファイルを特定する
  • 文字起こしを検索する
  • カメラや日付で絞り込む
  • 動きやシーンの変化を検知する
  • 候補となるタイムスタンプを取得する
  • そして短い候補クリップを生成する

このような分離は、プライベートデータに近い場所でストレージに隣接するAI処理を行うことに関するガイドで説明している原則と同じです。より重い推論を別の場所で実行する場合でも、NASは安定したデータレイヤーとして維持できます。

その後で初めて、ワークフローはクラウド推論が必要かどうかを判断します。

プライベート動画アーカイブ
        |
        v
ローカル検索+フィルター
        |
        v
関連セグメントが見つかりました
        |
        v
この質問には必要ですか?
より強力なマルチモーダル推論が必要ですか?
        |
    +---+---+
    |       |
   いいえ はい
    |       |
    v       v
 ローカル 承認済みクリップ
 回答       |
              v
        Gemini Agentic Video

これはGeminiをローカル化するものではありません。データ境界をより狭めるものです。

プライベートアーカイブ全体をクラウドのコンテキスト候補として扱うのではなく、システムがどのメディアをエスカレーションすべきか判断できます。

動画分析をローカルに留めるべきなのは、どのような場合ですか?Geminiに送るべきなのは、どのような場合ですか?

適切な答えは、プライバシー、難易度、規模、ハードウェア、そしてタスクに必要なマルチモーダル推論の度合いによって異なります。

動画タスク 開始時の有力候補
文字起こしからフレーズを検索する ローカル
日付やカメラで映像を絞り込む ローカル
サムネイルを生成する ローカル
基本的な動体検知 ローカル
プライベートアーカイブの埋め込みを作成する ローカル
意味的に関連する動画を見つける ローカル検索でも高い性能を発揮できる
複雑な一連の出来事を解釈する 高度なマルチモーダルモデル
1秒未満の微妙な動作を特定する エージェント型動画分析が役立つ可能性がある
映像、音声、時間的な順序を横断して推論する 高度なマルチモーダルモデル
極めて機密性の高い防犯映像 外部処理を明示的に許可できる場合を除き、ローカルに保持する

カメラを多用する環境では、継続録画とリアルタイム検知が異なるワークロードを生み出すため、この判断は特に重要です。プライベートNVRストレージとローカル動画インテリジェンスに関するガイドでは、クラウドのマルチモーダル推論とは別に、ストレージと常時稼働の検知について解説しています。

目標は、ローカル処理やクラウド処理のどちらかを最大化することではありません。

それぞれのタスクを解決できる、最も低コストで安全なレイヤーを使うことです。

Gemini Agentic Videoによって、AI NASが担うべき役割は変わるのでしょうか?

はい。ただし、NASを可能な限り大規模なマルチモーダルモデルですべてのフレームを理解しなければならないマシンに変えるという意味ではありません。

よりスケーラブルな役割は、メディアコレクションをAIでナビゲート可能にすることです。

つまり、オリジナルを保持しながら、次の情報を維持するということです。

  • 検索可能なトランスクリプト、
  • 時間同期されたメタデータ、
  • シーンインデックス、
  • OCR、
  • 埋め込み、
  • サムネイル、
  • 権限、
  • そして、元の映像に戻れる信頼性の高いリンク。

これは、保存データのローカルインテリジェンスレイヤーとしてのAI NASが担う、より広範な役割です。ストレージが基盤であり続ける一方、インデックスとAIサービスによって、そのストレージの検索、理解、再利用が容易になります。

そのレイヤーが存在すれば、推論モデルは交換可能になります。

現在はGemini Agentic Videoかもしれません。別のワークフローではローカルのマルチモーダルモデルを使うかもしれません。将来のシステムでは、プライバシー、コスト、精度に応じて複数のモデルを組み合わせる可能性があります。

モデルごとにアーカイブを再構築する必要はありません。

これは、AIデータの他の形態でも明らかになっている、同じアーキテクチャ上の教訓です。モデルにユーザーの情報をすべて与える必要はありません。現在のタスクに必要な、正確で最小限の情報を与えればよいのです。

テキストの場合、それは取得された少数のドキュメントかもしれません。

エージェントのメモリの場合、それは構造化された少数のナレッジファイルかもしれません。

動画の場合、それは50テラバイトの録画の中に隠れた12秒間かもしれません。

Gemini Agentic Videoが重要なのは、マルチモーダル推論をそのモデルに近づけるからです。動画を巨大なコンテキストの塊として扱うのではなく、システムが注意を向ける価値のある場所を能動的に判断できます。

大規模なプライベートメディアライブラリでは、次のステップがさらに重要になります。

マルチモーダルモデルはインデックスになるべきではありません。インデックスによって検索範囲が絞り込まれた後に到着する調査員になるべきです。

FAQ:Gemini Agentic Video、AI NAS、プライベートメディア検索

Gemini Agentic Video Understandingとは何ですか?

これは、サンプリングしたすべてのフレームを1回の静的処理で処理するのではなく、動画のタイムラインを動的に移動するGeminiの動画処理モードです。モデルはトランスクリプト、音声、映像フレームを選択的に検査し、有望なセグメントをより詳しく分析する必要がある場合はサンプリングの詳細度を高められます。

Gemini Agentic Videoでは、トークンがどのくらい少なくなりますか?

Googleは、検証した長時間動画のワークロードでトークンが最大88%削減されたと報告しています。これは固定の削減率ではありません。実際のトークン使用量は、動画、クエリの複雑さ、モデルが検査することを選択したコンテンツ量によって異なります。

トークンが88%少ないということは、Gemini Agentic Videoの料金も88%安くなるということですか?

いいえ。Googleは分析コストが最大66%削減されると報告しています。エージェント型処理でも、ナビゲーション、推論、動的に読み込まれる動画コンテンツ、最終出力にトークンを使用します。

Gemini Agentic Videoは静的な動画処理より正確ですか?

Googleは、テストしたベンチマーク全体で最大およそ7%の品質向上を報告しています。この効果は、長時間の録画内から短時間のイベントや特定の証拠を見つける必要がある場合に、特に重要です。

Geminiは通常、動画にどのフレームレートを使用しますか?

Geminiのデフォルトの静的動画処理モードでは、映像フレームを毎秒1フレームの頻度でサンプリングします。開発者は異なるサンプリングレートを設定できますが、Agentic Videoでは特定の区間をどの程度密に調べるかを動的に変更できます。

短いクリップにはAgentic Videoのほうが適していますか?

必ずしもそうではありません。Googleのガイダンスによると、短くレイテンシーが重視される動画では、エージェント型モードが回答前にナビゲーションと推論の手順を追加するため、静的処理のほうが初回トークンの生成までの時間が短くなる場合があります。

Gemini Agentic VideoはVideo RAGに取って代わりますか?

いいえ。Video RAGは、大規模な永続アーカイブから候補をインデックス化して取得できます。その後、Agentic Videoが選択された動画またはセグメントをより深く調査できます。取得によって調査対象が決まり、エージェント型動画推論によって調査方法が決まります。

Gemini Agentic VideoはNAS上で直接実行できますか?

いいえ。Gemini Agentic Videoは現在、Googleがホストする機能です。NASは元のメディアを保存してインデックス化できますが、Geminiに送信するコンテンツはGoogleのクラウドサービスからアクセス可能な状態にする必要があります。

Geminiはアップロードした動画ファイルをどのくらい保持しますか?

Googleの現在のFiles APIドキュメントによると、アップロードしたファイルは48時間保存されます。機密性の高い映像を扱う開発者は、メディアをアップロードする前に、最新のAPI、ログ、保持、データ利用に関するポリシーを確認してください。

AI NASには元の動画以外に何を保存すべきですか?

検索可能なメディア層には、トランスクリプト、タイムスタンプ、サムネイル、OCRテキスト、シーン境界、オブジェクトやイベントのタグ、埋め込み、その他のメタデータを含めることができます。これにより、AIシステムはアーカイブ全体を繰り返し処理することなく、関連するクリップを取得できます。

動画AIのインデックスにはSSDまたはNVMeストレージが必要ですか?

すべての動画アーカイブで、元のメディアにNVMeが必要とは限りません。大量の映像は容量重視のストレージに保存したままにし、頻繁にアクセスするデータベース、サムネイル、埋め込み、インデックス、一時的な作業用クリップには、より高速なSSDまたはNVMeの階層を利用できます。適切なストレージ構成は、ライブラリの規模、インデックス作成の頻度、同時実行されるワークロードによって異なります。

監視映像はローカルとクラウドのどちらで分析すべきですか?

機密性の高い映像は、ローカルでのフィルタリング、インデックス作成、基本分析に適しています。ユーザーまたは組織が外部へのデータ転送と適用される保持ポリシーを明示的に受け入れる場合、より難しいマルチモーダルな質問にはクラウド処理が役立つことがあります。

非常に大規模なAI動画ライブラリには、どのようなアーキテクチャが最適ですか?

スケーラブルな設計では、元のアーカイブ、永続的で検索可能なメタデータ層、候補クリップの小規模なホット作業セット、マルチモーダル推論モデルを分離します。これにより、大量に保存されたコレクションを、クエリに関連するはるかに少量のコンテキストへ変換できます。

テック&AIハブ

もっと読む

2026年版ホームラボ向けローカルAI Web UIトップ10
Sep 04, 2026

2026年版ホームラボ向けローカルAI Web UIトップ10

ホームラボ向けに、Ollama対応、RAG、エージェント、マルチユーザーアクセス、セットアップの手間、最適な用途を含む、セルフホスト可能なローカルAIウェブUI 10種類を比較します。

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.