Gemini 3.8 Liveを解説:AIが見て、話して、同時に考えられるとき

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

Gemini 3.8 Liveが重要なのは、音声AIに限った話ではありません。Googleはリアルタイムの音声・視覚コンテキストを推論、ツール呼び出し、長時間実行タスクと組み合わせ、バックグラウンドで作業を続けながらアシスタントとのやり取りを継続できるようにしました。

画面共有自体は新しいものではありません - Gemini Liveはすでに2025年にカメラ共有と画面共有に対応していました。より大きな変化は、AIが変化するタスクを継続的に観察し、あなたが話している間も推論を続け、すべての手順を別々のプロンプトに分けることなく作業を実行できるようになりつつあることです。これはローカルAIに関する問いも変えます。アシスタントがあなたの周囲の音を聞き、視覚情報を継続的に取得できるなら、クラウドに送信される前に何をローカルでフィルタリングすべきでしょうか?

Gemini 3.8 Liveとは?

Googleは2026年9月にGemini 3.8 LiveGemini 3.8 Live Extended Thinkingを発表しました。

Googleの公式発表によると、どちらのモデルもテキスト、画像、音声、動画を入力として受け取り、テキストまたは音声で応答します。違いは、ライブセッション中に実行するよう設計されている作業量です。

Gemini 3.8 Live Live Extended Thinking
主な目的 高速なリアルタイムインタラクション 複雑な複数ステップのライブタスク
推論 インターリーブ推論 バックグラウンドでの拡張推論
視覚入力 はい はい
音声インタラクション はい はい
関数呼び出し 対応 非同期ワークフロー
入力コンテキスト 131,072トークン 131,072トークン
最適な用途 応答性の高いライブアシスタント 会話を続けながら実行する、より長時間のエージェントタスク

Googleのモデルドキュメントでは、標準のLiveは低遅延のインタラクション向けと位置付けられています。Extended Thinkingは、調査、複数回のツール呼び出し、比較、計画、その他すぐには完了できない作業を必要とするタスクで、より興味深い機能です。

新しいのは画面共有ではない - 話し続けている間も推論できること

多くのデモでは、Gemini 3.8 LiveがGoogle初の画面認識アシスタントであるかのように見えます。しかし、そうではありません。

Googleはすでに2025年に、Gemini Liveでカメラ共有と画面共有を実演していました。その以前のGemini Liveガイドでは、ユーザーがカメラ越しに物体について話したり、スマートフォンの画面に表示されたコンテンツについて話し合ったりする様子が紹介されていました。

したがって、3.8の重要な変更点は、Geminiが単に「見える」ようになったことではありません。

より長い推論やツール実行のプロセスが続いている間も、リアルタイムの視覚・音声コンテキストを利用できます。

制約について話し続けながら、旅行の選択肢を比較するようアシスタントに頼む場面を想像してください。システムはリクエストを理解し、外部サービスを呼び出し、結果を比較し、計画を修正する必要があるかもしれません。拡張思考を使えば、その作業によって音声体験が長い無音の待ち時間になる必要はありません。

GoogleのLive APIの思考に関するドキュメントでも、turnComplete: trueは必ずしもエージェントのタスク全体が完了したことを意味しないと開発者に警告しています。バックグラウンドでの推論や非同期のツール処理がまだ実行中である可能性があります。

これは重要なアーキテクチャ上の変化を示しています。

会話の1ターンとエージェントのタスクは、もはや同じものではありません。

これは、より広範なAIエージェントによる自動化ですでに見られる方向性です。有用なエージェントは、単に一度に1つのプロンプトに答えるのではなく、状態を維持し、複数ステップの作業を完了するようになっています。

画面認識AIが単なるスクリーンショット認識以上のものである理由

スクリーンショットは、AIに1つの固定された状態を与えます。ライブビジュアルセッションは、変化するタスクをAIに与えます。

スクリーンショットAI ライブビジュアルAI
ユーザーが1つの状態を手動でキャプチャする セッション中に視覚的なコンテキストが変化する
変更するたびに新しいスクリーンショットが必要 アシスタントは進行中のタスクを追跡できる
ユーザーが何が変わったかを説明する モデルは新しい視覚情報を受け取れる
個別の質問に適している ガイダンスやトラブルシューティングに適している

これにより、いくつかのシナリオがはるかに自然になります。

  • 学習者が取り組んでいる間に、手書きの数学を説明する;
  • 使い慣れていないアプリケーションを案内する;
  • トラブルシューティング中に設定の変化を見守る;
  • 変化するスケッチやデザインに対応する;
  • カメラを使って機器や物理的な物体について話し合う。

Googleのローンチデモには、映像を使った従業員のオンボーディング、ライブボード上のチェス、スケッチと音声による指示のインターフェースコードへの変換、段階的なトラブルシューティングが含まれています。共通する改善点は、単なる視覚機能ではなく、進行中のタスクに組み込まれた視覚機能です。

継続的なコンテキストがプライバシーの境界を変える

従来のチャットでは、データの境界は比較的明確です。何かを入力するか、ファイルを明示的にアップロードします。

ライブマルチモーダルアシスタントは、アクティブなセッション中に、はるかに広範なコンテキストを受け取ることができます。

  • マイク音声;
  • 画面の内容;
  • カメラの映像;
  • 画面に表示される通知;
  • ツールの結果;
  • 以前の会話のコンテキスト。

したがって、プライバシーに関する問いは次のように変わります。

このファイルをアップロードしましたか?

〜:

セッションがアクティブな間、何が見えたり聞こえたりしていましたか?

IDEを共有している開発者が、端末に表示されたAPIキーを誤って公開してしまう可能性があります。画面共有セッションでは、タスクとは無関係なプライベートメール、顧客情報、社内ダッシュボード、通知などが一時的に表示されることがあります。

そのため、ライブAIアプリケーションのプライバシー境界は、クラウドへのリクエストを送信する前から始まるべきです。ローカルレイヤーで、どの画面領域、ファイル、音声セグメント、または派生コンテキストを実際にデバイス外へ送信する必要があるかを判断できます。

AIエージェントがクラウドツールを使用する場合にも、同じ原則が当てはまります。クラウドへのアクセスに、リモートサービスへすべてのローカルファイルやセンサーへの包括的なアクセス権を付与する必要はありません。

Gemini 3.8 Liveは常時リスニングするのか?

Geminiはオペレーティングシステムのマイク権限を迂回することはなく、Liveセッションをいつアクティブにするかはクライアントアプリケーションが決定します。

ただし、APIレベルでは重要な点があります。GoogleのLive APIのベストプラクティスドキュメントによると、Gemini 3.8 LiveおよびExtended Thinkingでは、プロアクティブ音声が恒久的に有効になっています。

アクティブなLiveセッションがリスニング中である間、入力音声トークンは蓄積され続けます。

そのため、「常時稼働」アシスタントは同時に2つの問題を抱えることになります。

設計上の課題 重要な理由
プライバシー ユーザーは、マイクや映像のキャプチャが有効になっているタイミングを把握する必要があります
コスト 継続的なリスニングにより入力の利用が継続する

したがって、常時稼働するアシスタントには高性能なモデルだけでは不十分です。適切な起動ルール、ローカルフィルタリング、センサー状態の可視化、そして適切なセッション管理が必要です。

Gemini Liveの長時間セッションが1分あたりの料金より高くなる可能性がある理由

現在、GoogleはGemini 3.8 Liveをモダリティごとのトークン単位で価格設定しています。API料金ドキュメントには、おおよそ次のように記載されています。

モダリティ 有料API料金
テキスト入力 100万トークンあたり0.75ドル
音声入力 100万トークンあたり3ドル、約0.005ドル/分
画像/動画入力 100万トークンあたり1ドル、約0.002ドル/分
テキスト出力 100万トークンあたり4.50ドル
音声出力 100万トークンあたり12ドル、約0.018ドル/分

しかし、1分あたりのメディア料金は実際のコストの一部にすぎません。

ライブセッションでは会話のコンテキストが維持されます。セッションが長くなるにつれて、以前のコンテキストが後続のターンにも引き続き影響する可能性があります。そのため、Googleは以下を推奨しています。 contextWindowCompression 長時間セッションでは、古い履歴をアクティブウィンドウから削除できるようにするためです。

これは、いわばライブセッションのトークン増加を引き起こします。アシスタントは音声や動画の最新の1秒だけを処理しているのではなく、次第に大きくなる会話状態も保持している可能性があります。

したがって、コストに関する問題は次のことだけではありません。

音声1分あたりのコストはいくらでしょうか?

それは次のとおりです。

セッションが長くなるにつれて、アシスタントはどれだけのコンテキストを再利用し続けるのでしょうか?

これは、ハイブリッドAIのコストが、トークン価格だけでなく、コンテキストサイズ、モデルルーティング、エージェントループの繰り返しに大きく左右されるのと同じ理由です。

連続動画が生むのは帯域幅だけでなく、コンテキストの問題

Googleによると、ネイティブ音声は毎秒およそ25トークン蓄積されます。Live APIのドキュメントでも、コンテキスト圧縮を行わない場合、連続する音声と動画は音声のみのやり取りよりもはるかに速くアクティブなコンテキスト上限に達すると説明されています。

これは重要です。アシスタントは通常、あらゆる瞬間に考えられる視覚情報をすべて必要とするわけではないからです。

たとえば、ユーザーが1つのエラーダイアログについて質問した場合、関係のないデスクトップ領域、バックグラウンドのウィンドウ、変化していないフレームを繰り返し送信すると、次の要素が増加します。

  • 入力コンテキスト。
  • コスト。
  • 無関係な視覚的ノイズ。
  • プライバシーの露出。

より良い解決策は、単にコンテキストウィンドウを大きくすることではありません。

より優れたコンテキスト選択です。

ローカルクライアントは、関連するウィンドウを切り抜いたり、画面が意味のある形で変化したタイミングを検出したり、機密テキストをマスキングしたり、役立つ情報が何もないときにフレームの送信を停止したりできます。

これにより、ローカル処理は最先端モデルの置き換えを試みるのではなく、コンテキストを制御するレイヤーになります。

Gemini 3.8 Liveはローカルで実行できるか?

公式にセルフホストできるGemini 3.8 Liveモデルは提供されていません。

Googleは、クラウドサービスとGemini APIを通じてモデルを提供しています。ダウンロード可能なGemini 3.8 Liveのチェックポイントや、一般向けGPUで動作するサポート対象ランタイムはありません。

しかし、「Gemini自体はローカルで実行できない」ということと、「アシスタント全体をクラウドで実行しなければならない」ということは別の話です。

多くの補助的なワークロードはローカルに残せます。

ワークロード ローカル処理が理にかなうか?
ウェイクワード検出 はい
音声アクティビティ検出 はい
画面の変化検出 はい
画面領域の選択 はい
機密データの検出 はい
OCR 多くの場合
プライベートファイルの検索 できれば
個人メモリ ローカルでの強力なプライバシー保護
単純なコマンド 多くの場合
高度なマルチモーダル推論 クラウドの最先端モデルは大きな価値を加えられる

したがって、プライベートAIアシスタントは、個人ファイル、インデックス、メモリ、定型処理をローカルに保持しながら、最先端の推論が必要な場合にのみ、Geminiなどのモデルへ選択したコンテキストを送信できます。

未来のリアルタイムアシスタントが複数のモデルを使う可能性が高い理由

あらゆるタスクの毎秒にGemini 3.8 Liveを使えば強力ですが、最も効率的な設計になることはほとんどありません。

リアルタイムアシスタントには、多くの小さな処理があります。

タスク 効率的な出発点
音声を検出 小型ローカル音声モデル
リクエストに対応が必要かどうかを判断する 小型分類器
機密性の高い画面コンテンツを特定する ローカルビジョンまたはルール
個人ファイルを検索する ローカル検索
既知のコマンドを実行する ローカル自動化
難しいライブシーンを理解する 最先端のマルチモーダルモデル
長く複雑なタスクを調整する 拡張思考エージェント

これは、プライベートなローカルデータと最先端クラウドAIの背後にある、より広範な戦略にも似ています。ホームシステムは最先端モデルを再現する必要はありません。最先端モデルにどの情報を渡すべきかを判断できればよいのです。

その結果は、クラウドのみでもローカルのみでもないAIです。

これは、ローカル処理が頻繁でプライベートかつ単純な処理を担い、高価なクラウドインテリジェンスは結果を大きく改善できる場合に限って使用する、振り分け型のシステムです。

ライブAIの性能が向上するほど、ローカルAIが重要になる理由

より強力なクラウドモデルによって、ローカルAIの重要性は低下するように思えるかもしれません。Gemini 3.8 Liveは、むしろ逆であることを示しています。

クラウドアシスタントが利用できるコンテキストが増えるほど、そのコンテキストを制御することが重要になります。

有用なローカルレイヤーに保持できるもの:

  • 個人ファイル;
  • 長期的なメモリ;
  • プライベートな検索インデックス;
  • センサーのフィルタリング;
  • シンプルな自動化;
  • リスクの低い判断

ユーザーの近くに。

クラウドモデルには、より高度な推論が必要な場合にのみ、選択されたコンテキストが送られます。

これにより、レジリエンスも向上します。真にオフライン対応のローカルAIワークフローなら、最先端のクラウド推論が一時的に利用できなくなっても、ローカルでの検索、自動化、メモリへのアクセス、基本的なコマンドを継続できます。

常時稼働する処理では、ローカル処理によって不要なクラウド利用も減らせます。これは重要です。マイク、画面、検索、エージェントの呼び出しを繰り返すと、一見安価なAPIワークフローでも、時間とともに高額になる可能性があるためです。

Gemini 3.8 LiveがAIとのインターフェースを変える

最も重要な変化は、Geminiがより自然に会話したり、画像をより正確に認識したりすることではありません。

つまり、AIを使うために、ユーザーがその場の状況を慎重に整えたプロンプトへ変換する必要がますますなくなるということです。

インターフェースを説明する代わりに、

「設定ページを開いています。2番目のオプションが無効になっています。何をクリックすればよいですか?」

ユーザーは次第にこう尋ねられるようになります。

「ここから続けられないのはなぜですか?」

モデルにはすでに、不足していたコンテキストの一部があります。

それによって手間は減りますが、アシスタントが観測できる範囲も広がります。したがって、リアルタイムのパーソナルAIには、高性能なモデルだけでは不十分です。どのセンサーが有効か、どのコンテキストを保持するか、何がデバイス外に出るか、そしていつクラウド推論を呼び出す価値があるかについて、明確なルールが必要です。

これが、パーソナルAIエージェントが、モデルの問題であると同時に、ますますインフラの問題にもなっていく理由です。

より大きな変化:ローカルAIが最先端インテリジェンスを囲む境界になる

Gemini 3.8 Liveは、最先端AIがより持続的かつ知覚的になると何が起こるのかを示しています。

アシスタントはより多くの音声を聞き、より多くを見て、より多くのコンテキストを記憶し、ツールを使い、あなたが操作している間も推論を続けられます。

これによりクラウドインテリジェンスはさらに有用になりますが、その周囲にローカルな境界を設ける価値も高まります。

ローカルレイヤー 最先端クラウドレイヤー
プライベートファイル 複雑なマルチモーダル推論
個人メモリ 長い複数ステップの計画
画面と音声のフィルタリング 高度なライブ会話
ローカル検索 難しい統合
簡単な自動化 価値の高いエージェントタスク
機密データの検出 クラウド推論を行う価値のあるタスク

目的はGeminiをワークフローから締め出すことではありません。そもそもGeminiが必要としなかった情報を送信しないことです。

AIが継続的に見て、聞いて、推論し、行動できるようになると、ローカルAIはモデルをオフラインで実行することだけを意味しなくなります。ローカルAIは、あなたのプライベートな世界と最先端のインテリジェンスの間に位置する、フィルタリング、プライバシー、メモリ、ルーティングのレイヤーになります。

Gemini 3.8 Liveに関するよくある質問

Gemini 3.8 LiveとExtended Thinkingの違いは何ですか?

Gemini 3.8 Liveは、応答性の高いリアルタイムのインタラクションを優先します。Extended Thinkingは、会話をアクティブなまま、推論や非同期のツール処理をバックグラウンドで続行できる、より複雑なライブタスク向けに設計されています。

Gemini 3.8 Liveは画面を見ることができますか?

Gemini Liveは画面共有に対応しており、Gemini 3.8 Liveはリアルタイムセッション中に視覚入力を受け付けます。ただし、どの画面や視覚データを取得してGoogleのクラウドモデルに送信するかは、引き続きクライアントアプリケーションが決定します。

Gemini 3.8 Liveは常に聞き続けているのですか?

デバイスの権限を回避することはありません。ただし、GoogleのAPIドキュメントによると、Gemini 3.8 LiveおよびExtended Thinkingのアクティブなセッション中はプロアクティブ音声が常に有効になるため、セッションが音声を聞いている間は音声入力によってトークンが生成され続けます。

Gemini 3.8 Liveはローカルで実行できますか?

公式のローカルチェックポイントやセルフホスト型ランタイムは提供されていません。ただし、ウェイクワード検出、プライベート検索、メモリ、OCR、画面フィルタリング、簡単なコマンドなどの補助機能は、選択したコンテキストをGeminiに送信する前にローカルで処理できます。

Gemini 3.8 Liveのほうが高性能なのに、なぜローカルAIが重要なのですか?

より高性能なライブモデルほど、より多くのプライベートなコンテキストを消費する可能性があるためです。ローカルレイヤーは個人データを保存し、画面や音声をフィルタリングし、定型タスクを実行して、最先端のクラウド推論が本当に必要なコンテキストだけを送信できます。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.