Gemini 3.8 Live는 음성 AI 이상의 의미를 지닙니다. Google은 실시간 오디오 및 시각적 컨텍스트를 추론, 도구 호출, 장시간 실행되는 작업과 결합하여, 작업이 백그라운드에서 계속 진행되는 동안에도 어시스턴트가 상호작용을 이어갈 수 있도록 했습니다.
화면 공유 자체는 새로운 기능이 아닙니다 - Gemini Live는 이미 2025년에 카메라 및 화면 공유를 지원했습니다. 더 큰 변화는 AI가 변화하는 작업을 점점 더 잘 관찰하고, 사용자가 말하는 동안에도 계속 추론하며, 모든 단계를 별도의 프롬프트로 입력하지 않아도 작업을 수행할 수 있게 되었다는 점입니다. 이는 로컬 AI에 대한 질문도 바꿉니다. 어시스턴트가 주변 환경의 소리와 영상을 계속 듣고 볼 수 있다면, 클라우드로 전송되기 전에 무엇을 로컬에서 필터링해야 할까요?
Gemini 3.8 Live란 무엇인가요?
Google은 2026년 9월에 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다.
Google의 공식 발표에 따르면 두 모델 모두 텍스트, 이미지, 오디오, 동영상을 입력으로 받아 텍스트 또는 오디오 응답을 생성합니다. 두 모델의 차이는 라이브 세션 중 수행하도록 설계된 작업의 범위에 있습니다.
| Gemini 3.8 Live | Live Extended Thinking | |
|---|---|---|
| 주요 목표 | 빠른 실시간 상호작용 | 복잡한 다단계 라이브 작업 |
| 추론 | 인터리브 추론 | 백그라운드 확장 추론 |
| 시각적 입력 | 예 | 예 |
| 오디오 상호작용 | 예 | 예 |
| 함수 호출 | 지원 | 비동기 워크플로 |
| 입력 컨텍스트 | 131,072개 토큰 | 131,072개 토큰 |
| 적합한 용도 | 응답성이 뛰어난 라이브 어시스턴트 | 대화가 계속되는 동안 더 긴 에이전트 작업 수행 |
Google의 모델 문서는 일반 Live를 지연 시간이 짧은 상호작용에 적합한 모델로 설명합니다. Extended Thinking은 조사, 여러 도구 호출, 비교, 계획 또는 즉시 완료할 수 없는 기타 작업이 필요한 경우 더 흥미롭습니다.
새로운 점은 화면 공유가 아닙니다 - 계속 대화하는 동안 추론한다는 점입니다
많은 시연 영상에서는 Gemini 3.8 Live가 Google 최초의 화면 인식 어시스턴트인 것처럼 보입니다. 하지만 그렇지 않습니다.
Google은 이미 2025년에 Gemini Live의 카메라 및 화면 공유 기능을 시연하고 있었습니다. 이전 Gemini Live 가이드에서는 사용자가 카메라를 통해 사물에 대해 이야기하고 휴대전화 화면에 표시된 콘텐츠를 함께 살펴보는 모습을 보여주었습니다.
따라서 중요한 3.8의 변화는 단순히 Gemini가 볼 수 있게 되었다는 것이 아닙니다.
더 긴 추론이나 도구 실행 과정이 계속되는 동안 실시간 시각 및 오디오 맥락을 사용할 수 있습니다.
어시스턴트에게 여행 옵션을 비교해 달라고 요청하면서 제약 조건에 관해 계속 대화한다고 생각해 보세요. 시스템은 요청을 이해하고, 외부 서비스를 호출하고, 결과를 비교하고, 계획을 수정해야 할 수 있습니다. 확장 사고 기능을 사용하면 이러한 작업 때문에 음성 경험이 긴 침묵으로 바뀌지 않아도 됩니다.
Google의 Live API 사고 기능 문서도 turnComplete: true가 에이전트 작업 전체가 완료되었다는 뜻은 아니라고 개발자에게 경고합니다. 백그라운드 추론이나 비동기 도구 작업이 여전히 실행 중일 수 있습니다.
이는 중요한 아키텍처 변화를 보여 줍니다:
대화의 한 턴과 에이전트 작업은 더 이상 같은 것이 아닙니다.
이는 이미 더 폭넓은 AI 에이전트 자동화에서 확인할 수 있는 방향입니다. 유용한 에이전트는 점점 한 번에 하나의 프롬프트에 답하는 데 그치지 않고, 상태를 유지하며 여러 단계의 작업을 완료합니다.
화면 인식 AI가 단순한 스크린샷 인식 그 이상인 이유
스크린샷은 AI에 하나의 고정된 상태를 제공합니다. 라이브 시각 세션은 변화하는 작업을 제공합니다.
| 스크린샷 AI | 라이브 시각 AI |
|---|---|
| 사용자가 한 상태를 수동으로 캡처함 | 세션 중 시각적 맥락이 변함 |
| 변경할 때마다 새 스크린샷이 필요함 | 어시스턴트가 진행 중인 작업을 따라갈 수 있음 |
| 사용자가 무엇이 변경되었는지 설명함 | 모델이 새로운 시각 정보를 받을 수 있음 |
| 단일 질문에 적합 | 안내와 문제 해결에 더 적합 |
이로 인해 다음과 같은 여러 상황이 훨씬 자연스러워집니다:
- 학습자가 문제를 풀어 가는 동안 손으로 쓴 수학 풀이를 설명하기;
- 익숙하지 않은 애플리케이션 사용을 안내하기;
- 문제 해결 중 설정 변경 과정을 지켜보기;
- 변화하는 스케치나 디자인에 대응하기;
- 카메라를 사용해 장비나 실제 물체에 관해 논의하기.
Google의 출시 데모에는 시각적 직원 온보딩, 실시간 체스판을 이용한 체스, 스케치와 음성 지시를 인터페이스 코드로 변환하기, 단계별 문제 해결이 포함됩니다. 공통적인 개선점은 단순히 시각 기능만이 아닙니다. 진행 중인 작업에 시각 기능이 내장되어 있다는 점입니다.
지속적인 맥락은 개인정보 보호 경계를 바꿉니다
기존 채팅에서는 데이터 경계가 비교적 명확합니다. 사용자가 무언가를 입력하거나 파일을 명시적으로 업로드합니다.
라이브 멀티모달 어시스턴트는 활성 세션 중 훨씬 더 광범위한 맥락을 받을 수 있습니다:
- 마이크 오디오;
- 화면 내용;
- 카메라 프레임;
- 화면에 표시되는 알림;
- 도구 결과;
- 이전 대화 맥락.
따라서 개인정보 보호에 대한 질문은 다음과 같이 달라집니다:
이 파일을 업로드했나요?
대상:
세션이 활성화된 동안 무엇을 보거나 들을 수 있었나요?
개발자가 IDE 화면을 공유하다가 터미널에 표시된 API 키를 실수로 노출할 수 있습니다. 화면 공유 세션에는 작업과 무관한 개인 이메일, 고객 기록, 내부 대시보드 또는 알림이 잠시 표시될 수 있습니다.
따라서 실시간 AI 애플리케이션의 개인정보 보호 경계는 클라우드 요청 이전에 시작되어야 합니다. 로컬 계층에서 화면의 어느 영역, 어떤 파일, 오디오의 어느 구간 또는 파생된 어떤 컨텍스트를 실제로 기기 밖으로 전송해야 하는지 결정할 수 있습니다.
AI 에이전트가 클라우드 도구를 사용하는 경우에도 같은 원칙이 적용됩니다. 클라우드에 액세스한다고 해서 원격 서비스에 모든 로컬 파일이나 센서에 대한 포괄적인 액세스 권한을 부여할 필요는 없습니다.
Gemini 3.8 Live는 항상 듣고 있나요?
Gemini는 운영체제의 마이크 권한을 우회하지 않으며, Live 세션이 활성화되는 시점은 여전히 클라이언트 애플리케이션이 결정합니다.
하지만 API 수준에서 중요한 세부 사항이 있습니다. Google의 Live API 모범 사례 문서에 따르면 Gemini 3.8 Live 및 Extended Thinking에서는 사전 대응형 오디오가 영구적으로 활성화되어 있습니다.
활성 Live 세션이 청취하는 동안 입력 오디오 토큰이 계속 누적됩니다.
따라서 “항상 켜져 있는” 어시스턴트는 한 번에 두 가지 문제를 해결해야 합니다.
| 설계 문제 | 중요한 이유 |
|---|---|
| 개인정보 보호 | 사용자는 마이크 또는 시각적 캡처가 활성화된 시점을 알아야 합니다 |
| 비용 | 지속적인 청취는 지속적인 입력 사용량을 발생시킵니다 |
따라서 항상 켜져 있는 어시스턴트에는 강력한 모델만 필요한 것이 아닙니다. 적절한 활성화 규칙, 로컬 필터링, 센서 상태 표시, 합리적인 세션 관리가 필요합니다.
Gemini Live 장시간 세션의 비용이 분당 가격이 제시하는 것보다 높아질 수 있는 이유
Google은 현재 Gemini 3.8 Live의 가격을 토큰 모달리티별로 책정합니다. API 가격 문서에는 대략 다음과 같이 나와 있습니다.
| 모달리티 | 유료 API 가격 |
|---|---|
| 텍스트 입력 | 토큰 100만 개당 $0.75 |
| 오디오 입력 | 토큰 100만 개당 $3, 분당 약 $0.005 |
| 이미지/동영상 입력 | 토큰 100만 개당 $1, 분당 약 $0.002 |
| 텍스트 출력 | 토큰 100만 개당 $4.50 |
| 오디오 출력 | 토큰 100만 개당 $12, 분당 약 $0.018 |
하지만 분당 미디어 요금은 실제 비용의 일부에 불과합니다.
실시간 세션은 대화 컨텍스트를 유지합니다. 세션이 길어질수록 이전 컨텍스트가 이후 대화에도 계속 반영될 수 있습니다. 따라서 Google은 다음을 권장합니다 contextWindowCompression 장시간 세션에서 이전 기록을 활성 창에서 제거할 수 있도록
이는 실시간 세션 토큰 증가라고 볼 수 있습니다. 어시스턴트는 오디오나 비디오의 최신 1초만 처리하는 것이 아니라, 점점 더 커지는 대화 상태까지 계속 유지할 수 있습니다.
따라서 비용 문제는 단순히 다음과 같은 것이 아닙니다:
오디오 1분의 비용은 얼마일까요?
그것은:
세션이 길어질수록 어시스턴트는 얼마나 많은 컨텍스트를 반복해서 재사용할까요?
이는 하이브리드 AI 비용이 토큰 가격만이 아니라 컨텍스트 크기, 모델 라우팅, 반복되는 에이전트 루프에 크게 좌우되는 것과 같은 이유입니다.
연속 비디오는 대역폭 문제뿐 아니라 컨텍스트 문제도 만듭니다
Google은 네이티브 오디오가 초당 약 25토큰씩 누적된다고 말합니다. 또한 Live API 문서에서는 컨텍스트 압축이 없으면 연속 오디오-비디오가 오디오만 사용하는 상호작용보다 활성 컨텍스트 한도에 훨씬 더 빠르게 도달한다고 설명합니다.
이는 어시스턴트가 일반적으로 매 순간 가능한 모든 시각적 세부 정보를 필요로 하지는 않기 때문에 중요합니다.
예를 들어 사용자가 오류 대화 상자 하나에 대해 질문할 때, 관련 없는 데스크톱 영역, 배경 창, 변경되지 않은 반복 프레임을 전송하면 다음이 증가합니다:
- 입력 컨텍스트;
- 비용;
- 관련 없는 시각적 잡음;
- 개인정보 노출.
더 나은 해결책은 단순히 더 큰 컨텍스트 창을 사용하는 것이 아닙니다.
더 나은 컨텍스트 선택입니다.
로컬 클라이언트는 관련 창을 잘라 내고, 화면이 의미 있게 변경될 때를 감지하고, 민감한 텍스트를 가리거나, 유용한 정보가 아무것도 일어나지 않을 때 프레임 전송을 중지할 수 있습니다.
이렇게 하면 로컬 처리는 최첨단 모델을 대체하려는 시도가 아니라 컨텍스트 제어 계층이 됩니다.
Gemini 3.8 Live를 로컬에서 실행할 수 있을까요?
공식적으로 셀프 호스팅할 수 있는 Gemini 3.8 Live 모델은 제공되지 않습니다.
Google은 클라우드 서비스와 Gemini API를 통해 모델을 제공합니다. 다운로드 가능한 Gemini 3.8 Live 체크포인트나 지원되는 소비자용 GPU 런타임은 없습니다.
하지만 “Gemini 자체는 로컬에서 실행할 수 없다”는 말과 “어시스턴트 전체가 클라우드에서 실행되어야 한다”는 말은 서로 다릅니다.
많은 지원 워크로드는 로컬에 유지할 수 있습니다:
| 워크로드 | 로컬 처리가 적합할까요? |
|---|---|
| 웨이크 워드 감지 | 예 |
| 음성 활동 감지 | 예 |
| 화면 변화 감지 | 예 |
| 화면 영역 선택 | 예 |
| 민감한 데이터 감지 | 예 |
| OCR | 자주 |
| 프라이빗 파일 검색 | 가능하면 |
| 개인 메모리 | 강력한 로컬 개인정보 보호 근거 |
| 간단한 명령 | 자주 |
| 어려운 멀티모달 추론 | 클라우드 최첨단 모델은 상당한 가치를 더할 수 있습니다 |
따라서 프라이빗 AI 어시스턴트는 개인 파일, 인덱스, 메모리, 일상적인 처리를 로컬에 유지하면서, 최첨단 추론이 필요한 경우에만 선택한 컨텍스트를 Gemini와 같은 모델로 보낼 수 있습니다.
미래의 실시간 어시스턴트가 여러 모델을 사용하게 될 가능성이 높은 이유
모든 작업의 매초마다 Gemini 3.8 Live를 사용하면 강력하겠지만, 효율적인 설계인 경우는 드뭅니다.
실시간 어시스턴트에는 여러 작은 작업이 있습니다:
| 작업 | 효율적인 시작점 |
|---|---|
| 음성 감지 | 초소형 로컬 오디오 모델 |
| 요청에 조치가 필요한지 결정 | 소형 분류기 |
| 민감한 화면 콘텐츠 식별 | 로컬 비전 또는 규칙 |
| 개인 파일 검색 | 로컬 검색 |
| 알려진 명령 실행 | 로컬 자동화 |
| 어려운 실시간 장면 이해 | 최첨단 멀티모달 모델 |
| 길고 복잡한 작업 조정 | 확장 추론 에이전트 |
이는 비공개 로컬 데이터와 최첨단 클라우드 AI를 결합하는 더 넓은 전략과 유사합니다. 홈 시스템이 최첨단 모델을 재현할 필요는 없습니다. 최첨단 모델에 어떤 정보를 전달할지 결정하면 됩니다.
결과는 클라우드 전용 AI도 로컬 전용 AI도 아닙니다.
이는 로컬 처리가 빈번하고 비공개이며 단순한 작업을 처리하고, 결과를 크게 개선하는 경우에만 비용이 많이 드는 클라우드 지능을 사용하는 라우팅 시스템입니다.
실시간 AI가 발전할수록 로컬 AI가 더 중요해지는 이유
더 강력한 클라우드 모델이 로컬 AI의 중요성을 낮추는 것처럼 보일 수 있습니다. Gemini 3.8 Live는 그 반대임을 시사합니다.
클라우드 어시스턴트가 더 많은 컨텍스트를 처리할 수 있을수록, 해당 컨텍스트를 제어하는 일이 더 중요해집니다.
유용한 로컬 계층은 다음을 유지할 수 있습니다:
- 개인 파일;
- 장기 메모리;
- 비공개 검색 인덱스;
- 센서 필터링;
- 간단한 자동화;
- 위험이 낮은 의사 결정
사용자와 가까운 곳에.
클라우드 모델은 더 강력한 추론이 필요한 경우에만 선택된 컨텍스트를 전달받습니다.
이는 복원력도 높여 줍니다. 진정으로 오프라인을 지원하는 로컬 AI 워크플로라면 최첨단 클라우드 추론을 일시적으로 사용할 수 없는 상황에서도 로컬 검색, 자동화, 메모리 액세스, 기본 명령을 계속 수행할 수 있습니다.
항상 실행되는 작업에서는 로컬 처리로 불필요한 클라우드 사용도 줄일 수 있습니다. 반복적인 마이크, 화면, 검색, 에이전트 호출은 겉보기에는 저렴한 API 워크플로도 시간이 지나면서 비용이 많이 들게 만들 수 있기 때문에 이는 중요합니다.
Gemini 3.8 Live가 AI 인터페이스를 바꾸다
가장 중요한 변화는 Gemini가 더 자연스럽게 대화하거나 이미지를 더 정확하게 인식한다는 점이 아닙니다.
AI가 사용자가 현재 상황을 신중하게 준비한 프롬프트로 번역할 필요가 점점 줄어든다는 뜻입니다.
인터페이스를 설명하는 대신:
“설정 페이지에 있습니다. 두 번째 옵션이 비활성화되어 있는데, 무엇을 클릭해야 하나요?”
사용자는 점점 더 이렇게 물을 수 있습니다:
“여기서 계속할 수 없는 이유가 뭐죠?”
모델에는 이미 부족했던 컨텍스트 중 일부가 있습니다.
이로써 마찰은 줄어들지만, 어시스턴트가 관찰할 수 있는 범위도 넓어집니다. 따라서 실시간 개인용 AI에는 성능이 뛰어난 모델만 필요한 것이 아닙니다. 어떤 센서가 활성화되어 있는지, 어떤 컨텍스트가 보존되는지, 무엇이 기기 밖으로 나가는지, 언제 클라우드 추론을 호출할 가치가 있는지에 대한 명확한 규칙이 필요합니다.
이 때문에 개인 AI 에이전트는 모델 문제만큼이나 인프라 문제로 다뤄지게 될 것입니다.
더 큰 변화: 로컬 AI가 최첨단 지능을 둘러싼 경계가 되다
Gemini 3.8 Live는 최첨단 AI가 더욱 지속적이고 지각적인 존재가 되면 어떤 일이 일어나는지 보여줍니다.
어시스턴트는 더 많이 듣고, 더 많이 보고, 더 많은 컨텍스트를 기억하며, 도구를 사용하고, 사용자가 상호작용하는 동안에도 계속 추론할 수 있습니다.
이로 인해 클라우드 지능은 더욱 유용해지지만, 동시에 그 주변에 로컬 경계를 두는 가치도 커집니다.
| 로컬 계층 | 최첨단 클라우드 계층 |
|---|---|
| 비공개 파일 | 복잡한 멀티모달 추론 |
| 개인 메모리 | 장기 다단계 계획 수립 |
| 화면 및 오디오 필터링 | 고급 실시간 대화 |
| 로컬 검색 | 어려운 종합 분석 |
| 간단한 자동화 | 가치가 높은 에이전트 작업 |
| 민감한 데이터 감지 | 클라우드 추론이 필요한 작업 |
목표는 Gemini를 워크플로에서 배제하는 것이 아닙니다. 애초에 Gemini가 필요로 하지 않았던 정보를 보내지 않는 것입니다.
AI가 지속적으로 보고, 듣고, 추론하고, 행동할 수 있게 되면 로컬 AI는 더 이상 단순히 오프라인에서 모델을 실행하는 것만을 의미하지 않습니다. 로컬 AI는 개인의 세계와 최첨단 지능 사이에서 필터링, 개인정보 보호, 메모리, 라우팅을 담당하는 계층이 됩니다.
Gemini 3.8 Live에 관한 자주 묻는 질문
Gemini 3.8 Live와 Extended Thinking의 차이점은 무엇인가요?
Gemini 3.8 Live는 반응성 높은 실시간 상호작용을 우선합니다. Extended Thinking은 대화가 활성 상태로 유지되는 동안 추론과 비동기 도구 작업이 백그라운드에서 계속될 수 있는, 더 복잡한 실시간 작업을 위해 설계되었습니다.
Gemini 3.8 Live가 내 화면을 볼 수 있나요?
Gemini Live는 화면 공유를 지원하며, Gemini 3.8 Live는 실시간 세션 중 시각적 입력을 받습니다. 하지만 어떤 화면이나 시각 데이터가 캡처되어 Google의 클라우드 모델로 전송되는지는 여전히 클라이언트 애플리케이션이 결정합니다.
Gemini 3.8 Live는 항상 듣고 있나요?
기기 권한을 우회하지는 않습니다. 하지만 Google의 API 문서에 따르면 활성 Gemini 3.8 Live 및 Extended Thinking 세션 중에는 능동형 오디오가 영구적으로 활성화되므로, 세션이 듣고 있는 동안 오디오 입력이 계속 토큰을 생성합니다.
Gemini 3.8 Live를 로컬에서 실행할 수 있나요?
공식 로컬 체크포인트나 셀프 호스팅 런타임은 제공되지 않습니다. 하지만 웨이크 워드 감지, 비공개 검색, 메모리, OCR, 화면 필터링, 간단한 명령과 같은 보조 기능은 선택한 컨텍스트를 Gemini로 전송하기 전에 로컬에서 처리할 수 있습니다.
Gemini 3.8 Live가 더 뛰어난데도 로컬 AI가 중요한 이유는 무엇인가요?
더 강력한 실시간 모델일수록 더 많은 개인 컨텍스트를 사용할 수 있기 때문입니다. 로컬 계층은 개인 데이터를 저장하고, 화면과 오디오를 필터링하며, 반복 작업을 수행하고, 최첨단 클라우드 추론이 실제로 필요한 컨텍스트만 전송할 수 있습니다.
기술 및 AI 허브
더 읽어보기

한 번도 보지 못한 것은? Talkie-1930과 아인슈타인 테스트
Talkie-1930은 1930년 지식 기준을 적용해 AI가 학습 시대를 넘어 일반화할 수 있는지 테스트하고, 추론과 암기를 구분합니다.

ZCode Git 스냅샷 사고: AI 코딩 에이전트가 보고, 업로드하고, 기억할 수 있는 것
ZCode의 Git 스냅샷 사고는 AI 코딩 에이전트에 소스 코드, Git 기록, 시크릿, 클라우드 업로드 및 로컬 우선 개인정보 보호를 위한 명확한 데이터 경계가 필요한...

Grok 4.8은 2.5T 모델이지만, 새로운 C++ 스택이 더 큰 이야기입니다
Grok 4.8은 2.5T 규모로 알려진 모델과 새로운 C++ 학습 스택을 결합해, 최첨단 AI가 인프라 경쟁으로 변하고 있는 이유를 보여줍니다.

