Mac용 Perplexity Hybrid Compute는 LLM을 로컬에서 실행하는 또 다른 방법이라기보다 개인정보 보호 아키텍처라는 점에서 더 흥미롭습니다. 이제 하나의 Perplexity Computer 작업에서 클라우드의 최첨단 모델과 Apple 실리콘 Mac의 로컬 모델을 결합할 수 있습니다. 클라우드 모델은 조사, 계획 수립, 복잡한 추론과 같은 작업을 처리하고, 로컬 측에서는 비공개 파일, 민감한 정보 및 기기 내 작업을 처리할 수 있습니다. 두 영역 사이에는 어떤 정보가 기기 경계를 넘어가도 되는지 제어하는 로컬 Privacy Gate가 있습니다.
이는 "하이브리드 AI"의 의미를 바꿉니다. 이제 사용자가 Ollama와 클라우드 API 중 하나를 직접 선택하는 것만을 뜻하지 않습니다. Perplexity는 라우팅을 에이전트 자체의 일부로 만들려고 합니다. 즉, 작업의 어느 부분이 로컬에 속하는지 결정하고, 민감한 컨텍스트가 Mac을 벗어나기 전에 식별하며, 가치가 있을 때만 클라우드 인텔리전스를 선택적으로 사용하는 것입니다. 따라서 Hybrid Compute는 더 큰 로컬 AI 관련 질문을 살펴볼 수 있는 유용한 사례 연구가 됩니다. 하나의 워크플로가 로컬 모델과 클라우드 모델을 모두 거칠 때, 어떤 데이터와 작업, 상태를 사용자가 계속 통제해야 할까요?
Mac에서 Perplexity Hybrid Compute란?
Perplexity Hybrid Compute는 Perplexity Computer에서 사용 가능한 모드로, 사용자가 워크플로를 별도의 프롬프트로 직접 나누지 않아도 하나의 작업에서 클라우드 AI와 기기 내 모델을 함께 사용할 수 있도록 합니다. Perplexity는 로컬 우선 에이전트를 향한 광범위한 움직임의 연장선으로 2026년 9월 1일 이 기능을 발표했습니다.
이전의 Perplexity Portable Computer의 로컬 우선 아키텍처는 오케스트레이터, 플래너, 도구 라우팅, 작업 대기열, 검색 인덱스 및 모델 실행을 로컬 하드웨어로 옮겼습니다. Hybrid Compute는 문제에 다르게 접근합니다. 클라우드 인텔리전스를 의도적으로 작업 과정에 유지하면서, 비공개 작업을 보호하는 정책 경계를 설정합니다.
Perplexity의 하이브리드 컴퓨팅 발표에서는 역할 분담을 명확하게 설명합니다.
| 워크플로의 일부 | 주요 실행 영역 |
|---|---|
| 최첨단 추론 | 클라우드 |
| 웹 검색 | 클라우드 |
| 상위 수준 계획 | 클라우드 |
| 비공개 파일 분석 | 로컬 Mac |
| 민감한 정보 | 로컬 Mac |
| 기기 내 작업 | 로컬 Mac |
| 개인정보 분류 및 라우팅 보호 기능 | 로컬 Mac |
따라서 중요한 단위는 모델이 아닙니다. 바로 작업입니다. 하나의 작업을 구성하는 서로 다른 부분이 서로 다른 신뢰 영역에 속할 수 있습니다.
로컬에서 실행되는 것과 클라우드에서 실행되는 것은?
Hybrid Compute는 "로컬 모델 대 클라우드 모델"이라는 관점에서 벗어나 각 측이 실제로 무엇을 잘하는지 묻기 시작할 때 더 타당해집니다.
클라우드 AI는 최신 웹 지식, 광범위한 조사, 최첨단 추론에 여전히 매력적입니다. Mac은 원격 모델의 컨텍스트에 복사해서는 안 되는 파일과 애플리케이션을 직접 처리하는 데 더 적합합니다. Perplexity Computer는 사용자가 기밀 문서를 직접 요약하고, 민감한 부분을 제거한 뒤, 정제된 텍스트를 다른 챗봇에 붙여 넣고, 답변을 다시 로컬 워크플로로 옮길 필요 없이 양쪽을 조율합니다.
법률 작업을 생각해 보겠습니다.
공개 / 클라우드 영역
최신 판례
웹 조사
최첨단 추론
상위 수준 계획
|
v
PRIVACY GATE
^
|
비공개 / 로컬 영역
특권 문서
의뢰인 신원
로컬 추출
문서 초안 작성
기기 내 작업
클라우드 모델은 공개된 판례를 조사할 수 있습니다. 로컬 모델은 특권이 적용되는 문서를 검토하고 관련 사실을 정제된 조사 질문으로 바꿀 수 있습니다. 클라우드는 유용한 추론을 제공하기 위해 의뢰인의 전체 파일을 필요로 하지 않습니다.
Perplexity는 금융 및 광고 분야에서도 비슷한 사례를 설명합니다. 공개 공시 자료와 시장 조사는 원격으로 처리할 수 있지만, 기밀 거래 문서, 공개 금지된 크리에이티브 자산, 내부 기록은 Mac에 보관됩니다.
이를 통해 하이브리드 AI를 더 정확하게 정의할 수 있습니다.
하이브리드 AI는 단순히 작업의 절반을 로컬에서 실행하고 나머지 절반을 클라우드에서 실행하는 것이 아닙니다. 서로 다른 신뢰 영역에 서로 다른 책임을 배정하는 것입니다.
Perplexity의 Privacy Gate는 어떻게 작동하나요?
Privacy Gate는 Hybrid Compute에서 가장 중요한 부분입니다. 모델을 라우팅하는 일은 해당 모델이 어떤 정보를 볼 수 있도록 허용할지 결정하는 일에 비하면 쉽기 때문입니다.
Perplexity에 따르면 Privacy Gate는 Mac에서 실행되며, 보호된 콘텐츠가 클라우드 서비스를 향해 전송되기 전에 민감한 정보를 평가합니다. 상황에 따라 시스템은 정보를 로컬에 유지하거나, 민감한 세부 정보를 마스킹하거나, 작업을 거부하거나, 사용자에게 동의를 요청할 수 있습니다.
| Privacy Gate 작업 | 의미 |
|---|---|
| 로컬에 유지 | 보호된 정보는 Mac에 남고, 로컬 처리가 해당 작업을 처리합니다. |
| 마스킹 | 승인된 컨텍스트가 클라우드 서비스에 도달하기 전에 민감한 세부 정보가 제거되거나 다시 작성됩니다. |
| 거부 | 보호된 정보가 기기를 벗어나면 안 되는 경우, 요청된 전송이나 작업이 차단됩니다. |
| 동의 요청 | 사용자는 해당 정보가 로컬 경계를 넘어 전송되어도 되는지 결정합니다. |
Perplexity는 기기 내 분류기가 인식할 수 있는 세부 정보의 예로 이름, 주소, 계정 정보, 비밀 정보를 구체적으로 제시합니다. 자격 증명, 결제 카드 정보, 정부 발급 신분증은 더 강력하게 보호됩니다.
이는 일반적인 클라우드 워크플로와 중요한 차이를 만듭니다. AI 에이전트가 작업을 수행하는 데 도움이 필요하다는 이유만으로 로컬 파일이 자동으로 클라우드 컨텍스트가 되지는 않습니다. 애플리케이션은 먼저 전체 데이터가 필요한지, 데이터 일부를 제거할 수 있는지, 또는 아무것도 공유하지 않고 로컬 모델이 해당 단계를 완료할 수 있는지 판단할 기회를 갖습니다.
Perplexity에 따르면 Enterprise 구독자는 조직 전체 정책을 정의해 로컬에 유지해야 하는 정보, 마스킹할 수 있는 정보, 명시적인 승인이 필요한 데이터 전송을 지정할 수도 있습니다. 관리자는 정보가 디바이스 밖으로 나가는 시점을 감사할 수 있습니다.
이 아키텍처는 유용하지만, "데이터가 절대 Mac 밖으로 나갈 수 없다"는 의미로 오해해서는 안 됩니다. Hybrid Compute는 여전히 클라우드 서비스를 사용합니다. 더 정확한 주장은 보호된 데이터는 로컬에 유지될 수 있고, 선택된 전송은 자동으로 클라우드 컨텍스트가 되는 대신 온디바이스 정책 계층의 적용을 받는다는 것입니다.
Mac은 어떤 데이터가 민감한지 어떻게 알 수 있을까요?
개인정보 보호 정책은 머신이 민감한 데이터를 안정적으로 식별할 수 있을 때만 작동합니다. 따라서 Perplexity는 Hybrid Compute와 함께 두 번째 기술 요소인 PII-Tracer를 도입했습니다. PII-Tracer는 개인 식별 정보를 로컬에서 감지하도록 설계된 소형 0.6B 모델입니다.
Perplexity의 PII-TRACE 연구에 따르면 PII-Tracer는 Privacy Gate에서 사용하는 신호 중 하나를 제공합니다. 그러면 애플리케이션은 이러한 감지 결과를 활용해 콘텐츠를 로컬에 유지하거나, 민감한 구간을 마스킹하거나, 작업을 클라우드 모델로 넘기기 전에 명시적인 권한을 요청할 수 있습니다.
어려운 부분은 한 문장에 명확한 신용카드 번호가 있는지 식별하는 것이 아닙니다. AI 에이전트는 장시간 대화를 유지하며, 동일한 식별자가 사용자 메시지, 어시스턴트 응답, 표, 코드 또는 구조화된 레코드에 반복해서 나타날 수 있습니다. 이후에 나타나는 단 한 번의 식별자를 놓치더라도 시스템이 보호하도록 설계된 정보가 노출될 수 있습니다.
Perplexity는 장시간의 대화에서 이 문제를 테스트하기 위해 PII-TRACE를 구축했습니다. 이 벤치마크에는 13개 언어와 10개 문자 체계에 걸친 13,148개의 합성 사용자-어시스턴트 대화가 포함되며, 9가지 PII 유형에 걸쳐 37,000건이 넘는 식별자 언급에 라벨이 지정되어 있습니다.
더 광범위한 아키텍처 관점은 로컬 AI와 관련해 특히 중요합니다. 프라이버시 자체가 로컬 AI 워크로드가 되고 있기 때문입니다.
따라서 성숙한 프라이빗 AI 스택에는 둘 이상의 모델이 포함될 수 있습니다.
주요 로컬 LLM
+
개인 식별 정보 / 보안 분류기
+
임베딩 모델
+
리랭커
+
OCR / 비전 모델
+
에이전트 런타임
가장 큰 모델이 추론을 담당할 수 있지만, 더 작은 로컬 모델은 원격 모델이 개입하기 전에 정책을 적용하고, 정보를 검색하고, 요청을 분류하거나, 비공개 데이터를 전처리할 수 있습니다.
Perplexity는 Mac용 자체 로컬 추론 엔진을 왜 구축했을까요?
하이브리드 라우팅은 로컬 작업 부분이 지속적으로 참여할 수 있을 만큼 빨라야 매끄럽게 느껴집니다. 에이전트가 클라우드 추론, 비공개 파일 처리, 또 다른 로컬 모델 호출, 도구 작업, 추가 추론 단계를 번갈아 수행한다면 로컬 추론이 느릴수록 전체 워크플로가 지연됩니다.
따라서 Perplexity는 Apple 실리콘과 Qwen3.6-35B-A3B에 특화된 경량 추론 엔진인 Lily를 구축했습니다. Perplexity는 이 엔진을 오픈 소스로 공개할 계획이라고 밝혔습니다.
Perplexity의 Apple Silicon 추론 연구에서 Lily는 OpenAI 호환 API와 맞춤형 Metal 커널을 갖춘 특화된 Rust 런타임으로 설명됩니다. PyTorch와 MLX는 Lily의 실행 경로에 포함되지 않습니다.
하나의 모델을 중심으로 특화한 이유는 아키텍처에 있습니다. Qwen3.6-35B-A3B는 토큰당 약 3B개의 파라미터를 활성화하는 35B 희소 모델입니다. 이 모델은 전문가 혼합 라우팅, Gated DeltaNet 레이어, 전체 어텐션 레이어를 결합합니다. 이러한 구성 요소는 서로 다른 연산 및 메모리 액세스 패턴을 생성하므로, 런타임이 Apple 실리콘에 맞춰 특별히 최적화될 여지가 생깁니다.
Lily에 사용된 체크포인트는 4비트로 양자화되어 있으며 용량은 약 19.4GB입니다. 따라서 Perplexity가 Hybrid Compute의 기준선으로 24GB 통합 메모리를 설정하면서도 상당한 규모의 로컬 모델을 지원할 수 있는 이유를 이해할 수 있습니다.
| Perplexity M5 Max 테스트 | Lily | MLX-LM |
|---|---|---|
| 평균 프리필 처리량 | 4,156토큰/초 | 3,388토큰/초 |
| 평균 디코드 처리량 | 170.0토큰/초 | 126.4토큰/초 |
| 상대 프리필 | 1.23배 | 기준선 |
| 상대 디코드 | 1.35배 | 기준선 |
이는 40코어 GPU와 128GB 통합 메모리를 갖춘 한 가지 M5 Max 구성에서 Perplexity가 측정한 결과이며, 지원되는 모든 Mac의 성능을 보편적으로 예측하는 수치는 아닙니다.
더 오래 남는 핵심은 로컬 추론 성능이 점점 모델 아키텍처, 런타임, 메모리 배치, 하드웨어의 조합에 좌우된다는 점입니다. Apple 실리콘은 단순히 더 작은 데이터센터 GPU가 아닙니다. 통합 메모리 설계, Metal 실행 경로, 메모리 대역폭이 서로 다른 최적화 문제를 만들어 냅니다.
어떤 Mac에서 Perplexity Hybrid Compute를 실행할 수 있을까요?
현재 Perplexity는 비교적 간단한 기본 조건을 제시합니다. macOS 15 이상을 실행하고 통합 메모리가 24GB 이상인 모든 Apple 실리콘 Mac입니다.
Hybrid Compute는 Perplexity Pro, Max 및 Enterprise 구독자에게 제공됩니다. 출시 시 사용자는 Gemma 4 E4B, Qwen3.6-35B-A3B 및 Perplexity 모델 중 세 가지 로컬 모델을 선택할 수 있습니다.
| Mac 구성 | Hybrid Compute 상태 | 실질적인 해석 |
|---|---|---|
| Intel Mac | 지원되지 않음 | Hybrid Compute에는 Apple 실리콘이 필요합니다 |
| Apple 실리콘 + 16GB | 공식 요구 사항 미만 | Perplexity의 24GB 최소 사양을 충족하지 않음 |
| Apple 실리콘 + 24GB | 지원되는 기본 사양 | 로컬 하이브리드 추론을 위한 공식 진입 조건 |
| Apple 실리콘 + 32–64GB | 지원됨 | 로컬 모델, 컨텍스트 및 기타 애플리케이션을 위한 더 넉넉한 메모리 여유 |
| 고메모리 MacBook Pro / Mac Studio | 지원됨 | 더 큰 규모의 로컬 워크로드를 위한 유연성 향상 |
24GB라는 수치는 Perplexity가 공개한 최소 사양입니다. 위에서 설명한 더 높은 메모리 시스템은 별도의 공식 권장 등급이 아니라 하드웨어 계획에 따른 해석입니다.
Perplexity는 상시 작동 옵션으로 전용 Mac mini도 제안합니다. 사용자는 iPhone에서 원격으로 Computer를 제어하는 동안 Mac에서 로컬 모델을 계속 실행할 수 있습니다.
이 작은 세부 사항은 Mac의 역할을 바꾸기 때문에 전략적으로 중요합니다.
Mac이 상시 작동하는 AI 노드가 되면 어떻게 될까요?
대화형으로 사용하는 Mac은 개인용 컴퓨터입니다. 에이전트, 로컬 추론, 비공개 파일 처리, 원격 작업을 실행하기 위해 Mac mini를 온라인 상태로 계속 유지하면 AI 노드처럼 작동하기 시작합니다.
이러한 변화는 벤치마크 점수와는 거의 관련이 없는 서버 수준의 요구 사항을 가져옵니다.
- 프로젝트 파일에 대한 지속적인 접근,
- 안정적인 네트워크 경로,
- 권한 관리,
- 에이전트의 출력물과 작업 공간,
- 검색 인덱스와 임베딩,
- 버전이 관리되는 아카이브,
- 스냅샷과 백업,
- Mac과 독립적으로 확장할 수 있는 저장 용량,
Mac의 내장 SSD는 자주 사용하는 데이터, 모델 체크포인트, 캐시, 활성 작업 공간에 적합합니다. 하지만 에이전트가 수년간 축적된 문서, 사진, 프로젝트 폴더, 코드, 연구 아카이브 또는 팀 파일을 다루기 시작하면, 모든 영구 자산을 추론 런타임과 동일한 SSD에 저장해야 할 이유는 거의 없습니다.
이 지점에서 로컬 AI는 하나의 노트북에서 실행되는 단일 애플리케이션이라기보다 인프라에 가까워지기 시작합니다.
하이브리드 Mac AI 워크플로에서 NAS는 어디에 적합할까요?
NAS가 Perplexity Hybrid Compute를 실행하지 않아도 아키텍처에서 유용한 역할을 할 수 있습니다. 현재 Perplexity는 Mac에서 로컬 추론과 Privacy Gate를 처리합니다. NAS는 이 컴퓨팅 계층 뒤에 위치해 지속적인 비공개 데이터 영역을 제공할 수 있습니다.
기본 아키텍처는 이미 Mac 컴퓨팅과 장기 NAS 스토리지를 분리하는 방법을 안내하는 가이드에서 다루고 있습니다. 하이브리드 컴퓨팅은 여기에 세 번째 영역인 외부 클라우드 인텔리전스를 추가합니다.
| 영역 | 주요 역할 | 일반적인 데이터 또는 작업 |
|---|---|---|
| 클라우드 | 최첨단 인텔리전스 | 웹 조사, 어려운 추론, 공개 정보, 클라우드 서비스 |
| Mac | 로컬 컴퓨팅 및 정책 경계 | 로컬 모델, 개인정보 보호 게이트, 개인 파일 처리, 디바이스 작업, 활성 작업 공간 |
| NAS / 로컬 서버 | 지속적인 프라이빗 데이터 | 문서, 미디어, RAG 소스, 보관 자료, 에이전트 출력, 공유 폴더, 백업 |
따라서 가정이나 소규모 사무실을 위한 개념적 아키텍처는 다음과 같이 구성할 수 있습니다.
클라우드
최첨단 추론
웹 검색
외부 서비스
|
|
승인됨 / 필터링됨
컨텍스트
|
v
MAC
로컬 모델
개인정보 보호 게이트
에이전트 작업
활성 작업 공간
|
|
신뢰할 수 있는 LAN
|
v
NAS / 서버
개인 문서
RAG 소스
프로젝트 보관소
에이전트 출력
백업
중요한 점은 이러한 계층이 서로 다른 문제를 해결한다는 것입니다. NAS는 느린 VRAM이 아니며, Mac이 장기 저장에 자동으로 가장 적합한 장소인 것도 아닙니다. Mac은 활성 컴퓨팅과 개인정보 보호 결정을 처리합니다. 스토리지 시스템은 지속적인 용량, 정리, 권한, 스냅샷 및 백업을 제공합니다.
동일한 패턴은 로컬 파일과 검색을 중심으로 프라이빗 AI 어시스턴트를 구축할 때도 유용합니다. 모델의 컨텍스트에 모든 보관 자료를 영구적으로 로드할 필요는 없습니다. 워크플로에서 필요할 때 올바른 파일에 대한 권한이 부여된 접근 권한만 있으면 됩니다.
이러한 분리는 AI 스택을 더 쉽게 발전시킬 수 있게 해줍니다. Mac mini는 더 빠른 Mac Studio로 교체할 수 있습니다. 로컬 모델도 변경할 수 있습니다. Perplexity는 새로운 런타임을 추가할 수 있습니다. 클라우드 모델은 개선될 수 있습니다. 컴퓨팅 계층이 변경될 때마다 개인 문서 보관소와 프로젝트 이력을 옮길 필요는 없습니다.
Perplexity 하이브리드 컴퓨팅은 단순히 Ollama와 클라우드 모델을 결합한 것일까요?
아닙니다. 중요한 차이점은 정책을 인식하는 오케스트레이션입니다.
사용자는 이미 Ollama, 로컬 모델, Claude, Gemini, OpenAI 또는 다른 제공업체의 API를 사용해 하이브리드 환경을 수동으로 구축할 수 있습니다. 하지만 간단한 구성에서는 일반적으로 사용자나 애플리케이션 개발자가 어떤 프롬프트를 어떤 모델에 보낼지 명시적으로 결정합니다.
차이점은 다음과 같습니다.
수동 하이브리드
사용자
|
+-- Ollama / 로컬 LLM
|
+-- 클라우드 모델
사용자 또는 애플리케이션이 라우팅을 결정합니다
PERPLEXITY 하이브리드 컴퓨팅
사용자 작업
|
v
컴퓨터 오케스트레이션
|
v
개인정보 보호 분류
|
v
라우팅 / 정책 결정
/ \
/ \
로컬 클라우드
이 라우팅 계층은 클라우드 지능의 참여 여부를 결정하기 전에 개인정보 보호를 평가할 수 있습니다. 따라서 로컬 모델은 단순한 대체 추론 엔드포인트가 아니라, 조율된 워크플로의 일부입니다.
이 때문에 하이브리드 AI는 단순한 개인정보 보호상의 타협안 이상이 될 수 있습니다. 선택적 라우팅은 비용 전략이 될 수 있습니다. 일상적인 추출, 문서 분석, 분류 또는 개인정보 필터링은 로컬에 유지하고, 클라우드의 고급 지능은 가장 큰 효과를 내는 단계에만 사용할 수 있습니다. 보다 폭넓은 로컬 AI와 클라우드 AI 비용 분석에서 이러한 절충을 더 자세히 살펴봅니다.
하이브리드 컴퓨팅이 완전 로컬 AI보다 더 비공개적인가요?
반드시 그렇지는 않습니다. 완전한 로컬 워크플로는 모델, 도구, 데이터, 추론을 로컬 환경 안에 유지할 수 있으므로 신뢰 경계가 가장 단순합니다. 하이브리드 컴퓨팅은 클라우드 서비스를 의도적으로 유지하므로 추가적인 라우팅 및 정책 결정이 필요합니다.
| 접근 방식 | 개인정보 보호 수준 | 주요 절충점 |
|---|---|---|
| 완전 로컬 AI | 데이터가 로컬 환경을 벗어날 필요가 없습니다 | 로컬 모델의 성능, 하드웨어, 오프라인 정보에 의해 제한됩니다 |
| 클라우드 AI | 간편하게 관리되는 환경이지만 원격 처리가 핵심입니다 | 더 많은 컨텍스트가 디바이스 경계를 넘어야 할 수 있습니다 |
| 하이브리드 컴퓨팅 | 선택한 민감한 작업은 로컬에 유지할 수 있습니다 | 개인정보 보호는 탐지, 라우팅 정책, 권한, 사용자 선택에 따라 달라집니다 |
PII-Tracer 자체가 이것이 왜 어려운 엔지니어링 문제인지 보여 줍니다. Perplexity는 긴 대화에서 일관된 탐지가 더 어려워지기 때문에 전용 벤치마크를 만들었습니다. 식별자가 다섯 번 나타났는데 분류기가 네 번만 잡아낸다면, 누락된 한 번의 발생만으로도 개인정보 보호 계층이 보호하려던 정보가 그대로 노출될 수 있습니다.
따라서 Privacy Gate는 불필요한 노출을 줄이지만 신뢰를 없애지는 않습니다. 사용자는 여전히 로컬 애플리케이션, 해당 분류기, 운영 체제의 권한, 라우팅 규칙, 그리고 사용자가 승인한 외부 서비스에 의존합니다.
이는 "로컬"이라는 단어가 모든 개인정보 보호 문제를 해결한다고 가정하는 것보다 비공개 AI를 평가하는 더 건전한 방법입니다. 중요한 질문은 다음과 같습니다.
- 원본 데이터는 어디에 저장되나요?
- 어떤 모델이 이를 전달받나요?
- 에이전트가 나가도 되는지는 누가 결정하나요?
- 에스컬레이션 전에 민감한 컨텍스트를 제거할 수 있나요?
- 에이전트는 로컬에서 어떤 권한을 행사할 수 있나요?
- 작업이 끝난 후 어떤 로그와 백업이 남나요?
Perplexity Hybrid Compute는 개인용 AI의 미래를 보여주나요?
Hybrid Compute는 아직 모든 개인용 AI 시스템이 같은 설계를 따를 것이라고 입증하기에는 너무 새롭지만, 더 광범위한 아키텍처 전환을 쉽게 확인할 수 있게 해줍니다.
로컬 모델은 모든 최첨단 모델을 축소한 대체품이라기보다 작업을 수행하는 구성 요소가 되어 가고 있습니다. 로컬 모델은 비공개 파일을 검사하고, 사실을 추출하고, 정책을 적용하고, 기기 작업을 실행하고, 정제된 컨텍스트를 준비할 수 있습니다. 가치를 인정받기 위해 모든 추론 벤치마크에서 최고의 클라우드 모델을 능가할 필요는 없습니다.
클라우드 모델은 조사, 어려운 추론, 대규모 관리형 인프라의 이점을 누릴 수 있는 기능을 전담할 수 있습니다. 소형 로컬 모델은 개인정보 보호 및 라우팅 구성 요소가 될 수 있습니다. Mac이나 AI PC는 실제 실행 노드가 될 수 있습니다. NAS나 홈 서버는 그 뒤에서 내구성 있는 데이터 계층으로 남을 수 있습니다.
이는 라우팅이 모델 선택만큼 중요해질 수 있다는 뜻입니다.
질문은 다음과 같이 바뀝니다:
"가장 큰 모델을 로컬에서 실행할 수 있을까?"
로 바뀝니다:
"작업의 각 부분에 가장 적합한 모델을 사용하면서도 필요한 데이터는 로컬에 보관할 수 있을까?"
Perplexity의 Portable Computer는 에이전트 런타임 자체가 로컬 하드웨어로 이동할 수 있음을 보여주었습니다. Mac용 Hybrid Compute는 로컬 실행과 클라우드 실행의 경계를 워크플로의 일부로 만들며 다음 단계로 나아갑니다. 두 출시 제품은 함께 사용자가 로컬 제어와 클라우드 기능 중 하나를 반드시 선택하지 않아도 되는 AI 아키텍처를 가리킵니다.
로컬 우선 인프라의 관점에서 이는 더 중요한 추세입니다. 미래에는 한 대의 기기가 모든 일을 처리하는 방식보다 역할을 명확히 분리하는 방식이 중심이 될 수 있습니다. 외부 지능은 클라우드에서, 신뢰할 수 있는 실행은 로컬 컴퓨팅에서, 계속 보관해야 하는 데이터는 사용자가 소유하는 영구 로컬 스토리지에서 처리하는 방식입니다.
FAQ: Mac용 Perplexity Hybrid Compute
Mac에서 Perplexity Hybrid Compute란 무엇인가요?
Perplexity Hybrid Compute는 Apple 실리콘 Mac의 로컬 모델과 클라우드의 최첨단 AI 서비스를 하나의 작업에서 나누어 처리하는 Perplexity Computer 모드입니다. 로컬 측에서는 비공개 파일, 민감한 정보, 기기 작업을 처리하고, 클라우드 모델은 조사, 계획 수립, 고급 추론을 제공할 수 있습니다.
Perplexity Hybrid Compute는 파일을 완전히 로컬에 보관하나요?
보호된 파일과 민감한 정보는 Mac에 남아 있을 수 있지만, Hybrid Compute는 완전한 오프라인 시스템이 아닙니다. 작업에 클라우드 기능이 필요한 경우 Privacy Gate는 민감한 데이터를 로컬에 유지하거나, 마스킹하거나, 전송을 거부하거나, 승인된 정보가 전송되기 전에 사용자 동의를 요청할 수 있습니다.
Perplexity Privacy Gate란 무엇인가요?
Privacy Gate는 민감한 정보가 Mac에서 클라우드 서비스로 전송되기 전에 평가하는 온디바이스 계층입니다. Perplexity에 따르면 보호된 세부 정보를 분류하고, 정보를 로컬에 유지하거나 마스킹하거나 작업을 거부하거나 동의를 요청하는 등의 조치를 적용할 수 있습니다.
Perplexity Hybrid Compute를 지원하는 Mac은 무엇인가요?
현재 Perplexity는 macOS 15 이상을 실행하고 통합 메모리가 최소 24GB인 Apple 실리콘 Mac을 요구합니다. Intel Mac과 통합 메모리가 24GB 미만인 Apple 실리콘 시스템은 공개된 요구 사항을 충족하지 않습니다.
Perplexity Hybrid Compute에는 통합 메모리가 얼마나 필요한가요?
공식 최소 사양은 통합 메모리 24GB입니다. 메모리가 많을수록 로컬 모델, 컨텍스트, 다른 애플리케이션 및 더 큰 작업을 위한 여유 공간이 늘어나지만, Perplexity는 현재 32GB, 64GB 또는 128GB에 대한 별도의 권장 등급을 발표하지 않았습니다.
Perplexity Hybrid Compute는 어떤 로컬 모델을 사용하나요?
출시 시점에 Perplexity는 Gemma 4 E4B, Qwen3.6-35B-A3B 및 Perplexity 모델을 로컬 모델 옵션으로 제시합니다. 제품이 발전함에 따라 사용 가능한 모델 목록이 늘어날 수 있습니다.
Perplexity Hybrid Compute는 오프라인에서 작동하나요?
일부 로컬 처리는 Mac에서 실행할 수 있지만, 전체 Hybrid Compute 워크플로는 로컬 실행과 최첨단 추론 및 웹 리서치 같은 클라우드 기능을 결합하도록 설계되었습니다. 이러한 원격 기능에 의존하는 작업에는 인터넷 연결이 필요합니다.
Perplexity Hybrid Compute는 Ollama와 같은 것인가요?
아니요. Ollama는 주로 로컬 모델 런타임이자 API입니다. Hybrid Compute는 단일 작업을 중심으로 로컬 및 클라우드 모델을 조정하고, 개인정보 분류와 라우팅 정책을 추가하는 에이전트 수준의 오케스트레이션 시스템입니다.
PII-Tracer란 무엇인가요?
PII-Tracer는 개인 식별 정보를 로컬에서 감지하기 위한 Perplexity의 소형 0.6B 모델입니다. 이 모델의 감지 결과는 Privacy Gate가 민감한 콘텐츠를 기기에 남겨 둘지, 삭제하거나 마스킹할지, 클라우드로 전송하기 전에 승인을 요구할지 결정하는 데 도움을 줄 수 있습니다.
Lily란 무엇인가요?
Lily는 Apple 실리콘과 Qwen3.6-35B-A3B를 위한 Perplexity의 특화된 로컬 추론 엔진입니다. Rust 런타임과 맞춤형 Metal 커널을 사용하며 OpenAI 호환 API를 제공합니다. Perplexity는 이 엔진을 오픈 소스로 공개할 계획이라고 밝혔습니다.
Hybrid Compute를 실행하는 Mac도 NAS의 이점을 얻을 수 있나요?
잠재적으로는 그렇습니다. 다만 별도의 역할을 합니다. Hybrid Compute는 Mac에서 로컬 추론과 Privacy Gate를 실행합니다. NAS는 기본 추론 장치가 되지 않고도 개인 문서, RAG 소스, 프로젝트 아카이브, 생성된 결과물, 공유 폴더, 스냅샷, 백업을 위한 영구 스토리지를 제공할 수 있습니다.
기술 및 AI 허브
더 읽어보기

2026년 홈 랩을 위한 최고의 로컬 AI 웹 UI 10가지
홈 랩에 적합한 셀프 호스팅 로컬 AI 웹 UI 10가지를 비교하고, Ollama 지원, RAG, 에이전트, 다중 사용자 액세스, 설정 난이도 및 이상적인 사용 사례를...

GPT-6 Astra는 시간이 지남에 따라 얼마나 비용이 들까요? 클라우드 AI와 로컬 AI 중 어떤 경우에 무엇이 적합할까요?
토큰 사용량, 장기 AI 워크로드, 클라우드와 로컬 환경의 장단점, 그리고 하이브리드 AI 인프라가 중요한 이유를 다루는 실용적인 GPT-6 Astra 비용 가이드입니다.

GPT-6 Astra와 로컬 AI: 에이전트의 어떤 부분을 홈 서버에 유지해야 할까?
GPT-6 Astra는 클라우드에 머무르고, 홈 서버는 파일, 메모리, RAG, 도구, 권한 및 지속적인 에이전트 상태를 로컬에 보관할 수 있습니다.

