셀프 호스팅 AI 검색은 더 이상 “Docker에서 Perplexity 클론을 실행하는 것”에 그치지 않습니다. 2026년에는 웹 답변 엔진, 비공개 문서 검색, 심층 리서치 에이전트, 엔터프라이즈 지식 검색, 로컬 검색 백엔드를 아우르는 분야로 확장되었습니다.
적합한 선택은 검색 쿼리, 모델, 파일, 임베딩, 검색 색인 또는 전체 검색 결과 도출 파이프라인 중 실제로 무엇을 직접 관리하려는지에 따라 달라집니다. 이 10가지 도구는 이러한 스택을 직접 구축하는 주요 방식을 다룹니다.
“셀프 호스팅 AI 검색”은 정확히 무엇을 의미하나요?
셀프 호스팅 AI 검색 도구는 여러 가지를 의미할 수 있습니다.
| 검색 유형 | 검색 대상 | 일반적인 아키텍처 |
|---|---|---|
| 웹 답변 엔진 | 실시간 웹 | 검색 백엔드 + LLM + 인용 |
| 비공개 지식 검색 | 문서, 메모, 드라이브, 앱 | 수집 + 임베딩 + 검색 결과 도출 + LLM |
| 심층 조사 에이전트 | 시간에 따른 여러 차례의 웹 검색 | 검색 → 성찰 → 다시 검색 → 종합 |
| 검색 백엔드 | 여러 기존 검색 엔진 | AI 계층에 검색 결과를 제공하는 메타 검색 API |
중요한 이유는 웹 인터페이스를 자체 서버에서 실행한다고 해서 전체 검색 워크플로가 자동으로 비공개가 되는 것은 아니기 때문입니다.
상용 LLM과 호스팅 검색 API로 쿼리를 전송하면서 프런트엔드만 셀프 호스팅할 수도 있습니다.
브라우저
|
셀프 호스팅 검색 UI
|
+--- 클라우드 LLM
|
+--- 호스팅 검색 API
또는 스택의 거의 전체를 자체 인프라로 옮길 수도 있습니다.
브라우저
|
셀프 호스팅 AI 검색
|
+--- SearXNG
+--- Ollama
+--- 로컬 임베딩
+--- 로컬 검색 색인
+--- 비공개 파일
두 번째 아키텍처는 로컬 지식 베이스와 관련해 셀프 호스팅 AI 검색이 특히 유용해지는 지점입니다. 검색은 더 이상 인터넷에서 페이지만 찾는 작업이 아닙니다. 문서, 연구 자료 보관소, 프로젝트 파일, 비공개 운영 데이터의 검색 계층으로도 활용할 수 있습니다.
최고의 셀프 호스팅 AI 검색 도구를 선정한 방법
이는 GitHub 스타 수 순위표가 아니며, 이 도구들이 모두 같은 검색 문제를 해결하는 것도 아닙니다.
순위는 스택을 얼마나 완전히 셀프 호스팅할 수 있는지, 검색 및 검색 결과 도출 아키텍처의 품질, 로컬 모델 지원, 인용 및 출처 기반성, 비공개 데이터 검색, 배포 난이도, 2026년 현재 프로젝트의 관련성이라는 7가지 실용적인 요소를 중심으로 정했습니다.
또한 “셀프 호스팅”과 “완전 로컬”을 구분합니다. 서버에 도구를 설치했더라도 OpenAI, Anthropic, Tavily, Brave, Exa 또는 다른 외부 제공업체를 계속 호출할 수 있습니다. 이는 유용할 수 있지만, Ollama + 로컬 임베딩 + 셀프 호스팅 검색 백엔드를 사용하는 경우와는 개인정보 보호 모델이 다릅니다.
한눈에 보는 최고의 셀프 호스팅 AI 검색 도구 10선
| 순위 | 도구 | 검색 유형 | 웹 검색 | 비공개 파일 | 로컬 LLM | 추천 대상 |
|---|---|---|---|---|---|---|
| 1 | Vane | 웹 답변 엔진 | 예 | 예 | Ollama | 셀프 호스팅 Perplexity 스타일 검색 |
| 2 | Morphic | 웹 답변 엔진 | 예 | 예 | Ollama | 생성형 검색 UI |
| 3 | Onyx | 엔터프라이즈 지식 검색 | 예 | 예 | Ollama, LiteLLM, vLLM | 팀 및 기업 검색 |
| 4 | Khoj | 개인 지식 + 웹 검색 | 예 | 예 | 로컬 / 호환 API | 개인용 세컨드 브레인 |
| 5 | SurfSense | 조사 작업 공간 | 예 | 예 | Ollama, LM Studio | 연결된 조사 워크플로 |
| 6 | Open WebUI | AI 작업 공간 + 검색 | 예 | 예 | Ollama | 기존 로컬 AI UI에 검색 기능 추가 |
| 7 | 로컬 심층 리서처 | 심층 조사 에이전트 | 예 | 제한적 | Ollama, LM Studio | 반복적인 로컬 조사 |
| 8 | RAGFlow | 문서 / RAG 검색 | 보조 기능 | 예 | 셀프 호스팅 모델 옵션 | 복잡한 비공개 문서 검색 |
| 9 | AnythingLLM | 비공개 문서 검색 | 보조 기능 | 예 | Ollama, LM Studio, LocalAI | 간편한 로컬 문서 Q&A |
| 10 | SearXNG | 메타 검색 백엔드 | 예 | 아니요 | 해당 없음 | 로컬 AI를 위한 비공개 검색 백엔드 |
1. Vane — 종합적으로 가장 뛰어난 셀프 호스팅 AI 검색 엔진

이전에 Perplexica로 알려졌던 Vane은 “Perplexity 대신 무엇을 셀프 호스팅할 수 있을까?”라는 질문에 대한 가장 직접적인 답변 중 하나입니다.
검색 백엔드와 LLM 답변 계층을 결합하고, 출처를 인용한 근거 기반 답변을 반환합니다. 현재 프로젝트는 Ollama를 통한 로컬 추론뿐 아니라 OpenAI, Anthropic Claude, Google Gemini 및 Groq를 포함한 호스팅 제공업체도 지원합니다.
Vane의 검색 계층은 SearXNG로 구동되므로 특정 상용 검색 API 하나에 의존할 필요가 없습니다. 권장 Docker 이미지에는 SearXNG를 애플리케이션과 함께 번들로 포함할 수도 있으며, 간소화된 배포에서는 네트워크의 다른 위치에 있는 기존 SearXNG 인스턴스를 가리킬 수 있습니다.
Vane은 검색 동작을 빠른 검색, 균형 잡힌 검색 및 심층 조사 모드로도 구분합니다. 모든 쿼리를 동일하게 처리하는 대신 일반 웹 결과, 토론 및 학술 자료를 검색할 수 있습니다.
사용자 질문
|
v
Vane
|
+---+----+
| |
SearXNG Ollama
| |
웹 로컬 LLM
+---+----+
|
인용된 답변
Vane이 1위를 차지한 이유는 기존 AI 검색 사용 사례에 매우 잘 부합하면서도, 셀프 호스팅 사용자가 검색과 추론 모두를 제어할 수 있도록 하기 때문입니다.
적합한 대상: 인용 및 Ollama 지원을 갖춘 비공개 셀프 호스팅 Perplexity 스타일의 답변 엔진을 원하는 사용자
절충점: 웹 검색에는 여전히 외부 인터넷 액세스가 필요하며, Vane 애플리케이션 자체가 로컬에서 실행되더라도 클라우드 LLM 제공업체를 사용하면 개인정보 보호 모델이 달라집니다.
2. Morphic — 생성형 UI에 가장 적합한 셀프 호스팅 AI 검색

Morphic은 표면적으로 Vane과 겹치는 부분이 있습니다. 두 서비스 모두 웹 검색과 LLM이 생성한 답변, 인용, Docker 배포, Ollama 및 SearXNG를 결합할 수 있습니다.
차이점은 표현 방식과 상호작용입니다.
Morphic은 생성형 UI를 갖춘 AI 기반 검색 엔진이라고 설명합니다. 모든 답변을 일반 마크다운으로 제한하는 대신, 인터페이스에서 이미지가 포함된 섹션, 그리드, 제목 및 기타 구조화된 결과 블록과 같은 더욱 풍부한 구성 요소를 스트리밍할 수 있습니다.
현재 검색 계층은 SearXNG, Tavily, Brave, Exa를 지원합니다. 모델 선택에는 OpenAI, Anthropic, Google, Ollama, Vercel AI Gateway 또는 OpenAI 호환 제공자를 사용할 수 있습니다.
Docker Compose로 Morphic, PostgreSQL, Redis, SearXNG를 함께 실행할 수 있어 Docker 설정이 특히 편리합니다. 덕분에 모든 서비스를 일일이 직접 구성하지 않고도 완전한 로컬 검색 애플리케이션을 원하는 사용자에게 가장 적합한 선택지 중 하나입니다.
적합한 대상: 더 풍부하게 생성되는 인터페이스와 유연한 검색 제공자를 갖춘 세련된 Perplexity 스타일 검색 경험을 원하는 사용자.
절충점: 전체 경험에 PostgreSQL, Redis, 인증, 기록, 추가 애플리케이션 서비스가 포함되므로 이 스택은 최소한의 Vane 배포보다 더 무겁습니다.
3. Onyx — 팀 및 회사 지식에 가장 적합한 셀프 호스팅 AI 검색

Onyx는 Vane 및 Morphic과는 다른 범주에 속합니다.
핵심 질문은 “웹에서는 뭐라고 말하는가?”가 아닙니다. 핵심 질문은 다음과 같습니다.
“우리 조직은 이미 무엇을 알고 있는가?”
Onyx는 하이브리드 검색, RAG, 심층 리서치, 에이전트, 웹 검색, 대규모 커넥터 생태계를 결합합니다. 내부 애플리케이션과 저장소의 정보를 인덱싱하는 동시에 필요할 때 실시간 웹을 검색할 수 있습니다.
이 프로젝트는 50개가 넘는 인덱싱 커넥터를 지원하며 Slack, Google Drive, GitHub, Jira, Confluence 및 기타 팀 시스템과 연결할 수 있습니다. Community Edition은 핵심 채팅, RAG, 에이전트, 작업 기능을 제공하고, 대규모 조직은 엔터프라이즈용 ID 및 거버넌스 기능을 추가할 수 있습니다.
또한 모든 검색 결과를 하나의 호스팅 LLM을 통해 처리하도록 강제하는 대신 Ollama, LiteLLM, vLLM과 같은 셀프 호스팅 모델 인프라도 지원합니다.
Slack -------\
Drive --------\
GitHub --------> Onyx ----> 검색 / RAG / 심층 리서치
Confluence ---/
웹 ----------/
이는 단순한 Perplexity 복제품이라기보다 셀프 호스팅 가능한 Glean 스타일 검색 계층에 훨씬 가깝습니다.
적합한 대상: 회사 문서, 앱, 저장소, 웹 전반에 걸쳐 하나의 검색 및 답변 계층을 원하는 팀.
절충점: 목표가 비공개 웹 검색뿐이라면 Onyx는 단일 사용자가 필요로 하는 것보다 플랫폼 규모가 상당히 큽니다.
4. Khoj — 웹 및 비공개 파일에 가장 적합한 개인용 AI 검색

Khoj는 조직을 대상으로 하는 Onyx가 차지하는 영역의 개인용 버전에 해당합니다.
비공개 문서, 웹 정보, 시맨틱 검색, 에이전트, 개인 지식을 결합한 셀프 호스팅 가능한 “세컨드 브레인” 스타일 환경입니다.
검색 아키텍처는 단순한 벡터 조회보다 훨씬 정교합니다. Khoj의 문서에 따르면, 바이인코더가 후보 문서를 검색하고 더 느린 크로스인코더가 현재 쿼리에 맞게 순위를 다시 매기는 2단계 검색 흐름을 사용합니다.
이는 우수한 AI 검색이 단순히 임베딩을 생성하는 것만으로 완성되지 않기 때문에 중요합니다. 검색 품질은 충분한 후보를 찾은 다음 LLM이 확인하기 전에 가장 관련성 높은 근거의 순위를 다시 매기는 데 달려 있습니다.
Khoj는 Ollama 호환 설정을 포함해 로컬 검색 모델과 OpenAI 호환 엔드포인트를 사용할 수 있으므로, 개인용 비공개 지식 시스템에 적합합니다.
적합한 대상: 하나의 자체 호스팅 개인 AI 작업 공간에서 메모, 파일, 문서, 웹을 검색하려는 개인.
절충점: 조직 전체를 대상으로 하는 엔터프라이즈 색인 및 권한 관리보다는 개인 지식과 어시스턴트 워크플로에 더 중점을 두고 설계되었습니다.
5. SurfSense — 최고의 자체 호스팅 AI 연구 작업 공간

SurfSense는 또 하나의 검색창이라기보다 연결형 연구 작업 공간으로 이해하는 편이 좋습니다.
이 자체 호스팅 플랫폼은 정보 소스를 연결하고, 검색 가능한 지식 기반을 구축하며, 연구, 메모, 자동화, 에이전트를 중심으로 한 워크플로를 지원할 수 있습니다. 현재 문서에는 Notion, Slack, Google, Jira 및 기타 외부 지식 소스와 같은 서비스를 위한 커넥터가 포함되어 있습니다.
또한 Ollama와 LM Studio를 통한 로컬 모델 연결도 문서화하고 있어, 애플리케이션 계층과 추론 계층을 사용자가 계속 제어할 수 있습니다.
따라서 “검색”이 더 긴 워크플로의 한 단계에 불과한 경우 SurfSense가 특히 흥미롭습니다.
소스 수집
|
지식 색인화
|
검색 / 질문
|
메모 생성
|
자동화 실행
|
연구 계속하기
적합한 대상: 검색, 연결된 소스, 메모, 자동화를 하나의 자체 호스팅 작업 공간에서 사용하려는 연구자와 지식 중심 팀.
절충점: 인용이 포함된 빠른 웹 답변만 원한다면 Vane이나 Morphic이 더 간단하고 목적에 집중되어 있습니다.
6. Open WebUI — 기존 로컬 AI 스택에 검색 기능을 추가하는 가장 좋은 방법

Open WebUI는 본질적으로 검색 엔진이 아니며, 이러한 차이를 분명히 해야 합니다.
많은 로컬 AI 사용자가 이미 Ollama나 다른 모델 서버 앞단의 인터페이스로 사용하고 있다는 점이 강점입니다. 이러한 사용자에게는 별도의 검색 애플리케이션을 배포하는 것보다 기존 AI 작업 공간에 검색 기능을 추가하는 편이 더 실용적일 수 있습니다.
Open WebUI는 현재 SearXNG, Brave, DuckDuckGo, Tavily, Exa, Kagi, Perplexity, Jina, Bing 및 여러 다른 엔진을 포함한 다양한 제공업체를 통한 웹 검색을 지원합니다.
공식 SearXNG 통합 가이드에서는 별도의 로컬 SearXNG 컨테이너를 Open WebUI의 검색 계층으로 사용하는 방법을 설명합니다.
같은 애플리케이션은 업로드한 문서와 문서 라이브러리에 대한 로컬 RAG도 지원하므로, 하나의 인터페이스에서 웹 검색과 비공개 파일 검색을 결합할 수 있습니다.
최적의 용도: 이미 Ollama + Open WebUI를 실행 중이며 전용 답변 엔진으로 옮기지 않고 셀프 호스팅 웹 검색을 추가하려는 사용자입니다.
절충점: Open WebUI는 범용 AI 작업 공간이므로 검색 동작은 모델의 도구 호출, 컨텍스트 크기, 검색 설정, 선택한 검색 제공업체의 구성에 크게 좌우됩니다.
7. Local Deep Researcher — 완전한 로컬 딥 리서치 에이전트에 최적

Local Deep Researcher는 AI 검색이 단일 쿼리 답변 엔진을 넘어 어떤 방향으로 나아가고 있는지 보여 줍니다.
이 프로젝트는 Ollama 또는 LM Studio를 통해 로컬 LLM을 사용하여 검색 쿼리를 생성하고, 웹 결과를 수집하고, 이를 요약하고, 남아 있는 지식 공백을 파악한 다음, 다른 쿼리를 생성하고 최종 인용 보고서를 만들기 전에 이 주기를 반복합니다.
질문
|
검색 생성
|
웹 검색
|
요약
|
지식 공백 찾기
|
다시 검색
|
반복
|
최종 인용 보고서
검색에는 기본적으로 DuckDuckGo를 사용할 수 있으며, SearXNG, Tavily 또는 Perplexity 통합도 선택적으로 지원합니다.
이 점에서 Vane이나 Morphic과 다릅니다. 이러한 도구는 대화형 검색과 답변 UX에 최적화되어 있습니다. Local Deep Researcher는 반복적인 조사에 최적화되어 있습니다.
최적의 용도: 한 번의 검색으로는 충분한 근거를 찾기 어려우며, 에이전트가 부족한 부분을 파악한 후 의도적으로 다시 검색해야 하는 연구 질문입니다.
절충점: 반복적인 검색 및 요약 주기는 일반적인 답변 엔진보다 느리고 더 많은 컴퓨팅 리소스를 사용하며, 특히 LLM을 로컬에서 실행할 때 그렇습니다.
8. RAGFlow — 복잡한 비공개 문서 검색에 최적
RAGFlow는 주로 Perplexity와 경쟁하려는 것이 아닙니다.
복잡한 비공개 데이터를 LLM에 신뢰할 수 있는 컨텍스트로 변환하는 검색 플랫폼입니다.
현재 프로젝트는 엔드투엔드 RAG와 문서 파싱, 오케스트레이션된 수집 파이프라인, 에이전트 워크플로, MCP 지원, Confluence, S3, Notion, Discord, Google Drive와 같은 소스의 데이터 동기화를 결합합니다.
따라서 다음과 같은 질문에 더 적합합니다.
“신뢰할 수 있는 검색을 통해 수천 개의 PDF, 오피스 파일, 내부 문서, 연결된 지식 소스를 어떻게 검색하나요?”
다음과 같은 질문보다는:
“오늘 웹에서 무슨 일이 있었나요?”
RAGFlow는 에이전트 컨텍스트 계층으로도 계속 발전하고 있습니다. 2026년에는 OpenClaw를 통해 RAGFlow 데이터 세트에 액세스하는 공식 스킬을 추가했으며, 이는 문서 검색이 고립된 RAG 채팅에서 재사용 가능한 에이전트 인프라로 이동하고 있음을 보여 줍니다.
이 계층을 더 자세히 살펴보려면 ZimaSpace의 문서 검색 및 RAG 가이드에서 추출, 청킹, 임베딩, 벡터 검색, 재순위 지정, 근거를 반영한 답변 생성을 단계별로 설명합니다.
적합한 대상: 본격적인 수집, 파싱, 검색, 지식 워크플로가 필요한 대규모 문서 라이브러리와 팀.
절충점: RAGFlow는 단순한 로컬 문서 채팅 애플리케이션보다 훨씬 무겁기 때문에, 지식 기반이 몇 개의 폴더에 불과하다면 과도할 수 있습니다.
9. AnythingLLM — 비공개 문서를 위한 가장 쉬운 셀프 호스팅 검색

AnythingLLM은 비공개 AI 검색 중에서도 접근성이 높은 편에 속합니다.
문서를 수집하고, 워크스페이스를 만들고, 임베딩을 생성하고, 관련 컨텍스트를 검색하고, 출처 인용을 표시하며, 사용자가 별도의 구성 요소로 RAG 스택을 조립하지 않아도 로컬 또는 클라우드 모델에 연결할 수 있습니다.
로컬 모델 지원에는 Ollama, LM Studio, LocalAI, llama.cpp 호환 모델이 포함됩니다. 임베딩 계층도 로컬 환경에 유지할 수 있으며, 이 프로젝트는 LanceDB, Chroma, Qdrant, Weaviate, Milvus, PGVector를 비롯한 여러 벡터 데이터베이스를 지원합니다.
AnythingLLM의 셀프 호스팅 개인정보 보호 정책은 이례적으로 명확합니다. 문서, 기록, 워크스페이스 설정, 임베딩은 사용자가 관리하는 인프라에 그대로 유지되며, 로컬 모델과 벡터 구성 요소를 선택하면 애플리케이션을 에어갭 환경에서도 운영할 수 있습니다.
이 기능은 “내 문서와 채팅하기”와 더욱 완성도 높은 로컬 AI 워크플로를 자연스럽게 연결해 줍니다.
최적의 사용자: 더 복잡한 검색 플랫폼을 관리하지 않고 간단한 로컬 문서 검색 및 RAG 애플리케이션을 원하는 사용자.
절충점: RAGFlow나 Onyx보다 배포하기 쉽지만, 이러한 단순성 때문에 조직 전체의 색인 생성이나 고급 리서치 오케스트레이션에는 가장 적합한 선택이 아닙니다.
10. SearXNG — 로컬 AI를 위한 최고의 비공개 검색 백엔드
SearXNG는 AI 답변 엔진이 아니므로 예외적인 도구입니다.
SearXNG는 사용자 추적과 프로파일링을 피하면서 최대 272개의 검색 서비스를 통합하는 셀프 호스팅 메타검색 엔진입니다.
따라서 SearXNG는 셀프 호스팅 AI 검색 생태계에서 가장 중요한 인프라 구성 요소 중 하나입니다.
Vane은 SearXNG를 사용할 수 있습니다. Morphic도 SearXNG를 사용할 수 있습니다. Open WebUI도 SearXNG를 사용할 수 있습니다. Local Deep Researcher도 SearXNG를 사용할 수 있습니다.
역할은 간단합니다.
사용자 쿼리
|
SearXNG
|
원시 검색 결과
|
로컬 LLM
|
출처가 포함된 AI 답변
검색 백엔드를 셀프 호스팅하면 검색 계층과 답변 계층을 분리할 수 있습니다. 검색 엔진을 변경하지 않고 LLM을 바꾸거나, 동일한 검색 인프라를 유지하면서 답변 애플리케이션을 변경할 수 있습니다.
최적의 사용자: Vane, Open WebUI, Morphic, 리서치 에이전트 또는 맞춤형 로컬 AI 애플리케이션에 연결할 수 있는 비공개 Google 스타일 메타검색 백엔드를 원하는 사용자.
절충점: SearXNG는 자체적으로 요약하거나 추론하거나 출처가 포함된 답변을 생성하지 않습니다. Perplexity와 같은 경험을 원한다면 그 위에 AI 계층이 필요합니다.
어떤 셀프 호스팅 AI 검색 도구를 선택해야 할까?
| 원하는 것이... | 다음으로 시작 | 이유 |
|---|---|---|
| 비공개 Perplexity 대안 | Vane | SearXNG와 Ollama를 사용하는 집중형 셀프 호스팅 웹 답변 엔진 |
| 더 풍부한 생성형 검색 인터페이스 | Morphic | 생성형 UI와 유연한 검색 공급자 |
| 팀 지식 전반 검색 | Onyx | 대규모 커넥터 생태계와 하이브리드 검색 및 RAG |
| 개인 파일과 웹 검색 | Khoj | 로컬 검색을 활용한 개인 지식 검색 |
| 연결된 리서치 워크스페이스 | SurfSense | 검색, 출처, 메모, 커넥터 및 자동화 |
| Ollama 채팅 스택에 검색 추가 | Open WebUI | 익숙한 로컬 AI 인터페이스에 플러그인 방식으로 추가하는 검색 |
| 다단계 웹 조사 | 로컬 심층 리서처 | 검색하고, 검토하고, 누락된 부분을 파악한 뒤 다시 검색 |
| 복잡한 기업 문서 검색 | RAGFlow | 고급 수집 및 RAG 아키텍처 |
| 간편한 비공개 문서 Q&A | AnythingLLM | 문서 파이프라인과 벡터 저장소가 내장된 로컬 우선 앱 |
| 비공개 검색 백엔드 | SearXNG | 다양한 AI 애플리케이션을 위한 재사용 가능한 메타검색 계층 |
Vane과 Morphic 비교: 어떤 셀프 호스팅 Perplexity 대안이 더 나을까?
“Perplexity를 내 서버에서 사용하고 싶다”는 관점이라면 Vane과 Morphic이 가장 직접적인 두 가지 선택지입니다.
| 영역 | Vane | Morphic |
|---|---|---|
| 주요 초점 | 개인정보 보호 중심의 AI 답변 엔진 | 생성형 UI를 활용한 AI 검색 |
| SearXNG | 핵심 검색 경로 | Docker Compose에서 지원 및 번들 제공 |
| Ollama | 예 | 예 |
| 클라우드 모델 | 예 | 예 |
| 파일 | 예 | 예 |
| 인용 | 예 | 예 |
| 검색 모드 | 속도, 균형, 품질 | 빠름, 적응형 |
| 최적의 용도 | 집중형 비공개 답변 엔진 | 검색 UX 및 풍부한 결과 표시 |
Vane을 선택하세요—간결한 SearXNG + Ollama 아키텍처를 갖춘 집중형 비공개 답변 엔진이 우선일 때 적합합니다.
Morphic을 선택하세요—검색 인터페이스 자체가 중요하고 더 풍부한 생성형 결과 구성 요소, 기록, 인증, 애플리케이션에 가까운 경험을 원할 때 적합합니다.
비공개 지식 검색을 위한 Onyx vs Khoj vs AnythingLLM
세 가지 모두 비공개 정보를 검색할 수 있지만, 목표로 하는 배포 환경은 서로 매우 다릅니다.
| 영역 | Onyx | Khoj | AnythingLLM |
|---|---|---|---|
| 주요 사용자 | 팀 / 조직 | 개인 | 개인 또는 소규모 팀 |
| 연결된 앱 | 폭넓은 커넥터 생태계 | 개인 지식 소스 | 문서/워크스페이스 중심 |
| 웹 검색 | 강력함 | 사용 가능 | 문서 검색보다 부차적 |
| 검색 깊이 | 하이브리드 검색 + 에이전트형 RAG | 바이인코더 + 재순위화 | 내장 RAG 파이프라인 |
| 로컬 모델 | 예 | 예 | 예 |
| 최적의 용도 | 회사 전체의 지식 | 개인용 세컨드 브레인 | 간편한 비공개 문서 Q&A |
Onyx를 선택하세요—정보가 여러 팀 애플리케이션에 분산되어 있고 권한 관리가 중요할 때 적합합니다.
Khoj를 선택하세요—지식이 주로 한 사람에게 속하고 검색 가능한 비공개 메모리 및 리서치 환경이 목표일 때 적합합니다.
AnythingLLM을 선택하세요—최소한의 인프라 작업으로 로컬 문서 검색 워크플로를 빠르게 구축하는 것이 우선일 때 적합합니다.
웹 검색과 비공개 지식 검색 비교
이 분야에서 가장 흔한 실수 중 하나는 웹 검색과 비공개 RAG를 서로 대체할 수 있는 것으로 취급하는 것입니다.
서로 다른 검색 문제를 해결합니다.
| 질문 | 최적의 검색 계층 |
|---|---|
| 오늘 무슨 일이 있었나요? | 실시간 웹 검색 |
| 우리의 내부 정책에는 무엇이라고 되어 있나요? | 비공개 문서 검색 |
| 이 프로젝트에서 무엇이 변경되었나요? | 연결된 앱 / 저장소 검색 |
| 최신 연구에서는 무엇을 말하나요? | 심층 리서치 + 웹 / 학술 검색 |
| 6개월 전에 이 주제에 대해 내가 무엇을 썼지? | 개인 지식 검색 |
성숙한 AI 검색 스택은 점점 다음 두 가지를 모두 결합하고 있습니다.
웹
\
비공개 파일 ----> 검색 계층 ----> LLM ----> 출처가 표시된 답변
/
연결된 앱
이 때문에 Onyx, Khoj, SurfSense, Open WebUI와 같은 제품은 기존의 RAG 애플리케이션보다 더 광범위한 역할을 하게 되고 있습니다.
Ollama와 함께 실행할 수 있는 셀프 호스팅 AI 검색 도구는 무엇인가요?
이 목록의 여러 도구는 LLM 추론 계층을 Ollama 또는 다른 로컬 모델 서버로 옮길 수 있습니다.
| 도구 | 로컬 모델 경로 | 일반적인 로컬 검색 스택 |
|---|---|---|
| Vane | Ollama | Vane + SearXNG + Ollama |
| Morphic | Ollama / 호환 제공업체 | Morphic + SearXNG + Ollama |
| Onyx | Ollama, LiteLLM, vLLM | Onyx + 커넥터 + 로컬 모델 |
| Khoj | 로컬 / OpenAI 호환 엔드포인트 | Khoj + 로컬 검색 + 로컬 모델 |
| SurfSense | Ollama, LM Studio | SurfSense + 커넥터 + 로컬 모델 |
| Open WebUI | Ollama | Open WebUI + SearXNG + Ollama |
| 로컬 심층 리서처 | Ollama, LM Studio | 리서치 에이전트 + 검색 백엔드 + 로컬 모델 |
| AnythingLLM | Ollama, LM Studio, LocalAI | AnythingLLM + 로컬 임베딩 + 로컬 벡터 DB |
중요한 점은 로컬 추론을 사용한다고 해서 실시간 웹 검색이 오프라인이 되는 것은 아니라는 것입니다.
다음과 같은 스택:
Vane
|
SearXNG
|
Ollama
LLM, 검색 오케스트레이션, 기록 및 애플리케이션 데이터를 자체 하드웨어에 유지할 수 있지만, 실시간 인터넷에 대해 검색할 때는 SearXNG가 여전히 외부 검색 서비스에 연결되어야 합니다.
완전한 에어갭 구성은 로컬에 이미 저장된 지식에 대해서만 작동합니다. 따라서 AnythingLLM, RAGFlow, Khoj 및 기타 비공개 문서 시스템이 더욱 적합해집니다.
SearXNG와 Ollama로 셀프 호스팅 AI 검색 스택 구축하기
홈랩에서는 검색, 추론 및 스토리지를 분리하는 것이 가장 깔끔한 아키텍처 중 하나입니다.
브라우저
|
AI 검색 앱
Vane / Morphic / Open WebUI
|
+--+-------------------+
| |
SearXNG Ollama
| |
실시간 웹 로컬 LLM
|
인터넷
비공개 스토리지
PDF / 메모 / 문서 / 캐시 / 인덱스
이러한 분리는 유연성을 제공합니다. SearXNG를 교체하지 않고도 Vane을 Morphic으로 교체할 수 있습니다. 검색 애플리케이션을 다시 구축하지 않고도 Ollama에서 실행되는 모델을 업그레이드할 수 있습니다. 애플리케이션 컨테이너가 변경되더라도 문서 아카이브와 인덱스를 영구 스토리지에 유지할 수 있습니다.
이 아키텍처는 로컬 AI 홈랩에 자연스럽게 부합합니다. 스토리지, Docker 서비스, 검색 인덱스, 벡터 데이터베이스 및 모델 런타임을 동일한 서버에 두거나 LAN을 통해 분리할 수 있습니다.
경량 서버에서 검색과 검색 결과 가져오기를 지속적으로 호스팅하고, 더 강력한 GPU 장비에서 LLM을 실행할 수 있습니다.
상시 가동 서버 GPU 워크스테이션
| |
AI 검색 앱 Ollama
SearXNG vLLM
벡터 DB |
문서 <------ LAN ---------+
모든 서비스를 하나의 과도하게 큰 장비에 억지로 배치하는 것보다 더 실용적일 수 있습니다.
셀프 호스팅 AI 검색에는 어느 정도의 하드웨어가 필요할까요?
검색 애플리케이션 자체는 일반적으로 스택에서 가장 많은 리소스를 요구하는 부분이 아닙니다.
리소스 사용량은 여러 계층에서 발생합니다.
| 계층 | 주요 리소스 | 중요한 이유 |
|---|---|---|
| 웹 검색 | 네트워크 + CPU | 여러 외부 소스를 쿼리하고 파싱합니다 |
| LLM 추론 | RAM / VRAM | 답변과 조사 요약을 생성합니다 |
| 임베딩 | CPU / GPU + RAM | 비공개 문서를 색인합니다 |
| 벡터 데이터베이스 | RAM + 스토리지 | 임베딩을 저장하고 검색합니다 |
| 문서 파싱 | CPU + 스토리지 | PDF, 오피스 파일, OCR 및 메타데이터를 처리합니다 |
| 검색 기록 / 캐시 | 스토리지 | 대화, 결과 및 조사 상태를 유지합니다 |
간단한 Vane + SearXNG 구성은 수백만 개의 문서 청크를 색인하는 대규모 RAGFlow 배포보다 훨씬 적은 하드웨어로 실행할 수 있습니다.
모델이 일반적으로 가장 큰 변수입니다. 호스팅 모델을 사용하면 검색 서버를 비교적 가볍게 유지할 수 있습니다. Ollama에서 더 큰 로컬 추론 모델을 실행하면 RAM과 가속기 요구 사항이 빠르게 증가합니다.
AnythingLLM의 현재 가이드는 이러한 차이를 잘 보여 줍니다. 애플리케이션 자체는 가벼울 수 있지만, 더 나은 로컬 모델 경험을 위해서는 더 많은 메모리와 GPU 성능이 필요합니다. 같은 원칙이 이 목록의 대부분 항목에 적용됩니다.
셀프 호스팅이 곧 자동으로 비공개를 의미하지는 않습니다
이는 이 범주 전체에서 가장 중요한 개인정보 보호 점검 항목입니다.
Docker에서 애플리케이션을 실행하는 것은 한 계층에 불과합니다.
| 계층 | 확인할 질문 |
|---|---|
| 검색 백엔드 | 웹 검색 쿼리를 전달받는 곳은 어디인가요? |
| LLM | 프롬프트와 검색된 구절은 어디에서 처리되나요? |
| 임베딩 | 색인 생성 중 문서 텍스트가 서버 외부로 전송되나요? |
| 벡터 데이터베이스 | 시맨틱 색인은 어디에 저장되나요? |
| 연결된 앱 | 검색 플랫폼은 어떤 외부 서비스에 액세스할 수 있나요? |
| 텔레메트리 | 어떤 사용 정보가 인스턴스 외부로 전송되나요? |
| 검색 기록 | 쿼리와 생성된 답변은 어디에 저장되나요? |
비공개 문서 검색에서는 임베딩 계층을 특히 간과하기 쉽습니다.
워크플로가 로컬 LLM을 사용하더라도 비공개 PDF의 모든 청크를 클라우드 임베딩 API로 전송할 수 있습니다. 이는 완전히 로컬에서 실행되는 RAG 스택과 동일하지 않습니다.
개인정보 보호가 목표라면 전체 경로를 점검해야 합니다.
문서
|
파서
|
임베딩 모델
|
벡터 DB
|
검색기
|
LLM
|
답변
ZimaSpace의 로컬 지식 베이스 가이드에서는 일회성 파일 채팅이 아닌 장기적인 비공개 검색을 목표로 할 때 스토리지, 임베딩, 벡터 검색 및 증거 규칙이 모두 중요한 이유를 자세히 설명합니다.
AI 검색이 심층 리서치로 발전하고 있습니다
2026년의 가장 큰 변화는 검색이 반복적으로 이루어지는 과정이 되고 있다는 점입니다.
기존 AI 검색 흐름은 다음과 같았습니다.
질문
|
한 번 검색
|
요약
|
답변
새로운 리서치 흐름은 점점 다음과 같은 형태가 되고 있습니다.
질문
|
검색
|
읽기
|
누락된 증거 식별
|
다시 검색
|
출처 비교
|
질문 다듬기
|
다시 검색
|
종합
|
인용된 보고서
Local Deep Researcher는 이러한 패턴을 명확히 보여 주지만, Onyx의 심층 리서치, SurfSense 같은 리서치 지향 워크스페이스, 최신 답변 엔진에 등장하는 “품질” 또는 적응형 모드에서도 같은 방향을 확인할 수 있습니다.
이 변화는 셀프 호스팅에 중요합니다. 심층 리서치는 일반 검색보다 더 많은 작업을 요구하기 때문입니다. 더 많은 검색 요청, 더 많은 검색 결과 텍스트, 더 긴 컨텍스트, 더 많은 모델 호출, 더 큰 리서치 상태를 생성합니다.
장점은 로컬 AI 검색 서버가 비공개 Google 대체재 이상의 역할을 할 수 있다는 것입니다. 공개 웹과 자체 데이터 모두를 대상으로 항상 켜져 있는 리서치 계층이 될 수 있습니다.
주목할 만한 기타 셀프 호스팅 AI 검색 도구
Farfalle은 SearXNG, Ollama, LiteLLM 및 에이전트 지향 검색을 지원하는 오픈 소스 AI 검색 프로젝트로 계속 주목할 만합니다. Vane 및 Morphic과 기능이 많이 겹치기 때문에 Top 10의 주요 항목으로 선정되지는 않았습니다.
학술 검색, 코드 검색, 엔터프라이즈 커넥터, 벡터 검색, NotebookLM 스타일 워크스페이스를 위한 전문 도구도 점점 늘고 있습니다. 이 분야는 너무 빠르게 확장되고 있어 “최고의 AI 검색 엔진”이라는 질문보다 실제로 어떤 검색 문제를 해결해야 하는지 묻는 편이 더 유용해지고 있습니다.
최종 결론
SearXNG와 Ollama를 활용한 가장 직접적인 셀프 호스팅 Perplexity 스타일 검색 경험을 원한다면 Vane을 선택하세요.
더 풍부한 생성형 검색 인터페이스와 애플리케이션에 가까운 배포 방식을 원한다면 Morphic을 선택하세요.
실제 검색 대상이 여러 도구와 저장소에 분산된 회사 지식이라면 Onyx를 선택하세요.
프라이빗 파일과 웹을 아우르는 개인 검색 계층을 원한다면 Khoj를 선택하세요.
검색이 리서치, 메모, 커넥터, 자동화 워크플로의 일부라면 SurfSense를 선택하세요.
이미 Ollama 기반 로컬 AI 스택을 사용 중이며 현재 인터페이스에 웹 검색과 로컬 RAG만 추가하고 싶다면 Open WebUI를 선택하세요.
빠른 답변 하나보다 반복 검색, 성찰, 근거 수집이 필요한 작업에는 Local Deep Researcher를 선택하세요.
프라이빗 문서 구문 분석, 수집, 검색 품질과 대규모 RAG가 웹 검색 UX보다 중요하다면 RAGFlow를 선택하세요.
로컬 모델, 로컬 임베딩, 기본 제공 RAG를 활용해 프라이빗 문서 검색을 가장 쉽게 시작하려면 AnythingLLM을 선택하세요.
웹 검색 백엔드 자체를 직접 관리하고 해당 검색 계층을 여러 로컬 AI 애플리케이션에 연결하려면 SearXNG를 선택하세요.
따라서 가장 유용한 셀프 호스팅 AI 검색 스택은 반드시 하나의 애플리케이션일 필요는 없습니다. 검색, 검색 증강, 추론, 프라이빗 스토리지, 인용 기능이 독립적으로 발전할 수 있는 모듈형 시스템인 경우가 많습니다.
자주 묻는 질문
2026년에 가장 좋은 셀프 호스팅 AI 검색 엔진은 무엇인가요?
Vane은 인용된 웹 답변, SearXNG, Docker 배포, Ollama를 통한 로컬 추론을 결합하므로 셀프 호스팅 Perplexity 스타일 답변 엔진을 위한 전반적으로 가장 강력한 선택지 중 하나입니다. 검색 인터페이스와 생성형 UI가 더 중요하다면 Morphic이 강력한 대안입니다.
Perplexity의 가장 좋은 오픈 소스 대안은 무엇인가요?
Vane과 Morphic은 가장 유사한 오픈 소스 셀프 호스팅 대안입니다. Vane은 SearXNG와 로컬 모델을 활용한 개인정보 보호 중심의 답변에 초점을 맞추며, Morphic은 생성형 UI와 유연한 검색 제공업체를 강조합니다.
Perplexica는 아직도 운영되고 있나요?
이전에 Perplexica로 알려졌던 프로젝트는 Vane으로 발전했습니다. 최신 버전을 찾는 사용자는 오래된 Perplexica 설치 가이드에 의존하기보다 Vane을 검토해야 합니다.
AI 웹 검색을 완전히 오프라인으로 실행할 수 있나요?
아니요. 실시간 웹에서 최신 정보가 필요하다면 불가능합니다. AI 모델, 애플리케이션, 기록, 검색 오케스트레이션은 로컬에 유지할 수 있지만, 웹 검색 백엔드는 최신 페이지나 검색 엔진 결과를 가져오기 위해 인터넷에 접속해야 합니다. 완전한 오프라인 검색은 이미 로컬에 저장된 데이터에 대해서만 가능합니다.
SearXNG를 Ollama와 함께 사용할 수 있나요?
예. SearXNG는 검색 결과를 제공하고 Ollama는 로컬 LLM 추론을 제공합니다. Vane, Morphic, Open WebUI, Local Deep Researcher 같은 애플리케이션은 그 사이에서 작동하며 검색 결과를 AI 생성 답변으로 변환할 수 있습니다.
개인 문서에 가장 적합한 자체 호스팅 AI 검색 도구는 무엇인가요?
AnythingLLM은 로컬 문서 Q&A를 위한 가장 쉬운 선택지 중 하나입니다. RAGFlow는 복잡한 수집 및 대규모 RAG 시스템에 더 적합하고, Onyx는 문서가 조직 전체의 여러 애플리케이션에 분산되어 있을 때 더 강력합니다.
팀에 가장 적합한 자체 호스팅 AI 검색 도구는 무엇인가요?
Onyx는 커넥터, 하이브리드 검색, RAG, 웹 검색, 에이전트, 팀 중심의 거버넌스를 결합하므로 이 목록에서 조직 전체 검색에 가장 적합합니다. 워크플로가 조사 중심이라면 SurfSense도 좋은 선택입니다.
AI 검색과 RAG의 차이점은 무엇인가요?
AI 검색은 정보를 검색하고 답변을 생성하는 더 광범위한 사용자 경험입니다. RAG는 관련 외부 컨텍스트를 바탕으로 LLM이 답변하도록 하는 검색 아키텍처 중 하나입니다. 자체 호스팅 AI 검색 도구는 개인 문서에 RAG를 사용하거나, 최신 정보에 실시간 웹 검색을 사용하거나, 두 가지를 모두 사용할 수 있습니다.
자체 호스팅 AI 검색에 벡터 데이터베이스가 필요한가요?
일반적인 실시간 웹 검색에는 필요하지 않습니다. 벡터 데이터베이스는 개인 문서, 메모, 저장소 또는 기타 지속적인 지식 기반에서 의미 검색이 필요할 때 유용합니다. AnythingLLM, RAGFlow, Onyx, Khoj 같은 도구는 기존 웹 검색을 넘어서는 검색 계층을 사용합니다.
Vane과 SearXNG의 차이점은 무엇인가요?
SearXNG는 검색 결과를 반환하는 메타검색 백엔드입니다. Vane은 SearXNG를 사용해 결과를 가져온 다음, LLM을 사용해 해당 결과를 인용이 포함된 답변으로 종합하는 AI 답변 엔진입니다.
자체 호스팅 AI 검색에서 로컬 모델과 클라우드 모델을 모두 사용할 수 있나요?
예. 이 목록의 많은 도구가 두 가지를 모두 지원합니다. 따라서 일반적인 검색은 Ollama를 사용해 로컬에서 처리하고, 필요한 경우 어려운 조사 작업은 호스팅 모델로 전달하는 하이브리드 아키텍처를 구축할 수 있습니다.
AI 모델과 검색 엔진 중 무엇을 먼저 자체 호스팅해야 하나요?
개인 문서의 개인정보 보호가 가장 큰 관심사라면 모델, 임베딩, 문서 인덱스부터 시작하세요. 웹 검색어의 개인정보 보호가 가장 큰 관심사라면 SearXNG 같은 자체 호스팅 검색 백엔드부터 시작하세요. 가장 강력한 제어가 필요하다면 두 계층 모두 자체 호스팅하세요.
기술 및 AI 허브
더 읽어보기

2026년 홈 랩을 위한 최고의 로컬 AI 웹 UI 10가지
홈 랩에 적합한 셀프 호스팅 로컬 AI 웹 UI 10가지를 비교하고, Ollama 지원, RAG, 에이전트, 다중 사용자 액세스, 설정 난이도 및 이상적인 사용 사례를...

GPT-6 Astra는 시간이 지남에 따라 얼마나 비용이 들까요? 클라우드 AI와 로컬 AI 중 어떤 경우에 무엇이 적합할까요?
토큰 사용량, 장기 AI 워크로드, 클라우드와 로컬 환경의 장단점, 그리고 하이브리드 AI 인프라가 중요한 이유를 다루는 실용적인 GPT-6 Astra 비용 가이드입니다.

GPT-6 Astra와 로컬 AI: 에이전트의 어떤 부분을 홈 서버에 유지해야 할까?
GPT-6 Astra는 클라우드에 머무르고, 홈 서버는 파일, 메모리, RAG, 도구, 권한 및 지속적인 에이전트 상태를 로컬에 보관할 수 있습니다.
