Die 10 besten selbst gehosteten KI-Suchtools im Jahr 2026

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Selbstgehostete KI-Suche bedeutet längst nicht mehr nur „einen Perplexity-Klon in Docker ausführen“. Im Jahr 2026 umfasst die Kategorie Web-Antwortmaschinen, die Suche in privaten Dokumenten, Deep-Research-Agenten, die Suche in Unternehmenswissen und lokale Such-Backends.

Die richtige Wahl hängt davon ab, was du tatsächlich unter deiner Kontrolle behalten möchtest: die Suchanfrage, das Modell, deine Dateien, die Embeddings, den Suchindex oder die gesamte Retrieval-Pipeline. Diese 10 Tools decken die wichtigsten Möglichkeiten ab, diesen Stack selbst aufzubauen.

Was bedeutet „selbstgehostete KI-Suche“ eigentlich?

Ein selbstgehostetes KI-Suchtool kann verschiedene Dinge bedeuten.

Suchtyp Was durchsucht wird Typische Architektur
Web-Antwortmaschine Das Live-Web Such-Backend + LLM + Zitate
Suche im privaten Wissen Dokumente, Notizen, Laufwerke, Apps Aufnahme + Embeddings + Retrieval + LLM
Tiefgehender Recherche-Agent Mehrere Websuchen im Zeitverlauf Suchen → reflektieren → erneut suchen → zusammenfassen
Such-Backend Mehrere herkömmliche Suchmaschinen Metasuch-API als Zufuhr für eine KI-Schicht

Der Unterschied ist wichtig, denn der Betrieb der Weboberfläche auf deinem eigenen Server macht nicht automatisch den gesamten Such-Workflow privat.

Du könntest das Frontend selbst hosten und Anfragen trotzdem an ein kommerzielles LLM und eine gehostete Such-API senden:

Browser
   |
Selbstgehostete Suchoberfläche
   |
   +--- Cloud-LLM
   |
   +--- Gehostete Such-API

Oder du kannst fast den gesamten Stack auf deine eigene Infrastruktur verlagern:

Browser
   |
Selbstgehostete KI-Suche
   |
   +--- SearXNG
   +--- Ollama
   +--- Lokale Embeddings
   +--- Lokaler Suchindex
   +--- Private Dateien

Diese zweite Architektur ist besonders für eine lokale Wissensdatenbank relevant. Bei der Suche geht es nicht mehr nur darum, Seiten im Internet zu finden; sie kann auch als Retrieval-Schicht für Dokumente, Forschungsarchive, Projektdateien und private Betriebsdaten dienen.

So haben wir die besten selbstgehosteten KI-Suchtools bewertet

Dies ist keine Rangliste nach GitHub-Sternen, und diese Tools lösen nicht alle dasselbe Suchproblem.

Die Rangliste konzentriert sich auf sieben praktische Faktoren: wie vollständig sich der Stack selbst hosten lässt, die Qualität seiner Such- und Retrieval-Architektur, die Unterstützung lokaler Modelle, die Beleg- und Quellenfundierung, die Suche in privaten Daten, der Bereitstellungsaufwand und die aktuelle Relevanz des Projekts im Jahr 2026.

Wir unterscheiden außerdem zwischen „selbstgehostet“ und „vollständig lokal“. Ein Tool kann auf deinem Server installiert sein und trotzdem OpenAI, Anthropic, Tavily, Brave, Exa oder einen anderen externen Anbieter aufrufen. Das kann weiterhin nützlich sein, entspricht aber einem anderen Datenschutzmodell als Ollama + lokale Embeddings + ein selbstgehostetes Such-Backend.

Die 10 besten selbstgehosteten KI-Suchtools auf einen Blick

Rang Tool Suchtyp Websuche Private Dateien Lokales LLM Am besten geeignet für
1 Vane Web-Antwortmaschine Ja Ja Ollama Selbstgehostete Suche im Perplexity-Stil
2 Morphic Web-Antwortmaschine Ja Ja Ollama Generative Suchoberfläche
3 Onyx Suche nach Unternehmenswissen Ja Ja Ollama, LiteLLM, vLLM Team- und Unternehmenssuche
4 Khoj Persönliches Wissen + Websuche Ja Ja Lokale/kompatible APIs Persönliches zweites Gehirn
5 SurfSense Recherche-Arbeitsbereich Ja Ja Ollama, LM Studio Verknüpfte Recherche-Workflows
6 Open WebUI KI-Arbeitsbereich + Suche Ja Ja Ollama Suche zu einer vorhandenen lokalen KI-Oberfläche hinzufügen
7 Lokaler Recherche-Agent Tiefgehender Recherche-Agent Ja Eingeschränkt Ollama, LM Studio Iterative lokale Recherche
8 RAGFlow Dokumenten-/RAG-Suche Sekundär Ja Optionen für selbst gehostete Modelle Komplexe private Dokumentensuche
9 AnythingLLM Suche in privaten Dokumenten Sekundär Ja Ollama, LM Studio, LocalAI Einfache lokale Dokumenten-Fragen und -Antworten
10 SearXNG Meta-Such-Backend Ja Nein Nicht zutreffend Privates Such-Backend für lokale KI

1. Vane — Beste selbst gehostete KI-Suchmaschine insgesamt

Vorschau

Vane, früher bekannt als Perplexica, ist eine der direktesten Antworten auf die Frage: „Was kann ich anstelle von Perplexity selbst hosten?“

Es kombiniert ein Such-Backend mit einer LLM-Antwortschicht und liefert fundierte Antworten mit zitierten Quellen. Das aktuelle Projekt unterstützt lokale Inferenz über Ollama sowie gehostete Anbieter wie OpenAI, Anthropic Claude, Google Gemini und Groq.

Seine Suchschicht basiert auf SearXNG. Dadurch muss Vane nicht von einer einzelnen kommerziellen Such-API abhängig sein. Das empfohlene Docker-Image kann SearXNG sogar zusammen mit der Anwendung bündeln, während eine schlanke Bereitstellung auf eine vorhandene SearXNG-Instanz an anderer Stelle in Ihrem Netzwerk verweisen kann.

Vane unterteilt das Suchverhalten außerdem in Modi für Geschwindigkeit, ausgewogene Nutzung und gründlichere Recherche. Es kann allgemeine Web-Ergebnisse, Diskussionen und akademische Quellen durchsuchen, anstatt jede Anfrage gleich zu behandeln.

Nutzerfrage
     |
     v
    Vane
     |
 +---+----+
 |        |
SearXNG  Ollama
 |        |
Web      Lokales LLM
 +---+----+
     |
Antwort mit Zitaten

Deshalb belegt Vane den ersten Platz: Es entspricht dem klassischen Anwendungsfall der KI-Suche besonders gut und gibt Nutzern selbst gehosteter Systeme zugleich die Kontrolle über Suche und Inferenz.

Am besten für: Nutzer, die eine private, selbst gehostete Antwortmaschine im Stil von Perplexity mit Zitaten und Ollama-Unterstützung wünschen.

Kompromiss: Die Websuche erfordert weiterhin ausgehenden Internetzugriff, und die Nutzung cloudbasierter LLM-Anbieter verändert das Datenschutzmodell, selbst wenn die Vane-Anwendung lokal ausgeführt wird.

2. Morphic — Beste selbst gehostete KI-Suche für generative Benutzeroberflächen

Morphic überschneidet sich oberflächlich mit Vane: Beide können Websuche mit von LLMs generierten Antworten, Zitaten, Docker-Bereitstellung, Ollama und SearXNG kombinieren.

Der Unterschied liegt in der Darstellung und Interaktion.

Morphic beschreibt sich als KI-gestützte Suchmaschine mit einer generativen Benutzeroberfläche. Anstatt jede Antwort auf einfaches Markdown zu beschränken, kann die Oberfläche umfangreichere Komponenten wie bildgestützte Abschnitte, Raster, Überschriften und andere strukturierte Ergebnisblöcke streamen.

Die aktuelle Suchschicht unterstützt SearXNG, Tavily, Brave und Exa. Für die Modellauswahl können OpenAI, Anthropic, Google, Ollama, Vercel AI Gateway oder OpenAI-kompatible Anbieter verwendet werden.

Die Docker-Einrichtung ist besonders komfortabel, da Docker Compose Morphic, PostgreSQL, Redis und SearXNG gemeinsam starten kann. Damit ist es eine der besseren Optionen für alle, die eine vollständige lokale Suchanwendung nutzen möchten, ohne jeden Dienst manuell zusammenbauen zu müssen.

Am besten geeignet für: Nutzer, die ein ausgereiftes Sucherlebnis im Stil von Perplexity mit umfangreicheren generierten Benutzeroberflächen und flexiblen Suchanbietern wünschen.

Kompromiss: Der Stack ist umfangreicher als eine minimale Vane-Bereitstellung, da das vollständige Erlebnis PostgreSQL, Redis, Authentifizierung, Verlauf und zusätzliche Anwendungsdienste umfasst.

3. Onyx — Beste selbst gehostete KI-Suche für Teams und Unternehmenswissen

Stille Onyx-Chat-Demo

Onyx gehört in eine andere Kategorie als Vane und Morphic.

Die zentrale Frage lautet nicht: „Was sagt das Web?“ Sie lautet:

„Was weiß unsere Organisation bereits?“

Onyx kombiniert hybride Abfrage, RAG, Tiefenrecherche, Agenten, Websuche und ein umfangreiches Connector-Ökosystem. Es kann Informationen aus internen Anwendungen und Repositorien indexieren und bei Bedarf gleichzeitig das aktuelle Web durchsuchen.

Das Projekt unterstützt mehr als 50 Indexierungs-Connectoren und kann eine Verbindung zu Tools wie Slack, Google Drive, GitHub, Jira, Confluence und anderen Teamsystemen herstellen. Die Community Edition deckt zentrale Chat-, RAG-, Agenten- und Aktionsfunktionen ab, während größere Organisationen zusätzliche Funktionen für Unternehmensidentität und Governance hinzufügen können.

Es unterstützt außerdem selbst gehostete Modellinfrastrukturen wie Ollama, LiteLLM und vLLM, anstatt alle Suchergebnisse über ein einziges gehostetes LLM zu leiten.

Slack -------\
Drive --------\
GitHub --------> Onyx ----> Suche / RAG / Tiefenrecherche
Confluence ---/
Web ----------/

Dies kommt einer selbst gehosteten Glean-ähnlichen Suchschicht wesentlich näher als ein einfacher Perplexity-Klon.

Am besten geeignet für: Teams, die eine einheitliche Such- und Antwortschicht für Unternehmensdokumente, Apps, Repositorien und das Web wünschen.

Kompromiss: Onyx ist deutlich umfangreicher als nötig, wenn das Ziel ausschließlich die private Websuche ist.

4. Khoj — Beste persönliche KI-Suche für das Web und private Dateien

Demo-Chat

Khoj nimmt den persönlichen Bereich ein, auf den Onyx für Organisationen abzielt.

Es vereint private Dokumente, Webinformationen, semantische Suche, Agenten und persönliches Wissen in einer selbst hostbaren Umgebung im Stil eines „zweiten Gehirns“.

Die Sucharchitektur ist anspruchsvoller als eine einfache Vektorsuche. In der Dokumentation von Khoj wird ein zweistufiger Abrufprozess beschrieben, bei dem ein Bi-Encoder Kandidatendokumente abruft und ein langsamerer Cross-Encoder sie für die aktuelle Anfrage neu bewertet.

Das ist wichtig, weil gute KI-Suche nicht nur vom Erstellen von Einbettungen abhängt. Die Qualität der Abfrage hängt davon ab, genügend Kandidaten zu finden und anschließend die relevantesten Belege neu zu bewerten, bevor das LLM sie sieht.

Khoj kann lokale Suchmodelle und OpenAI-kompatible Endpunkte verwenden, einschließlich Ollama-kompatibler Setups, wodurch es sich für ein persönliches, privates Wissenssystem eignet.

Am besten geeignet für: Einzelpersonen, die Notizen, Dateien, Dokumente und das Web in einem selbst ge hosteten persönlichen KI-Arbeitsbereich durchsuchen möchten.

Kompromiss: Es ist stärker auf persönliches Wissen und Assistenten-Workflows ausgelegt als auf organisationsweite Unternehmensindizierung und Berechtigungsverwaltung.

5. SurfSense — Der beste selbst gehostete KI-Recherchearbeitsbereich

Mit PDFs und Dokumenten chatten

SurfSense lässt sich besser als vernetzter Recherchearbeitsbereich verstehen denn als ein weiteres Suchfeld.

Die selbst gehostete Plattform kann Informationsquellen verbinden, durchsuchbares Wissen aufbauen und Arbeitsabläufe rund um Recherche, Notizen, Automatisierungen und Agenten unterstützen. Die aktuelle Dokumentation umfasst Konnektoren für Dienste wie Notion, Slack, Google, Jira und andere externe Wissensquellen.

Außerdem dokumentiert es Verbindungen zu lokalen Modellen über Ollama und LM Studio, sodass die Anwendungs- und die Inferenzschicht unter der Kontrolle der Nutzer bleiben können.

Das macht SurfSense besonders interessant, wenn „Suche“ nur ein Schritt in einem längeren Arbeitsablauf ist:

Quellen sammeln
      |
Wissen indizieren
      |
Suchen / Fragen
      |
Notizen erstellen
      |
Automatisierung ausführen
      |
Recherche fortsetzen

Am besten geeignet für: Forschende und wissensintensive Teams, die Suche, verknüpfte Quellen, Notizen und Automatisierung in einem selbst gehosteten Arbeitsbereich nutzen möchten.

Kompromiss: Wenn du nur schnelle Webantworten mit Quellenangaben möchtest, sind Vane oder Morphic einfacher und stärker auf diesen Zweck ausgerichtet.

6. Open WebUI — Die beste Möglichkeit, einem bestehenden lokalen KI-Stack eine Suche hinzuzufügen

Open-WebUI-Demo öffnen

Open WebUI ist in erster Linie keine Suchmaschine, und dieser Unterschied sollte ausdrücklich klargestellt werden.

Die Stärke liegt darin, dass viele Nutzer lokaler KI es bereits als Benutzeroberfläche vor Ollama oder anderen Modellservern einsetzen. Für diese Nutzer kann es praktischer sein, die Suche in den bestehenden KI-Arbeitsbereich zu integrieren, als eine separate Suchanwendung bereitzustellen.

Open WebUI unterstützt derzeit die Websuche über eine Vielzahl von Anbietern, darunter SearXNG, Brave, DuckDuckGo, Tavily, Exa, Kagi, Perplexity, Jina, Bing und mehrere weitere Suchmaschinen.

Der offizielle Integrationsleitfaden für SearXNG zeigt, wie ein separater lokaler SearXNG-Container zur Suchschicht für Open WebUI werden kann.

Dieselbe Anwendung unterstützt außerdem lokales RAG für hochgeladene Dokumente und Dokumentbibliotheken, sodass Nutzer Webabrufe und den Abruf privater Dateien in einer einzigen Oberfläche kombinieren können.

Am besten für: Nutzer, die bereits Ollama + Open WebUI betreiben und eine selbst gehostete Websuche hinzufügen möchten, ohne zu einer speziellen Antwortmaschine zu wechseln.

Kompromiss: Da Open WebUI ein allgemeiner KI-Arbeitsbereich ist, hängt das Suchverhalten stark vom Tool-Aufruf des Modells, der Kontextgröße, den Abrufeinstellungen und der Konfiguration des ausgewählten Suchanbieters ab.

7. Local Deep Researcher — Am besten für vollständig lokale, gründliche Rechercheagenten

Screenshot 24.01.2025, 22:08:31

Local Deep Researcher zeigt, wohin sich die KI-Suche über Antwortmaschinen mit nur einer Suchanfrage hinaus entwickelt.

Das Projekt verwendet ein lokales LLM über Ollama oder LM Studio, um eine Suchanfrage zu generieren, Web-Ergebnisse zu sammeln, sie zusammenzufassen, verbleibende Wissenslücken zu identifizieren, eine weitere Anfrage zu erstellen und den Zyklus zu wiederholen, bevor ein abschließender Bericht mit Quellenangaben generiert wird.

Fragen
   |
Suchanfrage generieren
   |
Web durchsuchen
   |
Zusammenfassen
   |
Wissenslücken finden
   |
Erneut suchen
   |
Wiederholen
   |
Abschließender Bericht mit Quellenangaben

Die Suche kann standardmäßig DuckDuckGo verwenden, mit optionalen Integrationen für SearXNG, Tavily oder Perplexity.

Dadurch unterscheidet es sich von Vane oder Morphic. Diese Tools sind auf interaktive Suche und eine intuitive Antwortoberfläche optimiert. Local Deep Researcher ist auf iterative Recherche optimiert.

Am besten für: Recherchefragen, bei denen eine einzige Suche wahrscheinlich nicht genügend Belege liefert und der Agent nach dem Erkennen von Lücken gezielt erneut suchen sollte.

Kompromiss: Wiederholte Such- und Zusammenfassungszyklen sind langsamer und rechenintensiver als bei einer gewöhnlichen Antwortmaschine, insbesondere wenn das LLM lokal ausgeführt wird.

8. RAGFlow — Am besten für die Suche in komplexen privaten Dokumenten

RAGFlow versucht nicht in erster Linie, mit Perplexity zu konkurrieren.

Es ist eine Abrufplattform, die komplexe private Daten in zuverlässigen Kontext für LLMs umwandelt.

Das aktuelle Projekt kombiniert durchgängiges RAG mit Dokumenten-Parsing, orchestrierten Aufnahmepipelines, Agenten-Workflows, MCP-Unterstützung und der Datensynchronisierung aus Quellen wie Confluence, S3, Notion, Discord und Google Drive.

Das macht es zu einer besseren Lösung für Fragen wie:

„Wie durchsuche ich Tausende von PDFs, Office-Dateien, internen Dokumenten und verbundenen Wissensquellen mit zuverlässigem Retrieval?“

statt:

„Was ist heute im Web passiert?“

RAGFlow entwickelt sich außerdem zu einer Context-Schicht für Agenten weiter. Im Jahr 2026 wurde ein offizielles Skill für den Zugriff auf RAGFlow-Datasets über OpenClaw hinzugefügt. Das veranschaulicht, wie sich die Dokumentsuche von isoliertem RAG-Chat hin zu einer wiederverwendbaren Agenteninfrastruktur entwickelt.

Für eine ausführlichere Betrachtung dieser Ebene unterteilt der ZimaSpace-Leitfaden zu Dokumentsuche und RAG den Workflow in Extraktion, Aufteilung in Textabschnitte, Embeddings, Vektorsuche, Reranking und die Generierung evidenzbasierter Antworten.

Am besten geeignet für: größere Dokumentensammlungen und Teams, die umfassende Workflows für Aufnahme, Parsing, Retrieval und Wissensverarbeitung benötigen.

Kompromiss: RAGFlow ist deutlich umfangreicher als eine einfache lokale Anwendung zum Chatten mit Dokumenten und überdimensioniert, wenn deine Wissensbasis nur aus wenigen Ordnern besteht.

9. AnythingLLM – Beste einfach zu bedienende selbst gehostete Suche für private Dokumente

Chat

AnythingLLM gehört zum zugänglicheren Bereich der privaten KI-Suche.

Es kann Dokumente aufnehmen, Workspaces erstellen, Embeddings erzeugen, relevanten Kontext abrufen, Quellenangaben anzeigen und eine Verbindung zu lokalen oder Cloud-Modellen herstellen, ohne dass Nutzer einen RAG-Stack aus separaten Komponenten zusammenstellen müssen.

Die Unterstützung für lokale Modelle umfasst Ollama, LM Studio, LocalAI und mit llama.cpp kompatible Modelle. Auch die Embedding-Schicht kann lokal betrieben werden. Das Projekt unterstützt außerdem mehrere Vektordatenbanken, darunter LanceDB, Chroma, Qdrant, Weaviate, Milvus und PGVector.

Die Datenschutzbedingungen für das Self-Hosting von AnythingLLM sind ungewöhnlich eindeutig: Dokumente, Verläufe, Workspace-Einstellungen und Embeddings verbleiben auf einer vom Nutzer verwalteten Infrastruktur, und die Anwendung kann bei Auswahl lokaler Modell- und Vektorkomponenten vollständig vom Netzwerk getrennt betrieben werden.

Das macht es zu einer natürlichen Brücke zwischen „mit meinen Dokumenten chatten“ und einem umfassenderen lokalen KI-Workflow.

Am besten geeignet für: Nutzer, die eine einfache lokale Anwendung für Dokumentensuche und RAG wünschen, ohne eine komplexere Abrufplattform verwalten zu müssen.

Kompromiss: Die Bereitstellung ist einfacher als bei RAGFlow oder Onyx, doch diese Einfachheit bedeutet auch, dass es nicht die stärkste Wahl für die organisationsweite Indexierung oder eine fortschrittliche Recherche-Orchestrierung ist.

10. SearXNG – Bestes privates Such-Backend für lokale KI

SearXNG – Wikipedia

SearXNG ist der Sonderfall, da es keine KI-Antwortmaschine ist.

Es handelt sich um eine selbst gehostete Metasuchmaschine, die Ergebnisse aus bis zu 272 Suchdiensten bündelt und dabei Nutzer-Tracking und Profiling vermeidet.

Damit ist es eine der wichtigsten Infrastrukturkomponenten im Ökosystem der selbst gehosteten KI-Suche.

Vane kann SearXNG verwenden. Morphic kann SearXNG verwenden. Open WebUI kann SearXNG verwenden. Local Deep Researcher kann SearXNG verwenden.

Seine Aufgabe ist einfach:

Nutzeranfrage
    |
SearXNG
    |
Rohe Suchergebnisse
    |
Lokales LLM
    |
Zitierte KI-Antwort

Wenn Sie das Such-Backend selbst hosten, trennen Sie die Abrufschicht von der Antwortschicht. Sie können LLMs wechseln, ohne die Suchmaschine zu ändern, oder Antwortanwendungen austauschen und dabei dieselbe Suchinfrastruktur beibehalten.

Am besten geeignet für: Nutzer, die ein privates, Google-ähnliches Metasuch-Backend wünschen, das Vane, Open WebUI, Morphic, Rechercheagenten oder eigene lokale KI-Anwendungen versorgen kann.

Kompromiss: SearXNG fasst Ergebnisse nicht zusammen, führt keine Schlussfolgerungen durch und generiert nicht eigenständig zitierte Antworten. Für eine Perplexity-ähnliche Erfahrung benötigen Sie darüber eine KI-Schicht.

Welches selbst gehostete KI-Suchtool sollten Sie wählen?

Wenn Sie Folgendes möchten ... Beginnen Sie mit Warum
Eine private Perplexity-Alternative Vane Fokussierte, selbst gehostete Web-Antwortmaschine mit SearXNG und Ollama
Eine umfangreichere generative Suchoberfläche Morphic Generative Benutzeroberfläche plus flexible Suchanbieter
Wissenssuche im gesamten Team Onyx Großes Konnektoren-Ökosystem sowie hybride Suche und RAG
Persönliche Dateien und das Web durchsuchen Khoj Suche im persönlichen Wissen mit lokaler Abfrage
Ein vernetzter Recherche-Arbeitsbereich SurfSense Suche, Quellen, Notizen, Konnektoren und Automatisierungen
Suche zu einem Ollama-Chat-Stack hinzufügen Open WebUI Erweiterbare Suche innerhalb einer vertrauten lokalen KI-Oberfläche
Mehrstufige Webrecherche Lokaler Recherche-Agent Durchsucht das Web, reflektiert, erkennt Lücken und sucht erneut
Komplexe Dokumentenabfrage im Unternehmen RAGFlow Fortschrittliche Ingestion- und RAG-Architektur
Einfache private Dokumentenfragen AnythingLLM Local-first-App mit integrierten Dokumentpipelines und Vektorspeichern
Ein privates Such-Backend SearXNG Wiederverwendbare Metasuchschicht für viele KI-Anwendungen

Vane vs. Morphic: Welche selbst gehostete Perplexity-Alternative ist besser?

Vane und Morphic sind die beiden naheliegendsten Optionen, wenn Ihr Denkmodell lautet: „Ich möchte Perplexity, aber auf meinem eigenen Server.“

Bereich Vane Morphic
Hauptfokus Datenschutzorientierte KI-Antwortmaschine KI-Suche mit generativer Benutzeroberfläche
SearXNG Zentraler Suchpfad Unterstützt und in Docker Compose enthalten
Ollama Ja Ja
Cloud-Modelle Ja Ja
Dateien Ja Ja
Zitate Ja Ja
Suchmodi Geschwindigkeit, Ausgewogenheit, Qualität Schnell, adaptiv
Am besten geeignet Fokussierte private Antwortmaschine Such-UX und umfassendere Ergebnisdarstellung

Wählen Sie Vane, wenn vorrangig eine fokussierte private Antwortmaschine mit einer unkomplizierten SearXNG- + Ollama-Architektur gefragt ist.

Wählen Sie Morphic, wenn die Suchoberfläche selbst wichtig ist und Sie umfassendere generative Ergebniskomponenten, Verlauf, Authentifizierung und ein anwendungsähnlicheres Erlebnis wünschen.

Onyx vs. Khoj vs. AnythingLLM für die Suche im privaten Wissensbestand

Alle drei können private Informationen durchsuchen, zielen jedoch auf sehr unterschiedliche Einsatzszenarien ab.

Bereich Onyx Khoj AnythingLLM
Primäre Nutzer Team / Organisation Einzelperson Einzelperson oder kleines Team
Verbundene Apps Umfangreiches Konnektoren-Ökosystem Persönliche Wissensquellen Dokumenten- / arbeitsbereichsorientiert
Websuche Stark Verfügbar Sekundär zur Dokumentsuche
Abfragetiefe Hybridsuche + agentisches RAG Bi-Encoder + Reranking Integrierte RAG-Pipeline
Lokale Modelle Ja Ja Ja
Am besten geeignet Unternehmensweites Wissen Persönliches zweites Gehirn Einfache private Dokumentenfragen

Wählen Sie Onyx, wenn sich Informationen über viele Team-Anwendungen verteilen und Berechtigungen eine Rolle spielen.

Wählen Sie Khoj, wenn das Wissen hauptsächlich einer einzelnen Person gehört und das Ziel ein durchsuchbares privates Gedächtnis und eine Rechercheumgebung ist.

Wählen Sie AnythingLLM, wenn es vorrangig darum geht, schnell einen Workflow für die lokale Dokumentsuche mit minimalem Infrastrukturaufwand einzurichten.

Websuche vs. Suche im privaten Wissensbestand

Einer der häufigsten Fehler in dieser Kategorie besteht darin, Websuche und privates RAG als austauschbar zu betrachten.

Sie lösen unterschiedliche Abfrageprobleme.

Fragen Beste Abfrageebene
Was ist heute passiert? Live-Websuche
Was besagt unsere interne Richtlinie? Suche in privaten Dokumenten
Was hat sich in diesem Projekt geändert? Suche in verbundenen Apps / Repositorien
Was sagt die aktuelle Forschung? Tiefgehende Recherche + Web- / wissenschaftliche Suche
Was habe ich vor sechs Monaten darüber geschrieben? Suche im persönlichen Wissensbestand

Ein ausgereifter KI-Such-Stack kombiniert zunehmend beides:

               Web
                \
Private Dateien ----> Abfrageebene ----> LLM ----> Zitierte Antwort
                /
Verbundene Apps

Deshalb werden Produkte wie Onyx, Khoj, SurfSense und Open WebUI umfassender als herkömmliche RAG-Anwendungen.

Welche selbst gehosteten KI-Suchtools können mit Ollama ausgeführt werden?

Mehrere Tools auf dieser Liste können die LLM-Inferenz auf Ollama oder einen anderen lokalen Modellserver verlagern.

Tool Pfad zum lokalen Modell Typischer lokaler Such-Stack
Vane Ollama Vane + SearXNG + Ollama
Morphic Ollama / kompatible Anbieter Morphic + SearXNG + Ollama
Onyx Ollama, LiteLLM, vLLM Onyx + Konnektoren + lokales Modell
Khoj Lokale / OpenAI-kompatible Endpunkte Khoj + lokale Abfrage + lokales Modell
SurfSense Ollama, LM Studio SurfSense + Konnektoren + lokales Modell
Open WebUI Ollama Open WebUI + SearXNG + Ollama
Lokaler Recherche-Agent Ollama, LM Studio Recherche-Agent + Such-Backend + lokales Modell
AnythingLLM Ollama, LM Studio, LocalAI AnythingLLM + lokale Embeddings + lokale Vektordatenbank

Die wichtige Einschränkung lautet: Lokale Inferenz macht die Live-Websuche nicht offline.

Ein Stack wie:

Vane
 |
SearXNG
 |
Ollama

kann LLM, Suchorchestrierung, Verlauf und Anwendungsdaten auf Ihrer Hardware behalten, aber SearXNG muss weiterhin externe Suchdienste erreichen, wenn Sie das Live-Internet durchsuchen.

Eine wirklich vollständig vom Netz getrennte Einrichtung funktioniert nur für Wissen, das bereits lokal gespeichert ist. Hier werden AnythingLLM, RAGFlow, Khoj und andere Systeme für private Dokumente relevanter.

So erstellen Sie einen selbst gehosteten KI-Such-Stack mit SearXNG und Ollama

Für ein Homelab gehört die Trennung von Suche, Inferenz und Speicher zu den saubersten Architekturen:

Browser
   |
KI-Such-App
Vane / Morphic / Open WebUI
   |
+--+-------------------+
|                      |
SearXNG              Ollama
|                      |
Live-Web             Lokales LLM
|
Internet

Privater Speicher
PDFs / Notizen / Dokumente / Cache / Indizes

Diese Trennung gibt Ihnen Flexibilität. Sie können Vane durch Morphic ersetzen, ohne SearXNG auszutauschen. Sie können das in Ollama ausgeführte Modell aktualisieren, ohne die Suchanwendung neu aufzubauen. Sie können Ihr Dokumentarchiv und Ihre Indizes auf dauerhaftem Speicher behalten, auch wenn sich die Anwendungcontainer ändern.

Diese Architektur passt natürlich zu einem lokalen KI-Homelab, in dem Speicher, Docker-Dienste, Suchindizes, Vektordatenbanken und Laufzeitumgebungen für Modelle auf demselben Server liegen oder über das LAN verteilt werden können.

Ein schlanker Server kann Suche und Abrufe dauerhaft hosten, während ein leistungsstärkerer GPU-Rechner das LLM ausführt:

Server im Dauerbetrieb            GPU-Workstation
      |                           |
 KI-Such-App                  Ollama
 SearXNG                         vLLM
 Vektordatenbank                        |
 Dokumente  <------ LAN ---------+

Das kann praktischer sein, als jeden Dienst auf einen einzigen überdimensionierten Rechner zu zwingen.

Wie viel Hardware benötigt eine selbst gehostete KI-Suche?

Die Suchanwendung selbst ist normalerweise nicht der anspruchsvollste Teil des Stacks.

Der Ressourcenverbrauch verteilt sich auf mehrere Ebenen:

Ebene Hauptressource Warum das wichtig ist
Websuche Netzwerk + CPU Fragt mehrere externe Quellen ab und analysiert sie
LLM-Inferenz RAM / VRAM Erstellt Antworten und Forschungszusammenfassungen
Embeddings CPU / GPU + RAM Indiziert private Dokumente
Vektordatenbank RAM + Speicher Speichert und durchsucht Embeddings
Dokumentanalyse CPU + Speicher Verarbeitet PDFs, Office-Dateien, OCR und Metadaten
Suchverlauf / Cache Speicher Speichert Unterhaltungen, Ergebnisse und den Recherchestatus

Eine einfache Vane- + SearXNG-Konfiguration kann mit deutlich weniger Hardware auskommen als eine große RAGFlow-Bereitstellung, die Millionen von Dokumentabschnitten indiziert.

Das Modell ist normalerweise die größte Variable. Wenn Sie ein gehostetes Modell verwenden, kann der Suchserver relativ schlank bleiben. Wenn Ollama ein größeres lokales Reasoning-Modell ausführt, steigen die Anforderungen an RAM und Beschleuniger schnell.

Die aktuellen Empfehlungen von AnythingLLM veranschaulichen diese Trennung gut: Die Anwendung selbst kann schlank sein, während eine bessere Erfahrung mit lokalen Modellen von mehr Arbeitsspeicher und GPU-Kapazität profitiert. Dasselbe Prinzip gilt für den Großteil dieser Liste.

Selbst gehostet bedeutet nicht automatisch privat

Dies ist die wichtigste Datenschutzprüfung in der gesamten Kategorie.

Die Anwendung in Docker auszuführen ist nur eine Ebene.

Ebene Zu stellende Frage
Such-Backend Wer erhält die Websuchanfrage?
LLM Wo werden Prompts und abgerufene Passagen verarbeitet?
Embeddings Verlässt Dokumenttext während der Indexierung den Server?
Vektordatenbank Wo werden semantische Indizes gespeichert?
Verbundene Apps Auf welche externen Dienste kann die Suchplattform zugreifen?
Telemetrie Welche Nutzungsinformationen verlassen die Instanz?
Suchverlauf Wo werden Suchanfragen und generierte Antworten gespeichert?

Bei der Suche in privaten Dokumenten wird die Embedding-Ebene besonders leicht übersehen.

Ein Workflow kann ein lokales LLM verwenden, aber trotzdem jeden Abschnitt eines privaten PDFs an eine Cloud-API für Embeddings senden. Das ist nicht gleichbedeutend mit einem vollständig lokalen RAG-Stack.

Wenn Datenschutz das Ziel ist, sollte der gesamte Pfad geprüft werden:

Dokument
   |
Parser
   |
Embedding-Modell
   |
Vektordatenbank
   |
Retriever
   |
LLM
   |
Antworten

Der ZimaSpace-Leitfaden zu lokalen Wissensdatenbanken erläutert ausführlicher, warum Speicher, Embeddings, Vektorsuche und Belegregeln wichtig sind, wenn das Ziel eine langfristige private Suche statt eines einmaligen Chats über Dateien ist.

KI-Suche entwickelt sich zu gründlicher Recherche

Die größte Veränderung im Jahr 2026 besteht darin, dass die Suche iterativ wird.

Der frühere KI-Suchablauf war:

Fragen
   |
Einmal suchen
   |
Zusammenfassen
   |
Antworten

Der neue Rechercheablauf sieht zunehmend so aus:

Fragen
   |
Suchen
   |
Lesen
   |
Fehlende Belege identifizieren
   |
Erneut suchen
   |
Quellen vergleichen
   |
Frage verfeinern
   |
Erneut suchen
   |
Zusammenführen
   |
Bericht mit Quellenangaben

Local Deep Researcher macht dieses Muster ausdrücklich sichtbar, aber dieselbe Richtung zeigt sich auch bei der gründlichen Recherche von Onyx, forschungsorientierten Arbeitsbereichen wie SurfSense und den „Qualitäts“- oder adaptiven Modi moderner Antwortmaschinen.

Diese Entwicklung ist für Self-Hosting wichtig, weil gründliche Recherche anspruchsvoller ist als gewöhnliche Suche. Sie erzeugt mehr Suchanfragen, mehr abgerufenen Text, längere Kontexte, mehr Modellaufrufe und einen größeren Recherchekontext.

Der Vorteil besteht darin, dass ein lokaler KI-Suchserver mehr als ein privater Google-Ersatz werden kann. Er kann zu einer ständig verfügbaren Rechercheebene über das öffentliche Web und die eigenen Daten werden.

Weitere selbst gehostete KI-Suchtools, die man im Blick behalten sollte

Farfalle bleibt als Open-Source-KI-Suchprojekt mit SearXNG, Ollama, LiteLLM und agentenorientierter Suchunterstützung beobachtenswert. Es überschneidet sich stark mit Vane und Morphic, weshalb es keinen der primären Top-10-Plätze erhalten hat.

Zunehmend gibt es auch spezialisierte Tools für die akademische Suche, Codesuche, Unternehmenskonnektoren, Vektorsuche und Arbeitsbereiche im Stil von NotebookLM. Die Kategorie wächst so schnell, dass „beste KI-Suchmaschine“ immer weniger hilfreich wird, als zu fragen, welches Abrufproblem Sie tatsächlich lösen müssen.

Abschließendes Urteil

Wählen Sie Vane, wenn Sie das direkteste selbst gehostete Sucherlebnis im Stil von Perplexity mit SearXNG und Ollama wünschen.

Wählen Sie Morphic, wenn Ihnen eine umfangreichere generative Suchoberfläche und eine anwendungsähnlichere Bereitstellung wichtig sind.

Wählen Sie Onyx, wenn sich das eigentliche Suchziel auf Unternehmenswissen erstreckt, das über viele Tools und Repositorien verteilt ist.

Wählen Sie Khoj, wenn Sie eine persönliche Suchschicht über privaten Dateien und dem Web wünschen.

Wählen Sie SurfSense, wenn die Suche Teil eines umfassenderen Workflows für Recherche, Notizen, Konnektoren und Automatisierung ist.

Wählen Sie Open WebUI, wenn Sie bereits einen lokalen KI-Stack auf Ollama-Basis haben und einfach Websuche und lokale RAG-Funktionen zu der bereits verwendeten Oberfläche hinzufügen möchten.

Wählen Sie Local Deep Researcher, wenn die Aufgabe wiederholte Suchen, Reflexion und das Sammeln von Belegen statt einer schnellen Einzelantwort erfordert.

Wählen Sie RAGFlow, wenn das private Parsen und Einlesen von Dokumenten, die Qualität des Abrufs und RAG im größeren Maßstab wichtiger sind als die Benutzerfreundlichkeit der Websuche.

Wählen Sie AnythingLLM für den einfachsten Einstieg in die private Dokumentensuche mit lokalen Modellen, lokalen Embeddings und integrierter RAG-Funktion.

Wählen Sie SearXNG, wenn Sie das Backend für die Websuche selbst betreiben und diese Suchschicht in mehrere lokale KI-Anwendungen einspeisen möchten.

Der nützlichste selbst gehostete KI-Such-Stack ist daher nicht unbedingt eine einzelne Anwendung. Häufig handelt es sich um ein modulares System, in dem sich Suche, Abruf, Inferenz, privater Speicher und Zitate unabhängig voneinander weiterentwickeln können.

FAQ

Was ist 2026 die beste selbst gehostete KI-Suchmaschine?

Vane ist eine der insgesamt stärksten Optionen für eine selbst gehostete Antwortmaschine im Stil von Perplexity, da es zitierte Webantworten, SearXNG, die Bereitstellung mit Docker und lokale Inferenz über Ollama kombiniert. Morphic ist eine starke Alternative, wenn die Suchoberfläche und die generative Benutzeroberfläche wichtiger sind.

Was ist die beste Open-Source-Alternative zu Perplexity?

Vane und Morphic gehören zu den ähnlichsten Open-Source-Alternativen für das Self-Hosting. Vane konzentriert sich mit SearXNG und lokalen Modellen auf datenschutzorientierte Antworten, während Morphic den Schwerpunkt auf generative Benutzeroberflächen und flexible Suchanbieter legt.

Ist Perplexica noch aktiv?

Das zuvor als Perplexica bekannte Projekt wurde als Vane weitergeführt. Nutzer, die nach der aktuellen Version suchen, sollten Vane prüfen, statt sich auf ältere Installationsanleitungen für Perplexica zu verlassen.

Kann ich die KI-Websuche vollständig offline ausführen?

Nein, nicht wenn Sie aktuelle Informationen aus dem Live-Web benötigen. Sie können das KI-Modell, die Anwendung, den Verlauf und die Suchorchestrierung lokal halten, aber ein Websuch-Backend benötigt weiterhin Internetzugang, um aktuelle Seiten oder Suchmaschinenergebnisse abzurufen. Eine vollständig Offline-Suche ist nur über bereits lokal gespeicherte Daten möglich.

Kann ich SearXNG mit Ollama verwenden?

Ja. SearXNG liefert Suchergebnisse, während Ollama die lokale LLM-Inferenz übernimmt. Anwendungen wie Vane, Morphic, Open WebUI und Local Deep Researcher können zwischen ihnen angesiedelt werden und Suchergebnisse in KI-generierte Antworten umwandeln.

Welches selbst gehostete KI-Suchtool ist am besten für private Dokumente geeignet?

AnythingLLM ist eine der benutzerfreundlichsten Optionen für lokale Dokumentenfragen und -antworten. RAGFlow eignet sich besser für komplexe Datenaufnahme und größere RAG-Systeme, während Onyx stärker ist, wenn Dokumente über viele organisationsweite Anwendungen verteilt sind.

Welches selbst gehostete KI-Suchtool ist am besten für ein Team geeignet?

Onyx eignet sich auf dieser Liste am besten für die unternehmensweite Suche, da es Konnektoren, hybrides Retrieval, RAG, Websuche, Agents und teamorientierte Governance kombiniert. SurfSense ist eine weitere gute Option, wenn der Workflow stärker auf Recherche ausgerichtet ist.

Was ist der Unterschied zwischen KI-Suche und RAG?

KI-Suche ist die umfassendere Nutzererfahrung des Abrufens von Informationen und Generierens einer Antwort. RAG ist eine Retrieval-Architektur, mit der ein LLM durch relevanten externen Kontext fundiert werden kann. Ein selbst gehostetes KI-Suchtool kann RAG für private Dokumente, die Live-Websuche für aktuelle Informationen oder beides verwenden.

Benötige ich eine Vektordatenbank für eine selbst gehostete KI-Suche?

Nicht für die gewöhnliche Live-Websuche. Vektordatenbanken werden nützlich, wenn Sie eine semantische Suche über private Dokumente, Notizen, Repositories oder anderes dauerhaft gespeichertes Wissen benötigen. Tools wie AnythingLLM, RAGFlow, Onyx und Khoj verwenden Retrieval-Ebenen, die über die herkömmliche Websuche hinausgehen.

Was ist der Unterschied zwischen Vane und SearXNG?

SearXNG ist ein Metasuch-Backend, das Suchergebnisse liefert. Vane ist eine KI-Antwort-Engine, die SearXNG zum Abrufen von Ergebnissen verwenden kann und anschließend ein LLM nutzt, um diese Ergebnisse zu einer Antwort mit Quellenangaben zusammenzufassen.

Kann die selbst gehostete KI-Suche sowohl lokale als auch Cloud-Modelle verwenden?

Ja. Viele Tools auf dieser Liste unterstützen beides. Dies ermöglicht eine hybride Architektur, bei der Routineabfragen lokal über Ollama ausgeführt werden, während anspruchsvolle Rechercheaufgaben bei Bedarf an ein gehostetes Modell weitergeleitet werden können.

Was sollte ich zuerst selbst hosten: das KI-Modell oder die Suchmaschine?

Wenn der Schutz privater Dokumente das Hauptanliegen ist, beginnen Sie mit dem Modell, den Embeddings und dem Dokumentindex. Wenn der Schutz von Webanfragen das Hauptanliegen ist, beginnen Sie mit einem selbst gehosteten Such-Backend wie SearXNG. Für die stärkste Kontrolle hosten Sie beide Ebenen selbst.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.