I 10 migliori strumenti di ricerca AI self-hosted nel 2026

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

La ricerca AI self-hosted non significa più soltanto “eseguire un clone di Perplexity su Docker”. Nel 2026, la categoria comprende ormai motori di risposta sul web, ricerca di documenti privati, agenti di ricerca approfondita, ricerca nella knowledge base aziendale e backend di ricerca locali.

La scelta giusta dipende da ciò che vuoi davvero mantenere sotto il tuo controllo: la query di ricerca, il modello, i tuoi file, gli embedding, l’indice di ricerca o l’intera pipeline di recupero. Questi 10 strumenti coprono i principali modi per creare autonomamente questo stack.

Che cosa significa davvero “ricerca AI self-hosted”?

Uno strumento di ricerca AI self-hosted può indicare diverse cose.

Tipo di ricerca Cosa cerca Architettura tipica
Motore di risposta sul web Il web in tempo reale Backend di ricerca + LLM + citazioni
Ricerca nella knowledge base privata Documenti, note, unità di archiviazione, app Acquisizione + embedding + recupero + LLM
Agente di ricerca approfondita Più ricerche sul web nel tempo Cerca → rifletti → cerca di nuovo → sintetizza
Backend di ricerca Più motori di ricerca convenzionali API di metaricerca che alimenta un livello AI

La distinzione è importante perché eseguire l’interfaccia web sul proprio server non rende automaticamente privato l’intero flusso di lavoro della ricerca.

Puoi eseguire il frontend in modalità self-hosted e continuare a inviare le query a un LLM commerciale e a un’API di ricerca ospitata:

Browser
   |
Interfaccia di ricerca self-hosted
   |
   +--- LLM cloud
   |
   +--- API di ricerca ospitata

Oppure puoi spostare quasi tutto lo stack sulla tua infrastruttura:

Browser
   |
Ricerca AI self-hosted
   |
   +--- SearXNG
   +--- Ollama
   +--- Embedding locali
   +--- Indice di ricerca locale
   +--- File privati

È proprio questa seconda architettura a rendere particolarmente rilevante la ricerca AI self-hosted per una knowledge base locale. La ricerca non riguarda più soltanto trovare pagine su Internet; può anche diventare il livello di recupero per documenti, archivi di ricerca, file di progetto e dati operativi privati.

Come abbiamo classificato i migliori strumenti di ricerca AI self-hosted

Non è una classifica basata sulle stelle di GitHub e questi strumenti non risolvono tutti lo stesso problema di ricerca.

La classifica si concentra su sette fattori pratici: quanto completamente lo stack può essere eseguito in modalità self-hosted, la qualità dell’architettura di ricerca e recupero, il supporto per i modelli locali, le citazioni e l’ancoraggio alle fonti, la ricerca nei dati privati, la difficoltà di distribuzione e l’attualità del progetto nel 2026.

Distinguiamo inoltre tra “self-hosted” e “completamente locale”. Uno strumento può essere installato sul tuo server e continuare a utilizzare OpenAI, Anthropic, Tavily, Brave, Exa o un altro provider esterno. Può essere comunque utile, ma si tratta di un modello di privacy diverso rispetto a Ollama + embedding locali + un backend di ricerca self-hosted.

I 10 migliori strumenti di ricerca AI self-hosted a colpo d’occhio

Classifica Strumento Tipo di ricerca Ricerca sul web File privati Modello linguistico locale Ideale per
1 Vane Motore di risposta sul web Ollama Ricerca in stile Perplexity self-hosted
2 Morphic Motore di risposta sul web Ollama Interfaccia utente di ricerca generativa
3 Onyx Ricerca della conoscenza aziendale Ollama, LiteLLM, vLLM Ricerca per team e aziende
4 Khoj Conoscenza personale + ricerca web API locali / compatibili Secondo cervello personale
5 SurfSense Workspace di ricerca Ollama, LM Studio Flussi di ricerca connessi
6 Open WebUI Workspace IA + ricerca Ollama Aggiungere la ricerca a un'interfaccia IA locale esistente
7 Ricercatore locale approfondito Agente di ricerca approfondita Limitato Ollama, LM Studio Ricerca locale iterativa
8 RAGFlow Ricerca di documenti / RAG Secondario Opzioni per modelli self-hosted Ricerca complessa di documenti privati
9 AnythingLLM Ricerca nei documenti privati Secondario Ollama, LM Studio, LocalAI Q&A semplice sui documenti locali
10 SearXNG Backend per la metaricerca No Non applicabile Backend di ricerca privato per l'IA locale

1. Vane — Il miglior motore di ricerca IA self-hosted in assoluto

Anteprima

Vane, precedentemente noto come Perplexica, è una delle risposte più dirette alla domanda «Cosa posso eseguire in modalità self-hosted al posto di Perplexity?»

Combina un backend di ricerca con un livello di risposta basato su LLM e restituisce risposte fondate su fonti citate. Il progetto attuale supporta l'inferenza locale tramite Ollama, oltre a provider ospitati tra cui OpenAI, Anthropic Claude, Google Gemini e Groq.

Il suo livello di ricerca è basato su SearXNG, il che significa che Vane non deve dipendere da una singola API di ricerca commerciale. L'immagine Docker consigliata può persino includere SearXNG insieme all'applicazione, mentre una distribuzione più leggera può collegarsi a un'istanza SearXNG esistente altrove nella rete.

Vane separa inoltre il comportamento di ricerca in modalità per la velocità, l'uso bilanciato e la ricerca più approfondita. Può cercare risultati web generici, discussioni e fonti accademiche, invece di trattare ogni query allo stesso modo.

Domanda dell'utente
     |
     v
    Vane
     |
 +---+----+
 |        |
SearXNG  Ollama
 |        |
Web      LLM locale
 +---+----+
     |
Risposta con citazioni

Ecco perché Vane si classifica al primo posto: si adatta perfettamente al classico caso d'uso della ricerca basata sull'IA, offrendo al contempo agli utenti self-hosted il controllo sia sulla ricerca sia sull'inferenza.

Ideale per: utenti che desiderano un motore di risposta privato e self-hosted in stile Perplexity, con citazioni e supporto per Ollama.

Compromesso: la ricerca web richiede comunque l'accesso a Internet in uscita e l'utilizzo di provider LLM cloud modifica il modello di privacy, anche se l'applicazione Vane è in esecuzione localmente.

2. Morphic — Il miglior motore di ricerca IA self-hosted per la UI generativa

Morphic si sovrappone a Vane a livello superficiale: entrambi possono combinare la ricerca web con risposte generate da LLM, citazioni, distribuzione tramite Docker, Ollama e SearXNG.

La differenza sta nella presentazione e nell'interazione.

Morphic si descrive come un motore di ricerca basato sull'IA con una UI generativa. Invece di limitare ogni risposta al semplice markdown, l'interfaccia può trasmettere componenti più ricchi, come sezioni con immagini, griglie, titoli e altri blocchi di risultati strutturati.

Il suo attuale livello di ricerca supporta SearXNG, Tavily, Brave ed Exa. La selezione dei modelli può utilizzare OpenAI, Anthropic, Google, Ollama, Vercel AI Gateway o provider compatibili con OpenAI.

La configurazione Docker è eccezionalmente comoda, perché Docker Compose può avviare insieme Morphic, PostgreSQL, Redis e SearXNG. Questo lo rende una delle scelte migliori per chi vuole un'applicazione di ricerca locale completa senza dover assemblare manualmente ogni servizio.

Ideale per: utenti che desiderano un'esperienza di ricerca curata in stile Perplexity, con interfacce generate più ricche e provider di ricerca flessibili.

Compromesso: lo stack è più pesante di una configurazione Vane minimale, perché l'esperienza completa include PostgreSQL, Redis, autenticazione, cronologia e servizi applicativi aggiuntivi.

3. Onyx — Migliore ricerca self-hosted con IA per i team e la conoscenza aziendale

Dimostrazione silenziosa della chat di Onyx

Onyx appartiene a una categoria diversa da Vane e Morphic.

La sua domanda centrale non è «Che cosa dice il web?». È:

«Che cosa sa già la nostra organizzazione?»

Onyx combina recupero ibrido, RAG, ricerca approfondita, agenti, ricerca sul web e un ampio ecosistema di connettori. Può indicizzare informazioni provenienti da applicazioni e repository interni, cercando anche sul web in tempo reale quando necessario.

Il progetto supporta più di 50 connettori per l'indicizzazione e può collegarsi a strumenti come Slack, Google Drive, GitHub, Jira, Confluence e altri sistemi per team. La Community Edition include le funzionalità principali di chat, RAG, agenti e azioni, mentre le organizzazioni più grandi possono aggiungere funzioni aziendali per identità e governance.

Supporta anche infrastrutture self-hosted per i modelli, come Ollama, LiteLLM e vLLM, invece di obbligare a far passare tutti i risultati della ricerca attraverso un unico LLM ospitato.

Slack -------\
Drive --------\
GitHub --------> Onyx ----> Ricerca / RAG / Ricerca approfondita
Confluence ---/
Web ----------/

È molto più vicino a un livello di ricerca self-hosted in stile Glean che a un semplice clone di Perplexity.

Ideale per: team che vogliono un unico livello di ricerca e risposta tra documenti aziendali, app, repository e web.

Compromesso: Onyx è significativamente più completo di quanto serva a un singolo utente se l'unico obiettivo è la ricerca privata sul web.

4. Khoj — Migliore ricerca personale con IA per il web e i file privati

Chat dimostrativa

Khoj occupa, per uso personale, lo spazio a cui Onyx si rivolge nelle organizzazioni.

Combina documenti privati, informazioni dal web, ricerca semantica, agenti e conoscenze personali in un ambiente in stile “secondo cervello” che può essere ospitato autonomamente.

L'architettura di ricerca è più sofisticata di una semplice ricerca vettoriale. La documentazione di Khoj descrive un flusso di recupero in due fasi, in cui un bi-encoder recupera i documenti candidati e un cross-encoder più lento li riordina in base alla query corrente.

Questo è importante perché una buona ricerca IA non consiste solo nel generare embedding. La qualità del recupero dipende dalla capacità di trovare un numero sufficiente di candidati e poi classificare le evidenze più pertinenti prima che l'LLM le visualizzi.

Khoj può utilizzare modelli di ricerca locali ed endpoint compatibili con OpenAI, incluse configurazioni compatibili con Ollama, il che lo rende adatto a un sistema personale e privato per la gestione della conoscenza.

Ideale per: chi desidera cercare note, file, documenti e contenuti web da un unico spazio di lavoro IA personale e self-hosted.

Compromesso: è progettato più per la conoscenza personale e i flussi di lavoro con assistenti che per l'indicizzazione e la gestione delle autorizzazioni a livello aziendale.

5. SurfSense — Il miglior spazio di lavoro IA self-hosted per la ricerca

Chatta con PDF e documenti

SurfSense è più correttamente inteso come uno spazio di lavoro connesso per la ricerca, piuttosto che come un altro campo di ricerca.

La piattaforma self-hosted può collegare fonti informative, creare una base di conoscenza consultabile e supportare flussi di lavoro per ricerca, note, automazioni e agenti. La documentazione attuale include connettori per servizi come Notion, Slack, Google, Jira e altre fonti di conoscenza esterne.

Documenta inoltre le connessioni ai modelli locali tramite Ollama e LM Studio, consentendo di mantenere sotto il controllo dell'utente sia il livello applicativo sia quello di inferenza.

Questo rende SurfSense particolarmente interessante quando la “ricerca” è solo un passaggio di un flusso di lavoro più lungo:

Raccogli fonti
      |
Indicizza la conoscenza
      |
Cerca / Chiedi
      |
Genera note
      |
Esegui l'automazione
      |
Continua la ricerca

Ideale per: ricercatori e team che lavorano intensamente con la conoscenza e desiderano ricerca, fonti collegate, note e automazione in un unico spazio di lavoro self-hosted.

Compromesso: se vuoi solo risposte web rapide con citazioni, Vane o Morphic sono più semplici e mirati.

6. Open WebUI — Il modo migliore per aggiungere la ricerca a uno stack IA locale esistente

Apri la demo di WebUI

Open WebUI non è principalmente un motore di ricerca, e questa distinzione dovrebbe essere esplicita.

Il suo punto di forza è che molti utenti di IA locale lo usano già come interfaccia davanti a Ollama o ad altri server di modelli. Per questi utenti, aggiungere la ricerca all'interno dell'area di lavoro IA esistente può essere più pratico che implementare un'applicazione di ricerca separata.

Attualmente Open WebUI supporta la ricerca web tramite un'ampia gamma di provider, tra cui SearXNG, Brave, DuckDuckGo, Tavily, Exa, Kagi, Perplexity, Jina, Bing e diversi altri motori.

La sua guida ufficiale all'integrazione con SearXNG mostra come un container SearXNG locale separato possa diventare il livello di ricerca per Open WebUI.

La stessa applicazione supporta anche il RAG locale sui documenti caricati e sulle raccolte di documenti, così l'utente può combinare il recupero dal Web e quello da file privati all'interno di un'unica interfaccia.

Ideale per: utenti che eseguono già Ollama + Open WebUI e vogliono aggiungere la ricerca web self-hosted senza passare a un motore di risposte dedicato.

Compromesso: poiché Open WebUI è un ambiente di lavoro IA generico, il comportamento della ricerca dipende fortemente dalla gestione delle chiamate agli strumenti da parte del modello, dalle dimensioni del contesto, dalle impostazioni di recupero e dalla configurazione del provider di ricerca selezionato.

7. Local Deep Researcher — Il miglior agente di ricerca approfondita completamente locale

截图 2025-01-24 晚上10:08:31

Local Deep Researcher mostra in quale direzione si sta evolvendo la ricerca basata sull'IA oltre i motori di risposta a query singola.

Il progetto utilizza un LLM locale tramite Ollama o LM Studio per generare una query di ricerca, raccogliere risultati web, sintetizzarli, individuare le lacune informative rimanenti, creare un'altra query e ripetere il ciclo prima di generare un rapporto finale con citazioni.

Domanda
   |
Genera ricerca
   |
Cerca sul Web
   |
Riassumi
   |
Trova le lacune informative
   |
Cerca di nuovo
   |
Ripeti
   |
Rapporto finale con citazioni

La ricerca può utilizzare DuckDuckGo per impostazione predefinita, con integrazioni opzionali per SearXNG, Tavily o Perplexity.

Questo lo rende diverso da Vane o Morphic. Questi strumenti sono ottimizzati per la ricerca interattiva e l'esperienza utente delle risposte. Local Deep Researcher è ottimizzato per l'indagine iterativa.

Ideale per: domande di ricerca per le quali una sola ricerca difficilmente farà emergere prove sufficienti e l'agente dovrebbe cercare deliberatamente di nuovo dopo aver individuato le lacune.

Compromesso: i cicli ripetuti di ricerca e riepilogo sono più lenti e richiedono più risorse di calcolo rispetto a un normale motore di risposte, soprattutto quando l'LLM viene eseguito localmente.

8. RAGFlow — Il migliore per la ricerca complessa di documenti privati

RAGFlow non cerca principalmente di competere con Perplexity.

È una piattaforma di recupero dati che trasforma dati privati complessi in un contesto affidabile per gli LLM.

Il progetto attuale combina RAG end-to-end con analisi dei documenti, pipeline di acquisizione orchestrate, flussi di lavoro per agenti, supporto MCP e sincronizzazione dei dati da fonti come Confluence, S3, Notion, Discord e Google Drive.

Questo lo rende più adatto a domande come:

“Come posso cercare migliaia di PDF, file di Office, documenti interni e fonti di conoscenza collegate con un recupero affidabile?”

invece di:

“Che cosa è successo oggi sul web?”

RAGFlow continua inoltre a evolversi come livello di contesto per gli agenti. Nel 2026 ha aggiunto una skill ufficiale per accedere ai dataset di RAGFlow tramite OpenClaw, mostrando come la ricerca nei documenti stia passando da una chat RAG isolata a un'infrastruttura riutilizzabile per gli agenti.

Per un'analisi più approfondita di questo livello, la guida di ZimaSpace a ricerca nei documenti e RAG suddivide il flusso di lavoro in estrazione, suddivisione in chunk, embedding, ricerca vettoriale, reranking e generazione di risposte basate sulle prove.

Ideale per: raccolte di documenti più grandi e team che necessitano di processi seri di acquisizione, analisi, recupero e gestione della conoscenza.

Compromesso: RAGFlow è molto più pesante di una semplice applicazione locale per chattare con i documenti ed è eccessivo se la tua knowledge base contiene solo alcune cartelle.

9. AnythingLLM — La migliore ricerca self-hosted semplice per documenti privati

Chat

AnythingLLM si colloca sul versante più accessibile della ricerca privata basata sull'IA.

Può acquisire documenti, creare spazi di lavoro, generare embedding, recuperare il contesto pertinente, mostrare citazioni delle fonti e connettersi a modelli locali o cloud senza richiedere agli utenti di assemblare uno stack RAG partendo da componenti separati.

Il supporto ai modelli locali include Ollama, LM Studio, LocalAI e i modelli compatibili con llama.cpp. Anche il livello di embedding può rimanere locale e il progetto supporta diversi database vettoriali, tra cui LanceDB, Chroma, Qdrant, Weaviate, Milvus e PGVector.

I termini sulla privacy self-hosted di AnythingLLM sono insolitamente espliciti: documenti, cronologie, impostazioni degli spazi di lavoro ed embedding rimangono sull'infrastruttura gestita dall'utente e l'applicazione può funzionare in modalità air-gapped quando vengono selezionati componenti locali per i modelli e i vettori.

Questo lo rende un ponte naturale tra “chattare con i miei documenti” e un flusso di lavoro di IA locale più completo.

Ideale per: utenti che desiderano una semplice applicazione locale per la ricerca nei documenti e il RAG, senza dover gestire una piattaforma di recupero più complessa.

Compromesso: è più semplice da implementare rispetto a RAGFlow o Onyx, ma questa semplicità significa anche che non è la scelta più indicata per l’indicizzazione a livello organizzativo o per un’orchestrazione avanzata della ricerca.

10. SearXNG — Il miglior backend di ricerca privato per l’IA locale

SearXNG - Wikipedia

SearXNG è l’eccezione perché non è un motore di risposta IA.

È un motore di metaricerca self-hosted che aggrega i risultati di ben 272 servizi di ricerca, evitando al contempo il tracciamento e la profilazione degli utenti.

Questo lo rende uno dei componenti infrastrutturali più importanti dell’ecosistema della ricerca IA self-hosted.

Vane può usare SearXNG. Morphic può usare SearXNG. Open WebUI può usare SearXNG. Local Deep Researcher può usare SearXNG.

Il suo ruolo è semplice:

Richiesta dell’utente
    |
SearXNG
    |
Risultati grezzi della ricerca
    |
Modello linguistico locale
    |
Risposta IA con citazioni

Il self-hosting del backend di ricerca separa il livello di recupero da quello delle risposte. Puoi cambiare i modelli linguistici senza cambiare il motore di ricerca, oppure cambiare le applicazioni di risposta mantenendo la stessa infrastruttura di ricerca.

Ideale per: utenti che desiderano un backend di metaricerca privato, simile a Google, in grado di alimentare Vane, Open WebUI, Morphic, agenti di ricerca o applicazioni IA locali personalizzate.

Compromesso: SearXNG non riassume, non ragiona e non genera autonomamente risposte con citazioni. Se vuoi un’esperienza in stile Perplexity, hai bisogno di un livello IA sopra di esso.

Quale strumento di ricerca IA self-hosted dovresti scegliere?

Se vuoi... Inizia con Perché
Un’alternativa privata a Perplexity Vane Motore di risposta web self-hosted mirato, con SearXNG e Ollama
Un’interfaccia di ricerca generativa più ricca Morphic Interfaccia generativa e provider di ricerca flessibili
Ricerca nella conoscenza del team Onyx Ampio ecosistema di connettori, oltre a ricerca ibrida e RAG
Cerca nei file personali e sul web Khoj Ricerca nella conoscenza personale con recupero locale
Un ambiente di ricerca connesso SurfSense Ricerca, fonti, note, connettori e automazioni
Aggiungi la ricerca a uno stack di chat Ollama Open WebUI Ricerca integrabile all’interno di una familiare interfaccia IA locale
Indagine web in più passaggi Ricercatore locale approfondito Cerca, riflette, individua le lacune e cerca di nuovo
Recupero complesso di documenti aziendali RAGFlow Architettura avanzata per l’acquisizione dei dati e il RAG
Domande e risposte semplici sui documenti privati AnythingLLM Applicazione local-first con pipeline integrate per i documenti e archivi vettoriali
Backend di ricerca privato SearXNG Livello di metaricerca riutilizzabile per molte applicazioni IA

Vane vs Morphic: qual è la migliore alternativa self-hosted a Perplexity?

Vane e Morphic sono le due scelte più dirette se il tuo modello mentale è: «Voglio Perplexity, ma sul mio server».

Area Vane Morphic
Obiettivo principale Motore di risposta IA incentrato sulla privacy Ricerca IA con interfaccia generativa
SearXNG Percorso di ricerca principale Supportati e inclusi in Docker Compose
Ollama
Modelli cloud
File
Citazioni
Modalità di ricerca Velocità, equilibrio, qualità Rapido, adattivo
Ideale per Motore di risposte private focalizzato Esperienza di ricerca e presentazione dei risultati più ricca

Scegli Vane quando la priorità è un motore di risposte private focalizzato, con un'architettura SearXNG + Ollama semplice.

Scegli Morphic quando l'interfaccia di ricerca è importante e desideri componenti dei risultati generativi più ricchi, cronologia, autenticazione e un'esperienza più simile a un'applicazione.

Onyx vs Khoj vs AnythingLLM per la ricerca nella conoscenza privata

Tutti e tre possono cercare informazioni private, ma sono destinati a implementazioni molto diverse.

Area Onyx Khoj AnythingLLM
Utente principale Team / organizzazione Singolo utente Singolo utente o piccolo team
App collegate Ampio ecosistema di connettori Fonti di conoscenza personali Orientato a documenti/spazi di lavoro
Ricerca web Eccellente Disponibile Secondaria rispetto alla ricerca nei documenti
Profondità del recupero Ricerca ibrida + RAG agentico Bi-encoder + riordinamento Pipeline RAG integrata
Modelli locali
Ideale per Conoscenza aziendale Secondo cervello personale Domande e risposte semplici sui documenti privati

Scegli Onyx quando le informazioni sono distribuite tra molte applicazioni del team e le autorizzazioni sono importanti.

Scegli Khoj quando la conoscenza appartiene principalmente a una sola persona e l'obiettivo è creare una memoria privata ricercabile e un ambiente di ricerca.

Scegli AnythingLLM quando la priorità è avviare rapidamente un flusso di lavoro per la ricerca nei documenti locali con il minimo intervento infrastrutturale.

Ricerca web vs ricerca nella conoscenza privata

Uno degli errori più comuni in questa categoria è considerare intercambiabili la ricerca web e il RAG privato.

Risolvono problemi di recupero diversi.

Domanda Miglior livello di recupero
Che cosa è successo oggi? Ricerca web in tempo reale
Che cosa dice la nostra politica interna? Ricerca nei documenti privati
Che cosa è cambiato in questo progetto? Ricerca nelle app / nei repository connessi
Che cosa dice la ricerca più recente? Ricerca approfondita + ricerca sul web / accademica
Che cosa ho scritto su questo sei mesi fa? Ricerca nella conoscenza personale

Uno stack di ricerca AI maturo combina sempre più spesso entrambi:

               Web
                \
File privati ----> Livello di recupero ----> LLM ----> Risposta con citazioni
                /
App connesse

Per questo prodotti come Onyx, Khoj, SurfSense e Open WebUI stanno diventando più ampi delle tradizionali applicazioni RAG.

Quali strumenti di ricerca AI self-hosted possono funzionare con Ollama?

Diversi strumenti di questo elenco possono spostare il livello di inferenza dell'LLM su Ollama o su un altro server di modelli locali.

Strumento Percorso del modello locale Stack di ricerca locale tipico
Vane Ollama Vane + SearXNG + Ollama
Morphic Ollama / provider compatibili Morphic + SearXNG + Ollama
Onyx Ollama, LiteLLM, vLLM Onyx + connettori + modello locale
Khoj Endpoint locali / compatibili con OpenAI Khoj + recupero locale + modello locale
SurfSense Ollama, LM Studio SurfSense + connettori + modello locale
Open WebUI Ollama Open WebUI + SearXNG + Ollama
Ricercatore locale approfondito Ollama, LM Studio Agente di ricerca + backend di ricerca + modello locale
AnythingLLM Ollama, LM Studio, LocalAI AnythingLLM + embedding locali + database vettoriale locale

La precisazione importante è che l'inferenza locale non rende offline la ricerca web in tempo reale.

Uno stack come:

Vane
 |
SearXNG
 |
Ollama

può mantenere LLM, orchestrazione della ricerca, cronologia e dati dell'applicazione sul tuo hardware, ma SearXNG deve comunque raggiungere servizi di ricerca esterni quando chiedi informazioni su Internet in tempo reale.

Una configurazione completamente isolata dalla rete funziona solo per le conoscenze già archiviate localmente; è qui che AnythingLLM, RAGFlow, Khoj e altri sistemi per documenti privati diventano più rilevanti.

Come creare uno stack di ricerca IA self-hosted con SearXNG e Ollama

Per un homelab, una delle architetture più ordinate consiste nel separare ricerca, inferenza e archiviazione:

Browser
   |
App di ricerca IA
Vane / Morphic / Open WebUI
   |
+--+-------------------+
|                      |
SearXNG              Ollama
|                      |
Web in tempo reale             LLM locale
|
Internet

Archiviazione privata
PDF / Note / Documenti / Cache / Indici

Questa separazione offre flessibilità. Puoi sostituire Vane con Morphic senza sostituire SearXNG. Puoi aggiornare il modello in esecuzione su Ollama senza ricostruire l'applicazione di ricerca. Puoi mantenere l'archivio dei documenti e gli indici nell'archiviazione persistente anche quando cambiano i container dell'applicazione.

Questa architettura si adatta naturalmente a un homelab IA locale, in cui l'archiviazione, i servizi Docker, gli indici di ricerca, i database vettoriali e i runtime dei modelli possono risiedere sullo stesso server oppure essere separati nella LAN.

Un server leggero può ospitare continuamente ricerca e recupero, mentre una macchina GPU più potente esegue l'LLM:

Server sempre acceso            Workstation GPU
      |                           |
 App di ricerca IA                  Ollama
 SearXNG                         vLLM
 Database vettoriale                        |
 Documenti  <------ LAN ---------+

Questa soluzione può essere più pratica che costringere ogni servizio a funzionare su un unico dispositivo sovradimensionato.

Di quanto hardware ha bisogno la ricerca IA self-hosted?

L'applicazione di ricerca in sé non è solitamente la parte più impegnativa dello stack.

L'utilizzo delle risorse deriva da diversi livelli:

Livello Risorsa principale Perché è importante
Ricerca web Rete + CPU Interroga e analizza più fonti esterne
Inferenza LLM RAM / VRAM Genera risposte e riepiloghi delle ricerche
Embedding CPU / GPU + RAM Indicizza documenti privati
Database vettoriale RAM + archiviazione Archivia e cerca gli embedding
Analisi dei documenti CPU + archiviazione Elabora PDF, file di Office, OCR e metadati
Cronologia / cache delle ricerche Archiviazione Conserva conversazioni, risultati e stato della ricerca

Una configurazione semplice con Vane + SearXNG può funzionare con un hardware molto meno potente rispetto a un'implementazione di RAGFlow di grandi dimensioni che indicizza milioni di frammenti di documenti.

Il modello è solitamente la variabile più importante. Se utilizzi un modello ospitato, il server di ricerca può rimanere relativamente leggero. Se Ollama esegue localmente un modello di ragionamento più grande, i requisiti di RAM e accelerazione aumentano rapidamente.

Le indicazioni attuali di AnythingLLM illustrano bene questa distinzione: l’applicazione può essere leggera, mentre un’esperienza migliore con modelli locali beneficia di più memoria e capacità GPU. Lo stesso principio si applica alla maggior parte degli strumenti di questo elenco.

Self-hosted non significa automaticamente privato

Questo è il controllo della privacy più importante dell’intera categoria.

Eseguire l’applicazione in Docker è solo un livello.

Livello Domanda da porsi
Backend di ricerca Chi riceve la query Web?
LLM Dove vengono elaborati i prompt e i passaggi recuperati?
Embedding Il testo dei documenti lascia il server durante l’indicizzazione?
Database vettoriale Dove sono archiviati gli indici semantici?
App collegate A quali servizi esterni può accedere la piattaforma di ricerca?
Telemetria Quali informazioni sull’utilizzo escono dall’istanza?
Cronologia delle ricerche Dove vengono archiviati le query e le risposte generate?

Per la ricerca nei documenti privati, il livello degli embedding è particolarmente facile da trascurare.

Un flusso di lavoro può usare un LLM locale, ma inviare comunque ogni blocco di un PDF privato a un’API cloud per gli embedding. Non equivale a uno stack RAG completamente locale.

Se l’obiettivo è la privacy, esamina l’intero percorso:

Documento
   |
Parser
   |
Modello di embedding
   |
Database vettoriale
   |
Recuperatore
   |
LLM
   |
Rispondi

La guida di ZimaSpace sulle basi di conoscenza locali spiega più in dettaglio perché spazio di archiviazione, embedding, ricerca vettoriale e regole sulle prove sono tutti importanti quando l’obiettivo è una ricerca privata a lungo termine anziché una conversazione occasionale sui file.

La ricerca basata sull’IA sta diventando ricerca approfondita

Il cambiamento più importante del 2026 è che la ricerca sta diventando iterativa.

Il vecchio flusso di ricerca basata sull’IA era:

Domanda
   |
Cerca una volta
   |
Riassumi
   |
Rispondi

Il nuovo flusso di ricerca assomiglia sempre più a questo:

Domanda
   |
Cerca
   |
Leggi
   |
Individua le prove mancanti
   |
Cerca di nuovo
   |
Confronta le fonti
   |
Affina la domanda
   |
Cerca di nuovo
   |
Sintetizza
   |
Report con citazioni

Local Deep Researcher rende esplicito questo approccio, ma la stessa direzione è visibile nella ricerca approfondita di Onyx, in spazi di lavoro orientati alla ricerca come SurfSense e nelle modalità “qualità” o adattive che stanno comparendo nei moderni motori di risposta.

Questo cambiamento è importante per il self-hosting perché la ricerca approfondita richiede più risorse della ricerca ordinaria. Genera più richieste di ricerca, più testo recuperato, contesti più lunghi, più chiamate ai modelli e uno stato di ricerca più ampio.

Il vantaggio è che un server locale di ricerca basata sull’IA può diventare più di un sostituto privato di Google. Può diventare un livello di ricerca sempre attivo sia sul Web pubblico sia sui propri dati.

Altri strumenti di ricerca basata sull’IA self-hosted da tenere d’occhio

Farfalle continua a meritare attenzione come progetto open source di ricerca basata sull’IA con SearXNG, Ollama, LiteLLM e supporto alla ricerca orientata agli agenti. Si sovrappone in larga misura a Vane e Morphic, motivo per cui non ha ottenuto un posto tra i primi 10.

Esistono inoltre strumenti sempre più specializzati per la ricerca accademica, la ricerca nel codice, i connettori aziendali, la ricerca vettoriale e gli ambienti di lavoro in stile NotebookLM. La categoria si sta ampliando così rapidamente che “miglior motore di ricerca AI” è un’espressione sempre meno utile rispetto alla domanda su quale problema di recupero sia effettivamente necessario risolvere.

Verdetto finale

Scegli Vane se vuoi l’esperienza di ricerca self-hosted in stile Perplexity più diretta, con SearXNG e Ollama.

Scegli Morphic se ti interessa un’interfaccia di ricerca generativa più ricca e una distribuzione più simile a un’applicazione.

Scegli Onyx se il vero obiettivo della ricerca è la conoscenza aziendale distribuita tra numerosi strumenti e repository.

Scegli Khoj se vuoi un livello di ricerca personale sui file privati e sul web.

Scegli SurfSense quando la ricerca fa parte di un flusso di lavoro più ampio che include ricerca, note, connettori e automazione.

Scegli Open WebUI se disponi già di uno stack AI locale basato su Ollama e vuoi semplicemente aggiungere la ricerca web e il RAG locale all’interfaccia che già utilizzi.

Scegli Local Deep Researcher quando l’attività richiede ricerche ripetute, riflessione e raccolta di prove anziché una singola risposta rapida.

Scegli RAGFlow quando l’analisi privata dei documenti, l’acquisizione, la qualità del recupero e il RAG su scala più ampia sono più importanti dell’esperienza utente della ricerca web.

Scegli AnythingLLM per il percorso più semplice verso la ricerca privata nei documenti con modelli locali, embedding locali e RAG integrato.

Scegli SearXNG quando vuoi gestire direttamente il backend di ricerca web e usare quel livello di ricerca in più applicazioni AI locali.

Lo stack AI self-hosted per la ricerca più utile, quindi, non è necessariamente una singola applicazione. Spesso è un sistema modulare in cui ricerca, recupero, inferenza, archiviazione privata e citazioni possono evolversi in modo indipendente.

FAQ

Qual è il miglior motore di ricerca AI self-hosted nel 2026?

Vane è una delle migliori opzioni complessive per un motore di risposta in stile Perplexity self-hosted, perché combina risposte web con citazioni, SearXNG, distribuzione tramite Docker e inferenza locale tramite Ollama. Morphic è un’alternativa valida quando l’interfaccia di ricerca e l’interfaccia utente generativa sono più importanti.

Qual è la migliore alternativa open source a Perplexity?

Vane e Morphic sono due delle alternative open source self-hosted più simili. Vane si concentra su risposte orientate alla privacy con SearXNG e modelli locali, mentre Morphic punta sull’interfaccia utente generativa e su provider di ricerca flessibili.

Perplexica è ancora attivo?

Il progetto precedentemente noto come Perplexica è proseguito come Vane. Gli utenti che cercano la versione attuale dovrebbero valutare Vane anziché affidarsi alle guide d’installazione obsolete di Perplexica.

Posso eseguire la ricerca web tramite IA completamente offline?

No, non se hai bisogno di informazioni aggiornate dal web in tempo reale. Puoi mantenere in locale il modello IA, l’applicazione, la cronologia e l’orchestrazione della ricerca, ma un backend di ricerca web ha comunque bisogno di accedere a Internet per recuperare pagine aggiornate o risultati dei motori di ricerca. La ricerca completamente offline è possibile solo sui dati già archiviati localmente.

Posso usare SearXNG con Ollama?

Sì. SearXNG fornisce risultati di ricerca, mentre Ollama esegue l’inferenza LLM in locale. Applicazioni come Vane, Morphic, Open WebUI e Local Deep Researcher possono fungere da intermediari e trasformare i risultati di ricerca in risposte generate dall’IA.

Qual è il miglior strumento di ricerca IA self-hosted per i documenti privati?

AnythingLLM è una delle opzioni più semplici per le domande e risposte sui documenti in locale. RAGFlow è più adatto all’acquisizione complessa dei dati e ai sistemi RAG di dimensioni maggiori, mentre Onyx è più efficace quando i documenti sono distribuiti tra molte applicazioni dell’organizzazione.

Qual è il miglior strumento di ricerca IA self-hosted per un team?

Onyx è la soluzione più adatta di questo elenco per la ricerca a livello aziendale, perché combina connettori, recupero ibrido, RAG, ricerca web, agenti e funzionalità di governance orientate ai team. SurfSense è un’altra buona opzione quando il flusso di lavoro è più incentrato sulla ricerca.

Qual è la differenza tra ricerca IA e RAG?

La ricerca IA è l’esperienza utente più ampia di recuperare informazioni e generare una risposta. RAG è un’architettura di recupero utilizzata per ancorare un LLM a un contesto esterno pertinente. Uno strumento di ricerca IA self-hosted può usare RAG per i documenti privati, la ricerca web in tempo reale per le informazioni aggiornate o entrambe le opzioni.

Ho bisogno di un database vettoriale per la ricerca IA self-hosted?

Non per le normali ricerche web in tempo reale. I database vettoriali diventano utili quando serve una ricerca semantica tra documenti privati, note, repository o altre conoscenze persistenti. Strumenti come AnythingLLM, RAGFlow, Onyx e Khoj usano livelli di recupero che vanno oltre la ricerca web tradizionale.

Qual è la differenza tra Vane e SearXNG?

SearXNG è un backend di metaricerca che restituisce risultati di ricerca. Vane è un motore di risposta basato sull’IA che può usare SearXNG per recuperare i risultati e poi un LLM per sintetizzarli in una risposta con citazioni.

La ricerca IA self-hosted può usare sia modelli locali sia modelli cloud?

Sì. Molti strumenti di questo elenco supportano entrambe le opzioni. Ciò consente un’architettura ibrida in cui le ricerche di routine utilizzano Ollama in locale, mentre le attività di ricerca più complesse possono essere inoltrate a un modello ospitato quando necessario.

Che cosa dovrei ospitare autonomamente per primo: il modello di IA o il motore di ricerca?

Se la principale preoccupazione riguarda la privacy dei documenti privati, inizia dal modello, dagli embedding e dall’indice dei documenti. Se la principale preoccupazione riguarda la privacy delle query web, inizia da un backend di ricerca self-hosted come SearXNG. Per ottenere il massimo controllo, ospita autonomamente entrambi i livelli.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.