Agentic RAG è la generazione aumentata dal recupero in cui un agente decide come, quando e se effettuare un nuovo recupero, invece di seguire un unico percorso di ricerca predefinito.
Una semplice ricerca nei documenti di casa può trasformare una domanda in un embedding, recuperare i primi k frammenti e generare una risposta. Agentic RAG aggiunge un ciclo di controllo a questo percorso: il modello o l’orchestratore può scegliere uno strumento di ricerca, valutare se le prove sono sufficienti, riscrivere la query, indirizzarla a un’altra fonte o interrompere il processo. Questa flessibilità è utile per domande private complesse, ma introduce anche latenza, autorizzazioni degli strumenti, stato e modalità di errore che la normale ricerca documentale non richiede.
Il RAG semplice usa un percorso di recupero predeterminato
Una pipeline RAG convenzionale conosce generalmente i propri passaggi prima che arrivi la domanda: trasformare la query, cercare in uno o più indici, assemblare il contesto e chiedere al modello di rispondere. Parametri come top-k o i filtri dei metadati possono cambiare, ma il flusso di controllo rimane in gran parte fisso.
Questo approccio è spesso sufficiente per manuali domestici, ricevute, note e testo ottenuto tramite OCR, perché un singolo passaggio di recupero può far emergere le prove necessarie. È prevedibile, facile da valutare ed economico da eseguire localmente.
La base per il recupero dalle basi di conoscenza locali può estrarre, indicizzare, recuperare e gestire le prove senza lasciare al modello il controllo dell’intero processo di ricerca.
Agentic RAG consente al sistema di decidere quando e come effettuare il recupero
Il cambiamento fondamentale riguarda il controllo. Il recupero diventa un’azione che l’agente può scegliere dopo aver esaminato la domanda o le prove precedenti, anziché una fase iniziale obbligatoria.
Un agente può scegliere il recupero, valutare i documenti e riscrivere le query prima di generare una risposta.
Un server domestico può usare questo approccio quando una domanda potrebbe richiedere note locali, un indice vettoriale, una ricerca esatta per nome file o uno strumento per lo stato dei servizi. L’agente può indirizzare la richiesta tra queste opzioni invece di obbligare ogni domanda a passare dallo stesso sistema di recupero.
Questo non rende agentica ogni funzionalità adattiva. Un router deterministico che invia gli ID dei file alla ricerca lessicale e le domande concettuali alla ricerca vettoriale può rimanere un programma fisso, anche se usa più metodi di recupero.
La valutazione delle prove e la riscrittura delle query creano un ciclo iterativo
Agentic RAG diventa sostanzialmente diverso quando il risultato di un recupero modifica l’azione successiva. Prove deboli possono attivare un’altra query, una nuova fonte o una ricerca riformulata, invece di passare direttamente alla generazione.
Un ciclo di recupero agentico può decidere quando e come effettuare il recupero mentre il compito procede.
Nella ricerca privata, questo ciclo può risolvere una domanda che inizia in modo generico e poi si restringe a una fattura con una data specifica, a una clip della videocamera o a un file di configurazione dopo che le prime prove hanno rivelato l’identificativo mancante.
Il costo è che la valutazione deve ora esaminare una traiettoria, non solo un’unica lista ordinata. Una risposta errata può derivare da una riscrittura della query inadeguata, dalla scelta dello strumento sbagliato, da un’interruzione prematura o da un errore di recupero avvenuto più avanti nel ciclo.
La ricerca smette di essere semplice quando il recupero diventa un processo decisionale basato sullo stato
Il confine non dipende dalla presenza di un LLM nella pipeline, perché anche il RAG semplice ne usa già uno per la generazione. Il confine emerge quando il sistema mantiene uno stato intermedio e utilizza decisioni guidate dal modello per selezionare o ripetere le azioni di raccolta delle prove.
Il controllo e l’autonomia dell’agente distinguono le architetture di recupero agentico più avanzate dalle pipeline fisse.
Quando il sistema può pianificare una sequenza di ricerca, chiamare diversi strumenti, conservare le osservazioni e decidere se le prove sono sufficienti, aspetti operativi come i limiti di esecuzione, le autorizzazioni e la tracciabilità diventano parte della progettazione del recupero.
Una pipeline in più passaggi non è automaticamente agentica se ogni diramazione è codificata rigidamente. La proprietà fondamentale è la titolarità adattiva delle decisioni, non il semplice numero di componenti.
Usa Agentic RAG solo quando il recupero adattivo giustifica il costo
Una ricerca nei documenti di famiglia che risponde in modo affidabile usando un solo indice trae pochi vantaggi da un ciclo agentico. Una maggiore autonomia aggiunge token, latenza, stato, esposizione degli strumenti e nuovi modi per interrompere il processo troppo presto o inseguire prove irrilevanti.
Il recupero agentico è più efficace quando le domande sono eterogenee, la qualità delle prove deve essere valutata durante l’esecuzione o diverse fonti private richiedono strategie di ricerca differenti. Può essere utile anche quando la prima query non contiene l’entità o la data necessaria per una ricerca esatta.
Mantieni il percorso semplice come impostazione predefinita e indirizza i casi difficili verso il percorso agentico quando una valutazione misurabile dimostra una migliore copertura delle prove. Agentic RAG è utile perché può modificare il piano di recupero, non perché ogni problema di ricerca tragga vantaggio da una maggiore autonomia.
La pianificazione in più passaggi e il recupero ripetuto possono aggiungere costi in token e latenza prima che la risposta sia completa; perciò il percorso adattivo dovrebbe giustificare questo lavoro aggiuntivo sull’effettivo set di valutazione della ricerca privata.
Hub Tecnologico e AI
Altro da leggere

Che cos’è lo stato di Plex e quali parti devono essere persistenti?
Lo stato persistente di Plex è l’insieme di informazioni che conserva l’esperienza del server tra un riavvio e una ricostruzione; i contenuti multimediali e...

In che modo Plex gestisce l’autenticazione nelle sessioni locali e remote?
L’autenticazione Plex inizia con l’identità del server e dell’account; quindi i percorsi di rete locali o remoti determinano la raggiungibilità e il comportamento della...

Perché la ricerca in Plex può rallentare man mano che aumentano i dati della libreria?
La crescita della libreria, da sola, non è la diagnosi. Verifica la struttura delle query, gli indici, lo stato della cache, la latenza dello...

