Agentic RAG è la generazione aumentata dal recupero in cui un agente decide come, quando e se effettuare un nuovo recupero, invece di seguire un unico percorso di ricerca predefinito.
Una semplice ricerca nei documenti di casa può trasformare una domanda in un embedding, recuperare i primi k frammenti e generare una risposta. Agentic RAG aggiunge un ciclo di controllo a questo percorso: il modello o l’orchestratore può scegliere uno strumento di ricerca, valutare se le prove sono sufficienti, riscrivere la query, indirizzarla a un’altra fonte o interrompere il processo. Questa flessibilità è utile per domande private complesse, ma introduce anche latenza, autorizzazioni degli strumenti, stato e modalità di errore che la normale ricerca documentale non richiede.
Il RAG semplice usa un percorso di recupero predeterminato
Una pipeline RAG convenzionale conosce generalmente i propri passaggi prima che arrivi la domanda: trasformare la query, cercare in uno o più indici, assemblare il contesto e chiedere al modello di rispondere. Parametri come top-k o i filtri dei metadati possono cambiare, ma il flusso di controllo rimane in gran parte fisso.
Questo approccio è spesso sufficiente per manuali domestici, ricevute, note e testo ottenuto tramite OCR, perché un singolo passaggio di recupero può far emergere le prove necessarie. È prevedibile, facile da valutare ed economico da eseguire localmente.
La base per il recupero dalle basi di conoscenza locali può estrarre, indicizzare, recuperare e gestire le prove senza lasciare al modello il controllo dell’intero processo di ricerca.
Agentic RAG consente al sistema di decidere quando e come effettuare il recupero
Il cambiamento fondamentale riguarda il controllo. Il recupero diventa un’azione che l’agente può scegliere dopo aver esaminato la domanda o le prove precedenti, anziché una fase iniziale obbligatoria.
Un agente può scegliere il recupero, valutare i documenti e riscrivere le query prima di generare una risposta.
Un server domestico può usare questo approccio quando una domanda potrebbe richiedere note locali, un indice vettoriale, una ricerca esatta per nome file o uno strumento per lo stato dei servizi. L’agente può indirizzare la richiesta tra queste opzioni invece di obbligare ogni domanda a passare dallo stesso sistema di recupero.
Questo non rende agentica ogni funzionalità adattiva. Un router deterministico che invia gli ID dei file alla ricerca lessicale e le domande concettuali alla ricerca vettoriale può rimanere un programma fisso, anche se usa più metodi di recupero.
La valutazione delle prove e la riscrittura delle query creano un ciclo iterativo
Agentic RAG diventa sostanzialmente diverso quando il risultato di un recupero modifica l’azione successiva. Prove deboli possono attivare un’altra query, una nuova fonte o una ricerca riformulata, invece di passare direttamente alla generazione.
Un ciclo di recupero agentico può decidere quando e come effettuare il recupero mentre il compito procede.
Nella ricerca privata, questo ciclo può risolvere una domanda che inizia in modo generico e poi si restringe a una fattura con una data specifica, a una clip della videocamera o a un file di configurazione dopo che le prime prove hanno rivelato l’identificativo mancante.
Il costo è che la valutazione deve ora esaminare una traiettoria, non solo un’unica lista ordinata. Una risposta errata può derivare da una riscrittura della query inadeguata, dalla scelta dello strumento sbagliato, da un’interruzione prematura o da un errore di recupero avvenuto più avanti nel ciclo.
La ricerca smette di essere semplice quando il recupero diventa un processo decisionale basato sullo stato
Il confine non dipende dalla presenza di un LLM nella pipeline, perché anche il RAG semplice ne usa già uno per la generazione. Il confine emerge quando il sistema mantiene uno stato intermedio e utilizza decisioni guidate dal modello per selezionare o ripetere le azioni di raccolta delle prove.
Il controllo e l’autonomia dell’agente distinguono le architetture di recupero agentico più avanzate dalle pipeline fisse.
Quando il sistema può pianificare una sequenza di ricerca, chiamare diversi strumenti, conservare le osservazioni e decidere se le prove sono sufficienti, aspetti operativi come i limiti di esecuzione, le autorizzazioni e la tracciabilità diventano parte della progettazione del recupero.
Una pipeline in più passaggi non è automaticamente agentica se ogni diramazione è codificata rigidamente. La proprietà fondamentale è la titolarità adattiva delle decisioni, non il semplice numero di componenti.
Usa Agentic RAG solo quando il recupero adattivo giustifica il costo
Una ricerca nei documenti di famiglia che risponde in modo affidabile usando un solo indice trae pochi vantaggi da un ciclo agentico. Una maggiore autonomia aggiunge token, latenza, stato, esposizione degli strumenti e nuovi modi per interrompere il processo troppo presto o inseguire prove irrilevanti.
Il recupero agentico è più efficace quando le domande sono eterogenee, la qualità delle prove deve essere valutata durante l’esecuzione o diverse fonti private richiedono strategie di ricerca differenti. Può essere utile anche quando la prima query non contiene l’entità o la data necessaria per una ricerca esatta.
Mantieni il percorso semplice come impostazione predefinita e indirizza i casi difficili verso il percorso agentico quando una valutazione misurabile dimostra una migliore copertura delle prove. Agentic RAG è utile perché può modificare il piano di recupero, non perché ogni problema di ricerca tragga vantaggio da una maggiore autonomia.
La pianificazione in più passaggi e il recupero ripetuto possono aggiungere costi in token e latenza prima che la risposta sia completa; perciò il percorso adattivo dovrebbe giustificare questo lavoro aggiuntivo sull’effettivo set di valutazione della ricerca privata.
Hub Tecnologico e AI
Altro da leggere

In che modo il downsampling delle serie temporali influisce sul rilevamento delle anomalie nelle smart home?
Scopri come la larghezza dei bucket, l'aggregazione, l'anti-aliasing, i dati mancanti, la durata degli eventi e la conservazione multiscala modificano il tasso di rilevamento...

In che modo una griglia di occupazione combina segnali deboli della casa intelligente?
Scopri come le celle spaziali, i modelli dei sensori, gli aggiornamenti log-odds, il decadimento, le evidenze correlate e le soglie trasformano i deboli segnali...

In che modo la normalizzazione fotometrica influisce sul clustering privato dei volti?
Scopri come la correzione dell’illuminazione modifica i ritagli dei volti, gli embedding, le distanze tra i cluster, le soglie, l’eccessiva normalizzazione e la valutazione...

