L’OCR locale può alimentare il RAG basato su tabelle, ma è la struttura della tabella, non la sola accuratezza dei caratteri, a determinare se un numero recuperato conserva ancora il significato del documento originale.
Una pipeline può riconoscere correttamente ogni valore visibile e produrre comunque la risposta sbagliata dopo aver appiattito una tabella. Se “2026”, “$412” e “Household A” superano l’OCR, ma non le loro relazioni di riga e colonna, il modello linguistico riceve token accurati associati all’evidenza sbagliata.
L’OCR riconosce i simboli, mentre la comprensione delle tabelle ricostruisce le relazioni
L’OCR semplice risponde alla domanda su quali caratteri compaiono e, approssimativamente, dove si trovano. Un parser di tabelle ha un compito più complesso: identificare i confini della tabella, dedurre righe e colonne, assegnare le intestazioni, gestire le celle unite, mantenere l’ordine di lettura e preservare le coordinate che collegano ogni valore alla pagina.
Il riconoscitore di tabelle Split, Embed and Merge separa esplicitamente il rilevamento della griglia dalla fusione delle celle e utilizza caratteristiche sia visive sia testuali per ricostruire strutture complesse. La sua struttura delle tabelle basata su suddivisione e fusione dimostra perché il riconoscimento dei caratteri e il recupero delle relazioni tra righe, colonne e celle siano problemi diversi; l’articolo riporta un punteggio F1 del 97,11% su SciTSR per il compito di riconoscimento della struttura delle tabelle.
Questa distinzione diventa particolarmente importante per fatture, bollette, orari scolastici, tabelle dei farmaci ed estratti finanziari, dove lo stesso numero può comparire in più righe. L’elaborazione locale impedisce alla pagina di uscire dalla rete domestica, ma la località non rende semanticamente sicura una rappresentazione appiattita.
Le intestazioni e le celle unite trasmettono il significato che il RAG deve recuperare
Un’unità indicizzata utile dovrebbe rispondere non solo alla domanda “quale valore è stato trovato?”, ma anche a “quale etichetta di riga, intestazione di colonna, unità e sezione appartengono a questo valore?”. Le intestazioni multilivello e le celle unite creano relazioni ereditate che scompaiono quando un parser converte la pagina in un’unica riga di testo.
Un articolo PMLR del 2026 sulla correzione del layout delle tabelle ha riportato un’estrazione strutturata e una risposta alle domande successive migliori dopo una correzione esplicita del layout e la conversione in rappresentazioni simili a Markdown/HTML. Questo è un indicatore più solido della qualità del RAG rispetto alla sola accuratezza dei caratteri OCR, perché verifica se la struttura resta utilizzabile per rispondere alle domande.
Il relativo articolo di ZimaSpace sulle relazioni tra le tabelle nell’OCR illustra i principali tipi di errore. La distinzione dell’AI Hub è architetturale: la struttura della tabella dovrebbe diventare un’evidenza indicizzata di primo livello, non un sottoprodotto occasionale dell’OCR.
Suddividere una tabella come fosse prosa ordinaria può compromettere l’estrazione corretta
Anche una tabella ricostruita correttamente può fallire in seguito se il chunking separa un valore dalle sue intestazioni o divide un’intestazione ripetuta dalle righe a cui si riferisce. Il RAG consapevole della struttura delle tabelle richiede spesso gruppi di righe, propagazione delle intestazioni, ID stabili delle tabelle, coordinate della pagina e una rappresentazione che possa essere recuperata come un unico oggetto logico.
Il lavoro T2-RAGBench del 2026 valuta il RAG su testo e tabelle, invece di trattare le tabelle come semplice prosa. L’esistenza di un benchmark dedicato a testo e tabelle riflette il problema di fondo: la qualità del recupero dipende dalla conservazione dell’evidenza strutturata durante l’acquisizione e la costruzione del contesto, non solo dall’estrazione delle parole dalla pagina.
Non creare embedding minuscoli a livello di cella senza contesto condiviso, a meno che il livello di recupero non sia in grado di ricostruire deterministicamente il percorso delle intestazioni. Una cella contenente “18.4” è raramente utile da sola. L’indice dovrebbe poter restituire il valore insieme a una struttura circostante sufficiente a stabilire che cosa misura 18.4, per chi e in quale periodo.
Valida la fedeltà strutturale con le domande, non solo con la percentuale OCR
Costruisci un set di test a partire dalle tabelle più difficili della famiglia: intestazioni unite, estratti multipagina, scansioni ruotate, linee della griglia sbiadite, unità ripetute e righe con numeri simili. Valuta separatamente l’accuratezza del testo nelle celle, l’assegnazione delle intestazioni, la corrispondenza tra righe e colonne e la correttezza finale delle risposte, così un punteggio OCR elevato non possa nascondere un errore strutturale.
Un’analisi pratica degli errori nell’estrazione delle celle unite mostra come le celle unite e le intestazioni multilivello possano compromettere le associazioni successive tra righe e colonne anche quando il testo visibile viene riconosciuto. Sono esattamente gli errori che un test RAG locale dovrebbe far emergere prima di indicizzare migliaia di documenti domestici.
Considera la pipeline pronta solo quando le risposte recuperate possono essere ricondotte alla tabella, alla pagina, alla riga, alla colonna e al percorso di intestazioni corretti. Se il modello deve indovinare quale etichetta appartiene a un valore, migliora la ricostruzione della tabella o recupera l’immagine della pagina per una verifica multimodale, invece di accettare un punteggio di accuratezza OCR fuorviante.
Hub Tecnologico e AI
Altro da leggere

In che modo un broker segreto fornisce le credenziali a un agente IA senza esporle nei prompt?
Segui l'identità del carico di lavoro, le policy, l'emissione dei token, l'iniezione delle richieste, la redazione, la scadenza e la revoca attraverso un'architettura secretless...

In che modo un sandbox degli strumenti contiene gli effetti collaterali degli agenti IA?
Scopri come l'isolamento, i gate delle capacità, lo stato usa e getta, il controllo dell'egress, le quote e i log di audit limitano gli...

In che modo la decodifica vincolata produce JSON valido secondo lo schema?
Comprendi la compilazione dello schema, il mascheramento dei token, lo stato del parser, i sottoinsiemi supportati, la latenza, il troncamento e perché la validità...

