Le pipeline OCR perdono le relazioni tra le tabelle perché il riconoscimento dei caratteri non recupera automaticamente righe, colonne, intestazioni, celle unite e ordine di lettura.
Una bolletta scansionata, una ricevuta, un foglio d’inventario, un referto medico o un programma di manutenzione di un elettrodomestico possono contenere parole perfettamente leggibili, ma produrre un flusso di testo piatto dopo l’OCR. Ciò che manca è l’informazione strutturale: quale valore appartiene a quale intestazione, quali celle condividono una riga, se un’etichetta si estende su più colonne e come le sezioni ripetute proseguono nella pagina. L’OCR risolve il riconoscimento visivo del testo, mentre la comprensione delle tabelle richiede anche il rilevamento del layout, la segmentazione delle celle, l’allineamento delle coordinate e la ricostruzione logica.
L’OCR converte le regioni dell’immagine in testo, non in uno schema di tabella
Il riconoscimento dei caratteri identifica lettere, numeri e parole a partire dai pixel dell’immagine. Un output in testo semplice può conservare le parole eliminando però le coordinate originali.
Google descrive il testo leggibile dalle macchine come il risultato fondamentale dell’OCR.
Una tabella richiede oggetti aggiuntivi: celle, gruppi di righe, gruppi di colonne, intestazioni, estensioni e collegamenti tra questi elementi. Queste relazioni non sono caratteri e non possono essere recuperate basandosi soltanto sull’accuratezza ortografica.
La trasformazione dell’output OCR in testo piatto elimina le informazioni spaziali
Due valori possono essere separati da spazi perché appartengono a colonne diverse, perché una cella è vuota o perché la scansione contiene spaziature visive.
Microsoft Research osserva che il testo OCR libero non contiene una struttura tabellare esplicita e richiede ulteriori inferenze per ricostruire righe, colonne e intestazioni.
Una volta eliminate le coordinate, il pipeline deve dedurre la struttura da delimitatori, schemi ripetuti, tipi di valore e coerenza semantica. I layout ambigui possono supportare diverse ricostruzioni plausibili.
Quando in seguito sarà necessaria l’estrazione di tabelle, conserva i riquadri di delimitazione, i numeri di pagina, gli ID delle righe e i valori di confidenza insieme al testo riconosciuto.
Righe e colonne dipendono dall’allineamento visivo
Le tabelle prive di linee di delimitazione visibili si basano su spaziatura e allineamento coerenti. Inclinazione, prospettiva, sfocatura o scansioni irregolari possono spostare le celle abbastanza da compromettere le semplici euristiche per righe e colonne.
La ricerca sul riconoscimento delle tabelle utilizza la modellazione delle coordinate per recuperare la struttura logica e fisica delle tabelle dalle immagini dei documenti.
Una stringa OCR corretta inserita nella riga sbagliata rimane una tabella errata. L’accuratezza delle relazioni deve essere misurata separatamente da quella dei caratteri.
Le intestazioni e le celle unite creano relazioni gerarchiche
Un’intestazione superiore può coprire diverse sottocolonne e un’etichetta laterale può descrivere più righe successive. Le celle vuote possono indicare una continuazione, non dati mancanti.
Pix2Struct viene addestrato sul parsing situato visivamente, perché il significato di un documento dipende dal layout oltre che dai token riconosciuti.
Il testo piatto spesso ripete un’intestazione una sola volta e poi elenca molti valori senza un collegamento stabile con essa. Le celle unite e le intestazioni multilivello richiedono una rappresentazione gerarchica della tabella, non una semplice suddivisione per righe.
Gli attributi HTML per l’estensione su righe e colonne, un grafo delle celle o ID espliciti delle intestazioni principali possono preservare queste relazioni dopo l’estrazione.
L’ordine di lettura può intercalare le celle della tabella con altri contenuti della pagina
Una pagina può contenere un titolo, note a piè di pagina, due colonne, etichette accanto alla tabella e testo di continuazione sotto di essa. La logica generica dell’ordine di lettura può inserire queste regioni tra le righe della tabella.
IBM spiega che l’OCR è una fase dell’estrazione dei dati dai documenti, non una rappresentazione completa delle relazioni di layout.
Il rilevamento della tabella dovrebbe isolare la regione della tabella prima di ordinare le righe, mentre note a piè di pagina e didascalie dovrebbero rimanere collegate tramite metadati separati.
Le tabelle su più pagine richiedono inoltre una logica di continuazione, affinché le intestazioni ripetute non vengano indicizzate come normali righe di dati.
Anche i modelli end-to-end per le tabelle richiedono la convalida delle relazioni
I sistemi moderni possono prevedere direttamente dalle immagini i riquadri delle tabelle, le righe, le colonne e l’adiacenza tra le celle, ma i layout complessi, le scansioni di bassa qualità e gli stili di documenti non presenti nei dati di addestramento rimangono difficili da gestire.
Table Transformer ha introdotto il riconoscimento della struttura come attività specifica, distinta dal normale OCR.
Il flusso di ricerca nei documenti di ZimaSpace dipende dalla conservazione di informazioni significative prima del chunking e dell’indicizzazione; una tabella appiattita non può in seguito produrre citazioni affidabili a livello di riga.
Convalida il testo delle celle, l’appartenenza alle righe, l’appartenenza alle colonne, l’associazione alle intestazioni, le estensioni, l’ordine di lettura e le coordinate di origine. Il pipeline supera la verifica solo quando un valore recuperato può essere ricondotto alla relazione corretta all’interno della tabella.
FAQ
Un’elevata accuratezza dei caratteri OCR può comunque produrre una tabella errata?
Sì. Ogni parola può essere riconosciuta correttamente mentre i valori vengono assegnati alla riga, alla colonna, all’intestazione o alla sezione di continuazione sbagliata.
Le tabelle scansionate dovrebbero essere convertite direttamente in testo semplice per il RAG?
Solo quando la struttura non è rilevante. Per la ricerca fattuale, conserva una rappresentazione strutturata della tabella e le coordinate di origine insieme a qualsiasi versione testuale.
Le linee della griglia visibili garantiscono un’estrazione corretta?
No. Le linee aiutano la segmentazione, ma celle unite, scansioni danneggiate, intestazioni annidate ed errori di allineamento OCR possono comunque produrre relazioni errate.
Hub Tecnologico e AI
Altro da leggere

Quali funzionalità consentono di creare un confine di fiducia per l’IA domestica attorno ai file sensibili?
Un confine di fiducia per l’IA domestica combina la crittografia dei dati inattivi, autorizzazioni con il principio del privilegio minimo, sandboxing in fase di...

Cosa fa sì che i risultati di ricerca privati favoriscano i file modificati frequentemente?
I file modificati frequentemente ottengono vantaggi nel ranking quando ogni aggiornamento aggiunge segnali di freschezza, segmenti, versioni o interazioni senza normalizzarli in base alla...

Cosa porta i modelli di rilevamento della presenza nelle smart home a confondere gli ospiti con i residenti?
Gli ospiti possono sembrare residenti quando il sistema osserva i modelli di attività domestica, ma non dispone di un segnale d’identità stabile per la...

