Waarom tabelstructuur belangrijker is dan OCR-nauwkeurigheid voor lokale RAG

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Lokale OCR kan tabelgebaseerde RAG voeden, maar de tabelstructuur — niet alleen de nauwkeurigheid van de tekens — bepaalt of een opgehaald getal nog steeds betekent wat het oorspronkelijke document bedoelde.

Een pipeline kan elke zichtbare waarde correct herkennen en toch het verkeerde antwoord opleveren nadat een tabel is afgevlakt. Als “2026”, “$412” en “Huishouden A” de OCR overleven, maar hun relaties tussen rijen en kolommen niet, ontvangt het taalmodel nauwkeurige tokens die aan het verkeerde bewijs zijn gekoppeld.

OCR herkent symbolen, terwijl tabelbegrip relaties reconstrueert

Gewone OCR beantwoordt de vraag welke tekens voorkomen en ongeveer waar ze staan. Een tabelparser heeft een moeilijkere taak: de tabelgrenzen identificeren, rijen en kolommen afleiden, kopteksten toewijzen, samengevoegde cellen verwerken, de leesvolgorde behouden en de coördinaten bewaren die elke waarde aan de pagina koppelen.

De Split, Embed and Merge-tabelherkenner scheidt expliciet de detectie van het tabelraster van het samenvoegen van cellen en gebruikt zowel visuele als tekstuele kenmerken om complexe structuren te reconstrueren. De tabelstructuur met splitsen en samenvoegen laat zien waarom het herkennen van tekens en het herstellen van relaties tussen rijen, kolommen en cellen verschillende problemen zijn; het artikel rapporteert een F1-score van 97,11% op SciTSR voor de taak rond tabelstructuur.

Deze grens wordt vooral belangrijk bij facturen, energierekeningen, schoolroosters, medicatietabellen en financiële overzichten, waarin hetzelfde getal in meerdere rijen kan voorkomen. Lokale verwerking voorkomt dat de pagina het huis verlaat, maar lokaal verwerken maakt een afgevlakte weergave niet automatisch semantisch betrouwbaar.

Kopteksten en overspanningen bevatten de betekenis die RAG moet ophalen

Een bruikbare geïndexeerde eenheid moet niet alleen antwoord geven op “welke waarde is gevonden?”, maar ook op “welk rijlabel, welke kolomkop, eenheid en sectie horen bij deze waarde?” Kopteksten op meerdere niveaus en samengevoegde cellen creëren overgeërfde relaties die verdwijnen wanneer een parser de pagina omzet in één regel tekst.

Een PMLR-artikel uit 2026 over correctie van de tabelindeling rapporteerde betere gestructureerde extractie en vraagbeantwoording achteraf na expliciete correctie van de indeling en omzetting naar Markdown-/HTML-achtige representaties. Dat is een sterker signaal voor RAG-kwaliteit dan de ruwe nauwkeurigheid van OCR-tekens, omdat hiermee wordt getest of de structuur bruikbaar blijft voor het beantwoorden van vragen.

Het gerelateerde ZimaSpace-artikel over relaties in OCR-tabellen behandelt veelvoorkomende foutpatronen. Het onderscheid van AI Hub is hier architecturaal: tabelstructuur moet eersteklas geïndexeerd bewijs worden in plaats van een toevallig bijproduct van OCR.

Een tabel behandelen als gewone proza bij het opdelen in fragmenten kan correcte extractie verstoren

Zelfs een correct gereconstrueerde tabel kan later mislukken als het opdelen in fragmenten een waarde scheidt van de kopteksten of een herhaalde koptekst losmaakt van de rijen waarop deze van toepassing is. Tabelbewuste RAG heeft vaak rijgroepen, het doorgeven van kopteksten, stabiele tabel-ID's, paginacoördinaten en een representatie nodig die als één logisch object kan worden opgehaald.

Het T2-RAGBench-onderzoek uit 2026 evalueert RAG over tekst en tabellen in plaats van tabellen als gewone proza te behandelen. Het bestaan van een speciale benchmark voor tekst en tabellen weerspiegelt het onderliggende probleem: de kwaliteit van het ophalen hangt af van het behouden van gestructureerd bewijs tijdens het inladen en opbouwen van context, niet alleen van het extraheren van woorden uit een pagina.

Maak geen kleine embeddings op celniveau zonder gedeelde context, tenzij de ophaallaag het pad van de koptekst deterministisch kan reconstrueren. Een cel met “18,4” is zelden op zichzelf bruikbaar. De index moet de waarde kunnen teruggeven met voldoende omliggende structuur om vast te stellen wat 18,4 meet, voor wie en in welke periode.

Valideer structurele getrouwheid met vragen, niet alleen met een OCR-percentage

Stel een testset samen op basis van de moeilijkste tabellen van het huishouden: samengevoegde kopteksten, overzichten van meerdere pagina's, gedraaide scans, vage rasterlijnen, herhaalde eenheden en rijen met vergelijkbare getallen. Beoordeel de nauwkeurigheid van celteksten, de toewijzing van kopteksten, de koppeling tussen rijen en kolommen en de juistheid van de uiteindelijke vraagbeantwoording afzonderlijk, zodat een hoge OCR-score geen structurele fout kan verbergen.

Een praktische analyse van extractiefouten bij samengevoegde cellen laat zien hoe samengevoegde cellen en kopteksten op meerdere niveaus de relaties tussen rijen en kolommen verderop in de verwerking kunnen verbreken, zelfs wanneer zichtbare tekst wordt herkend. Dat zijn precies de fouten die een lokale RAG-test aan het licht moet brengen voordat duizenden huishoudelijke documenten worden geïndexeerd.

Verklaar de pipeline pas gereed wanneer opgehaalde antwoorden kunnen worden teruggevoerd naar de juiste tabel, pagina, rij, kolom en het juiste pad van de koptekst. Als het model moet raden welk label bij een waarde hoort, verbeter dan de tabelreconstructie of haal de pagina-afbeelding op voor een multimodale controle, in plaats van een misleidend hoge OCR-nauwkeurigheidsscore te accepteren.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.