Porque é que os pipelines de OCR não detetam as relações entre tabelas em documentos domésticos digitalizados?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

Os pipelines de OCR não detetam as relações entre tabelas porque reconhecer caracteres não recupera automaticamente as linhas, colunas, cabeçalhos, células mescladas e a ordem de leitura à sua volta.

Uma fatura de serviços digitalizada, um recibo, uma folha de inventário, um extrato médico ou um plano de eletrodomésticos pode conter palavras perfeitamente legíveis e, ainda assim, produzir um fluxo de texto simples após o OCR. A informação em falta é estrutural: qual o valor que pertence a determinado cabeçalho, quais as células que partilham uma linha, se uma etiqueta abrange várias colunas e como as secções repetidas continuam ao longo da página. O OCR resolve o reconhecimento visual de texto, enquanto a compreensão de tabelas também requer deteção do esquema, segmentação de células, alinhamento de coordenadas e reconstrução lógica.

O OCR Converte Regiões de Imagem em Texto, Não num Esquema de Tabela

O reconhecimento de caracteres identifica letras, números e palavras a partir dos píxeis da imagem. Um resultado em texto simples pode preservar as palavras e, ao mesmo tempo, eliminar as suas coordenadas originais.

A Google descreve o texto legível por máquina como o resultado essencial do OCR.

Uma tabela requer objetos adicionais: células, grupos de linhas, grupos de colunas, cabeçalhos, extensões e ligações entre estes elementos. Essas relações não são caracteres e não podem ser recuperadas apenas com base na precisão ortográfica.

Aplanar o Resultado do OCR Remove as Evidências Espaciais

Dois valores podem estar separados por espaços em branco porque pertencem a colunas diferentes, porque uma célula está vazia ou porque a digitalização contém espaçamento visual.

A Microsoft Research observa que o texto OCR em formato livre não contém uma estrutura de tabela explícita e requer inferência adicional para reconstruir linhas, colunas e cabeçalhos.

Depois de as coordenadas serem eliminadas, o pipeline tem de inferir a estrutura a partir de delimitadores, padrões repetidos, tipos de valores e consistência semântica. Os esquemas ambíguos podem permitir várias reconstruções plausíveis.

Preserve as caixas delimitadoras, os números das páginas, os IDs das linhas e os valores de confiança juntamente com o texto reconhecido sempre que for necessária uma extração posterior de tabelas.

As Linhas e Colunas Dependem do Alinhamento Visual

As tabelas sem linhas de delimitação visíveis dependem de espaçamento e alinhamento consistentes. A inclinação, a perspetiva, o desfoque ou uma digitalização irregular podem deslocar as células o suficiente para comprometer heurísticas simples de linhas e colunas.

A investigação sobre reconhecimento de tabelas utiliza a modelação de coordenadas para recuperar a estrutura lógica e física de tabelas a partir de imagens de documentos.

Uma cadeia de OCR correta colocada na linha errada continua a ser uma tabela incorreta. A precisão das relações deve ser medida separadamente da precisão dos caracteres.

-15% OFF

Os Cabeçalhos e as Células Mescladas Criam Relações Hierárquicas

Um cabeçalho superior pode abranger várias subcolunas e uma etiqueta do lado esquerdo pode descrever várias linhas seguintes. As células vazias podem significar continuação, e não dados em falta.

O Pix2Struct é treinado para a análise visualmente contextualizada, porque o significado de um documento depende tanto do esquema como dos tokens reconhecidos.

O texto simples repete frequentemente um cabeçalho uma vez e, depois, apresenta muitos valores sem uma ligação duradoura a esse cabeçalho. As células mescladas e os cabeçalhos multinível requerem uma representação hierárquica da tabela, em vez de uma simples divisão por linhas.

Extensões de linhas e colunas ao estilo HTML, um grafo de células ou IDs explícitos dos cabeçalhos principais podem preservar estas relações após a extração.

A Ordem de Leitura Pode Intercalar Células da Tabela com Outro Conteúdo da Página

Uma página pode conter um título, notas de rodapé, duas colunas, etiquetas junto à tabela e texto de continuação abaixo dela. A lógica genérica da ordem de leitura pode inserir essas regiões entre as linhas da tabela.

A IBM explica que o OCR é uma etapa da extração de dados de documentos, e não uma representação completa das relações do esquema.

A deteção de tabelas deve isolar a região da tabela antes de ordenar as linhas, enquanto as notas de rodapé e as legendas devem permanecer ligadas através de metadados separados.

As tabelas com várias páginas também precisam de lógica de continuação para que os cabeçalhos repetidos não sejam indexados como linhas de dados normais.

Os Modelos de Tabelas de Ponta a Ponta Ainda Precisam de Validação das Relações

Os sistemas modernos podem prever diretamente a partir de imagens as caixas das tabelas, as linhas, as colunas e a adjacência entre células, mas os esquemas complexos, as digitalizações de baixa qualidade e os estilos de documentos desconhecidos continuam a ser difíceis.

O Table Transformer introduziu o reconhecimento da estrutura como uma tarefa específica para além do OCR normal.

O fluxo de pesquisa de documentos da ZimaSpace depende da preservação de evidências relevantes antes da divisão em fragmentos e da indexação; uma tabela aplanada não pode produzir posteriormente citações fiáveis ao nível das linhas.

Valide o texto das células, a pertença às linhas, a pertença às colunas, a associação aos cabeçalhos, as extensões, a ordem de leitura e as coordenadas de origem. O pipeline só é aprovado quando um valor recuperado pode ser rastreado até à relação correta na tabela.

FAQ

Uma elevada precisão de caracteres no OCR pode ainda produzir uma tabela incorreta?

Sim. Todas as palavras podem ser reconhecidas corretamente, enquanto os valores são atribuídos à linha, coluna, cabeçalho ou secção de continuação errados.

As tabelas digitalizadas devem ser convertidas diretamente em texto simples para RAG?

Apenas quando a estrutura for irrelevante. Para pesquisa factual, mantenha uma representação estruturada da tabela e as coordenadas de origem juntamente com qualquer versão em texto.

As linhas de grelha visíveis garantem uma extração correta?

Não. As linhas ajudam na segmentação, mas as células mescladas, as digitalizações danificadas, os cabeçalhos aninhados e os erros de alinhamento do OCR ainda podem produzir relações incorretas.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.