Os pipelines de OCR não detetam as relações entre tabelas porque reconhecer caracteres não recupera automaticamente as linhas, colunas, cabeçalhos, células mescladas e a ordem de leitura à sua volta.
Uma fatura de serviços digitalizada, um recibo, uma folha de inventário, um extrato médico ou um plano de eletrodomésticos pode conter palavras perfeitamente legíveis e, ainda assim, produzir um fluxo de texto simples após o OCR. A informação em falta é estrutural: qual o valor que pertence a determinado cabeçalho, quais as células que partilham uma linha, se uma etiqueta abrange várias colunas e como as secções repetidas continuam ao longo da página. O OCR resolve o reconhecimento visual de texto, enquanto a compreensão de tabelas também requer deteção do esquema, segmentação de células, alinhamento de coordenadas e reconstrução lógica.
O OCR Converte Regiões de Imagem em Texto, Não num Esquema de Tabela
O reconhecimento de caracteres identifica letras, números e palavras a partir dos píxeis da imagem. Um resultado em texto simples pode preservar as palavras e, ao mesmo tempo, eliminar as suas coordenadas originais.
A Google descreve o texto legível por máquina como o resultado essencial do OCR.
Uma tabela requer objetos adicionais: células, grupos de linhas, grupos de colunas, cabeçalhos, extensões e ligações entre estes elementos. Essas relações não são caracteres e não podem ser recuperadas apenas com base na precisão ortográfica.
Aplanar o Resultado do OCR Remove as Evidências Espaciais
Dois valores podem estar separados por espaços em branco porque pertencem a colunas diferentes, porque uma célula está vazia ou porque a digitalização contém espaçamento visual.
A Microsoft Research observa que o texto OCR em formato livre não contém uma estrutura de tabela explícita e requer inferência adicional para reconstruir linhas, colunas e cabeçalhos.
Depois de as coordenadas serem eliminadas, o pipeline tem de inferir a estrutura a partir de delimitadores, padrões repetidos, tipos de valores e consistência semântica. Os esquemas ambíguos podem permitir várias reconstruções plausíveis.
Preserve as caixas delimitadoras, os números das páginas, os IDs das linhas e os valores de confiança juntamente com o texto reconhecido sempre que for necessária uma extração posterior de tabelas.
As Linhas e Colunas Dependem do Alinhamento Visual
As tabelas sem linhas de delimitação visíveis dependem de espaçamento e alinhamento consistentes. A inclinação, a perspetiva, o desfoque ou uma digitalização irregular podem deslocar as células o suficiente para comprometer heurísticas simples de linhas e colunas.
A investigação sobre reconhecimento de tabelas utiliza a modelação de coordenadas para recuperar a estrutura lógica e física de tabelas a partir de imagens de documentos.
Uma cadeia de OCR correta colocada na linha errada continua a ser uma tabela incorreta. A precisão das relações deve ser medida separadamente da precisão dos caracteres.
Os Cabeçalhos e as Células Mescladas Criam Relações Hierárquicas
Um cabeçalho superior pode abranger várias subcolunas e uma etiqueta do lado esquerdo pode descrever várias linhas seguintes. As células vazias podem significar continuação, e não dados em falta.
O Pix2Struct é treinado para a análise visualmente contextualizada, porque o significado de um documento depende tanto do esquema como dos tokens reconhecidos.
O texto simples repete frequentemente um cabeçalho uma vez e, depois, apresenta muitos valores sem uma ligação duradoura a esse cabeçalho. As células mescladas e os cabeçalhos multinível requerem uma representação hierárquica da tabela, em vez de uma simples divisão por linhas.
Extensões de linhas e colunas ao estilo HTML, um grafo de células ou IDs explícitos dos cabeçalhos principais podem preservar estas relações após a extração.
A Ordem de Leitura Pode Intercalar Células da Tabela com Outro Conteúdo da Página
Uma página pode conter um título, notas de rodapé, duas colunas, etiquetas junto à tabela e texto de continuação abaixo dela. A lógica genérica da ordem de leitura pode inserir essas regiões entre as linhas da tabela.
A IBM explica que o OCR é uma etapa da extração de dados de documentos, e não uma representação completa das relações do esquema.
A deteção de tabelas deve isolar a região da tabela antes de ordenar as linhas, enquanto as notas de rodapé e as legendas devem permanecer ligadas através de metadados separados.
As tabelas com várias páginas também precisam de lógica de continuação para que os cabeçalhos repetidos não sejam indexados como linhas de dados normais.
Os Modelos de Tabelas de Ponta a Ponta Ainda Precisam de Validação das Relações
Os sistemas modernos podem prever diretamente a partir de imagens as caixas das tabelas, as linhas, as colunas e a adjacência entre células, mas os esquemas complexos, as digitalizações de baixa qualidade e os estilos de documentos desconhecidos continuam a ser difíceis.
O Table Transformer introduziu o reconhecimento da estrutura como uma tarefa específica para além do OCR normal.
O fluxo de pesquisa de documentos da ZimaSpace depende da preservação de evidências relevantes antes da divisão em fragmentos e da indexação; uma tabela aplanada não pode produzir posteriormente citações fiáveis ao nível das linhas.
Valide o texto das células, a pertença às linhas, a pertença às colunas, a associação aos cabeçalhos, as extensões, a ordem de leitura e as coordenadas de origem. O pipeline só é aprovado quando um valor recuperado pode ser rastreado até à relação correta na tabela.
FAQ
Uma elevada precisão de caracteres no OCR pode ainda produzir uma tabela incorreta?
Sim. Todas as palavras podem ser reconhecidas corretamente, enquanto os valores são atribuídos à linha, coluna, cabeçalho ou secção de continuação errados.
As tabelas digitalizadas devem ser convertidas diretamente em texto simples para RAG?
Apenas quando a estrutura for irrelevante. Para pesquisa factual, mantenha uma representação estruturada da tabela e as coordenadas de origem juntamente com qualquer versão em texto.
As linhas de grelha visíveis garantem uma extração correta?
Não. As linhas ajudam na segmentação, mas as células mescladas, as digitalizações danificadas, os cabeçalhos aninhados e os erros de alinhamento do OCR ainda podem produzir relações incorretas.
Centro de Tecnologia e IA
Mais para Ler

Que funcionalidades permitem criar um limite de confiança de IA doméstico em torno de ficheiros sensíveis?
Uma fronteira de confiança para IA doméstica combina encriptação em repouso, permissões de privilégio mínimo, sandboxing em tempo de execução e recuperação com âmbito...

O que faz com que os resultados de pesquisa privada favoreçam ficheiros editados com frequência?
Os ficheiros editados frequentemente obtêm vantagens no posicionamento quando cada atualização acrescenta sinais de atualidade, fragmentos, versões ou interação, sem normalização por fonte.

O que faz com que os modelos de presença de casas inteligentes confundam visitantes com residentes?
Os visitantes podem parecer residentes quando o sistema observa padrões de atividade doméstica, mas não dispõe de um sinal de identidade estável da pessoa...

