O OCR não deteta texto ténue após a recompressão de PDFs porque os traços de baixo contraste podem ser reduzidos, quantizados, desfocados ou fundidos com o fundo da página.
Um visualizador de PDF pode fazer com que a página recomprimida pareça aceitável através da interpolação do zoom, da nitidez e da leitura contextual humana. O OCR, por sua vez, processa uma imagem rasterizada à resolução selecionada e converte padrões de intensidade locais em caracteres. Quando a tinta ténue ocupa apenas alguns píxeis, pequenas alterações na compressão ou no processamento da cor podem fazer com que esses píxeis fiquem abaixo dos limiares de segmentação e reconhecimento.
A recompressão pode rasterizar e reduzir a resolução da página
Um otimizador de PDF pode voltar a amostrar digitalizações incorporadas, reduzir os pontos por polegada, converter espaços de cor ou achatar a transparência antes de aplicar um novo codec. Os traços finos passam então a abranger menos píxeis, e a média mistura a sua intensidade com o fundo branco.
Uma revisão abrangente sobre binarização de documentos descreve como a binarização de documentos separa o primeiro plano do fundo perante iluminação irregular, degradação e baixo contraste. As evidências mostram que a recuperação de texto ténue depende da informação preservada antes da aplicação do limiar. Esta distinção continua visível durante testes domésticos posteriores.
As gravações repetidas com perdas agravam o problema, porque cada geração opera sobre artefactos anteriores. As transformações em blocos e a quantização JPEG removem alterações subtis de alta frequência, enquanto uma conversão monocromática agressiva pode fazer desaparecer por completo um traço cinzento limítrofe. O resultado intermédio deve permanecer inspecionável antes de prosseguir com a automatização.
A renderização e o pré-processamento do OCR aplicam limiares adicionais
O motor de OCR ou a biblioteca de PDF escolhe a resolução de renderização, o modo de antialiasing, a conversão de cor, a redução de ruído, a correção de inclinação e o método de binarização. Uma página que continua legível com o zoom do ecrã pode produzir uma imagem bitmap para OCR com menor resolução ou filtrada de forma diferente.
A investigação sobre binarização orientada para OCR otimiza conjuntamente os parâmetros de binarização para OCR, demonstrando que uma única escolha de limiar não serve todos os documentos. Os traços de baixo contraste podem ser classificados como fundo, mesmo quando uma pessoa os infere a partir das palavras circundantes.
Os limiares adaptativos podem recuperar texto ténue local, mas também podem amplificar a textura do papel e os ecos de compressão, transformando-os em falsos caracteres. Os limiares globais suprimem o ruído de forma mais consistente, mas falham quando as intensidades da tinta e do fundo se sobrepõem. Esse limite deve ser medido separadamente em condições de funcionamento realistas.
A visão humana e o OCR falham em limites diferentes
As pessoas combinam o zoom, a forma das palavras, as expectativas linguísticas e as frases próximas, enquanto o OCR precisa de evidências locais suficientes para a segmentação e a classificação. Uma página com um aspeto plausível não prova, portanto, que os píxeis dos caracteres tenham sobrevivido. A consequência prática surge quando várias fontes competem por um contexto limitado.
Uma análise dos efeitos do pré-processamento no OCR relaciona o pré-processamento com a precisão do OCR em documentos degradados, reforçando que a resolução, o contraste, o ruído e a aplicação de limiares interagem, em vez de contribuírem de forma independente. Esta dependência deve continuar explícita na interface final.
O limite da falha consiste em atribuir todas as omissões à recompressão. A nova execução do OCR pode utilizar outro pacote linguístico, renderizador, resolução, modo de disposição ou imagem de página em cache. Compare as imagens rasterizadas exatas apresentadas ao mesmo motor.
Compare as páginas de origem e recomprimidas na entrada do OCR
Renderize as páginas originais e recomprimidas com definições idênticas de resolução e cor. Meça as dimensões dos píxeis, o codec, a resolução efetiva, o contraste local entre os traços e o fundo, a largura das margens, os artefactos de blocos, a confiança do OCR, a taxa de erro de caracteres e as regiões em falta, utilizando dados de referência verificados.
Use a inconsistência do OCR para verificar se a inconsistência ao nível da página resulta da disposição ou da qualidade da imagem. Repita o OCR com o pré-processamento fixo e varie apenas a resolução de renderização, o método de aplicação de limiar e a qualidade da recompressão. O resultado deve, portanto, ser verificado em relação às evidências originais.
Considere a recompressão causal quando o mesmo motor obtém êxito na imagem raster original e falha nos locais onde a informação mensurável dos traços diminuiu. Preserve os originais, evite otimizações repetidas com perdas e escolha uma abordagem de maior qualidade ou sem perdas para documentos cujas marcas ténues tenham importância legal ou histórica.
Centro de Tecnologia e IA
Mais para Ler

Porque é que as alterações de ficheiros SMB chegam a um indexador incremental em rajadas?
Veja como o armazenamento em cache de escrita SMB, as concessões, CHANGE_NOTIFY, o transbordamento do buffer, a reconexão e o processamento em lotes do...

Porque é que a latência da IA local oscila com a curva da ventoinha de um servidor doméstico?
Veja como o calor, o controlo da ventoinha, os limites do relógio, o atraso dos sensores e o timing da carga de trabalho criam...

Porque é que a indexação de multimédia aquece mais um NAS do que uma cópia de segurança sequencial?
Saiba por que motivo as operações de E/S em ficheiros pequenos, os codecs, as miniaturas, os metadados, as bases de dados e a inferência...

