같은 스캔 PDF의 페이지마다 OCR 결과가 일관되지 않은 이유는 무엇인가요?

에바 왕 는 기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

스캔한 PDF 한 파일 안에서도 페이지마다 해상도, 기울기, 대비, 압축, 레이아웃, 언어, 이미지 기하 구조가 다를 수 있으므로 OCR 결과가 달라집니다.

가정용 아카이브에는 여러 차례의 스캐너 작업, 휴대폰 촬영, 복사본 또는 가져온 이미지로 구성된 단일 PDF가 포함될 수 있습니다. 뷰어에서는 문서가 연속적으로 보이지만, OCR 엔진은 페이지 이미지를 독립적으로 처리합니다. 한 페이지는 깨끗한 300DPI 스캔인 반면, 다음 페이지는 다운샘플링되었거나 회전되어 있고, 제본 부분이 휘어 있거나, 배경 질감이 덮여 있거나, 이미 손상된 텍스트 레이어를 포함할 수 있습니다. 따라서 이러한 불일치는 작업 중 OCR 모델이 바뀐 것이 아니라 페이지 입력 상태가 달라진 결과인 경우가 많습니다.

하나의 PDF에서도 페이지마다 유효 해상도가 다를 수 있습니다

PDF 페이지는 컨테이너일 뿐, 포함된 모든 이미지의 픽셀 밀도가 같다는 보장은 없습니다. 여러 파일을 병합하는 과정에서 페이지가 서로 다른 설정으로 스캔되거나 크기가 조정될 수 있습니다.

Tesseract의 품질 가이드에서는 해상도와 문자 픽셀 크기를 중요한 OCR 입력 요소로 설명합니다.

저해상도 페이지에서는 작은 구두점과 문자의 가장자리부터 손실되는 반면, 고해상도 페이지는 정확도를 유지할 수 있습니다. 이러한 차이는 페이지 번호가 아니라 래스터 이미지의 크기와 문자 높이에 따라 발생합니다.

회전, 기울기, 페이지 말림은 텍스트 분할을 바꿉니다

OCR은 문자를 먼저 개별적으로 인식하는 것이 아니라, 줄과 텍스트 영역을 먼저 찾습니다. 약간의 기울기만 있어도 줄이 합쳐지거나 분리되거나, 예상된 분할 경계를 넘을 수 있습니다.

OCRmyPDF는 회전, 배경 제거, 기울기 보정, 정리와 같은 이미지 처리 단계를 정해진 순서로 적용합니다. 페이지의 기하 구조가 이후 인식에 영향을 주기 때문입니다.

오류가 제본 가장자리, 휘어진 페이지 또는 회전된 삽입물 주변에 집중된다면 원인은 기하학적 왜곡일 가능성이 높습니다. 반대로 곧게 스캔된 페이지 전반에서 동일한 문자 치환이 나타난다면 언어 또는 모델 설정 문제일 가능성이 더 큽니다.

고르지 않은 조명과 배경 질감은 하나의 전역 임계값을 무력화합니다

평판 스캐너로 스캔한 문서는 배경이 거의 균일한 흰색일 수 있지만, 휴대폰으로 촬영한 페이지에는 그림자, 그라데이션, 얼룩 또는 뒷면의 비침이 포함될 수 있습니다.

OpenCV는 전역 임계값과 적응형 임계값 처리를 구분합니다. 적응형 임계값 처리는 조명이 고르지 않을 때 지역별로 서로 다른 임계값을 적용합니다.

하나의 고정된 전처리 설정은 깨끗한 페이지를 개선하는 동시에 어두운 페이지의 희미한 텍스트를 지울 수 있습니다. OCR 오류가 특정 단어가 아니라 그림자, 종이 색상 또는 낮은 대비 영역과 일치한다면 이 원인을 의심할 수 있습니다.

뒤틀림과 원근 왜곡은 문자의 형태를 바꿉니다

비스듬히 촬영되었거나 책등 근처에서 휘어진 페이지에서는 일부 문자가 늘어나고 다른 문자는 압축됩니다. 곧은 텍스트 줄이 곡선으로 휘거나 기준선이 한 지점으로 모이는 형태가 됩니다.

PaddleOCR는 방향 분류와 이미지 왜곡 보정을 위한 문서 전처리 기능을 제공합니다.

원근 왜곡과 페이지 말림은 위치에 따라 다른 오류를 만듭니다. 가운데 영역은 제대로 OCR되지만 바깥 여백은 실패할 수 있습니다. 언어 모델 문제라면 일반적으로 위치와 관계없이 동일한 기호에 영향을 줍니다.

압축과 물리적 손상은 페이지마다 서로 다른 세부 정보를 제거합니다

JPEG 블록, 링잉 현상, 흐림, 망점 패턴, 여러 세대의 복사 과정, 낮은 잉크 농도는 문자 획을 지우거나 잘못된 가장자리를 만들 수 있습니다.

강건한 문서 파싱에 관한 연구에서는 스캔, 기울기, 뒤틀림, 화면 촬영 및 조명 변화를 포함한 왜곡을 평가합니다.

페이지를 결합하기 전에 서로 다른 출처에서 만들어졌기 때문에 이러한 인공물이 페이지마다 다르게 나타날 수 있습니다. 파일 수준의 압축 설정으로는 이전 스캔이나 복사 과정에서 이미 손실된 세부 정보를 복원할 수 없습니다.

레이아웃 변화가 인식 실패로 오해될 수 있습니다

일반 문단, 표, 2단 구성의 부록, 손글씨 메모, 양식이 있는 페이지는 서로 다른 영역 및 읽기 순서 가정을 필요로 합니다.

Tesseract를 비롯한 OCR 엔진은 입력을 하나의 블록, 희소 텍스트, 여러 열 또는 다른 레이아웃으로 처리할 수 있도록 페이지 분할 모드를 제공합니다. 인식 결과가 레이아웃에 따라 달라지기 때문입니다.

문자 자체는 대부분 정확하지만 열이 뒤섞이거나 표 셀이 잘못된 순서로 나타난다면 주요 실패 원인은 레이아웃 분석입니다. 일반 텍스트의 편집 거리만 측정하면 이러한 차이를 놓칠 수 있습니다.

여러 언어, 글꼴, 문자 집합은 후보 공간을 바꿉니다

보고서의 뒤쪽 페이지에서 영어 문단이 악센트가 있는 이름, 수학 기호, 손글씨, 타자기 글자 또는 다른 언어로 바뀔 수 있습니다.

설정된 인식 언어에 해당 문자 패턴이 없으면 엔진은 익숙하지 않은 글리프를 시각적으로 비슷하면서 지원되는 문자로 바꿉니다. 장식적인 글꼴과 품질이 저하된 고정폭 텍스트는 같은 현상을 더욱 심화할 수 있습니다.

이 원인은 문자 체계와 타이포그래피의 경계를 따라 나타납니다. 이미지 품질이 양호한데도 특정 언어나 글꼴군이 포함된 모든 페이지에서 비슷한 문제가 발생한다면, 스캔 노이즈보다는 인식 모델이나 언어 팩이 더 유력한 원인입니다.

PDF 래스터화 과정에서 OCR 엔진에 서로 다른 이미지가 전달될 수 있습니다

일부 페이지에는 임베드된 래스터 이미지가 있고, 일부에는 벡터 텍스트와 이미지가 함께 있으며, 다른 페이지에는 이미 숨겨진 OCR 레이어가 포함되어 있을 수 있습니다. 렌더링 설정에 따라 새 OCR 작업이 전달받는 픽셀이 달라집니다.

PyMuPDF의 OCR 가이드에서는 OCR이 페이지 이미지에서 작동하며, 페이지 렌더링과 기존 텍스트가 OCR 수행 여부와 방식에 영향을 준다고 설명합니다.

ZimaSpace의 문서 검색 및 RAG 글은 후속 처리의 경계를 설명합니다. 수집 파이프라인이 페이지별 출처와 신뢰도를 보존하지 않으면 일관성 없는 OCR 결과가 일관성 없는 청크와 인용으로 이어집니다.

FAQ

다국어 PDF에 하나의 OCR 언어 설정을 사용할 수 있나요?

엔진이 결합된 언어 모델을 지원한다면 가능합니다. 하지만 문자 체계, 글꼴, 페이지 품질이 다르면 정확도가 여전히 달라질 수 있습니다. 언어 감지와 페이지별 설정이 중요할 수 있습니다.

300DPI면 일관된 OCR 결과가 보장되나요?

아닙니다. 사용 가능한 세부 정보는 늘어나지만, 기울기, 흐림, 배경 노이즈, 압축, 뒤틀림, 레이아웃이 여전히 인식 품질을 좌우할 수 있습니다.

PDF가 선명해 보이는데도 OCR 결과가 좋지 않은 이유는 무엇인가요?

뷰어는 이미지를 보기 좋게 보정하거나 확대할 수 있습니다. OCR은 인식 파이프라인이 사용하는 원본 픽셀, 텍스트 레이어 상태, 래스터화 방식에 따라 달라집니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.