OCR 파이프라인은 문자를 인식한다고 해서 행, 열, 헤더, 병합 셀, 주변의 읽기 순서까지 자동으로 복원할 수 있는 것은 아니기 때문에 표의 관계를 놓칩니다.
스캔된 공과금 청구서, 영수증, 재고 목록, 의료 명세서 또는 가전제품 일정표에는 완벽하게 읽을 수 있는 단어가 포함되어 있어도 OCR 후에는 평평한 텍스트 스트림으로 변환될 수 있습니다. 누락되는 것은 구조입니다. 어떤 값이 어떤 헤더 아래에 속하는지, 어떤 셀들이 같은 행을 공유하는지, 하나의 레이블이 여러 열에 걸쳐 있는지, 페이지 전체에서 반복되는 섹션이 어떻게 이어지는지 등의 정보입니다. OCR은 시각적 텍스트 인식을 해결하지만, 표 이해에는 레이아웃 감지, 셀 분할, 좌표 정렬, 논리적 재구성이 추가로 필요합니다.
OCR은 이미지 영역을 텍스트로 변환할 뿐, 표 스키마로 변환하지는 않습니다
문자 인식은 이미지 픽셀에서 글자, 숫자, 단어를 식별합니다. 일반 텍스트 출력은 단어를 보존할 수 있지만 원래 좌표는 삭제할 수 있습니다.
Google은 기계 판독 가능한 텍스트를 핵심 OCR 결과로 설명합니다.
표에는 셀, 행 그룹, 열 그룹, 헤더, 병합 영역, 그리고 이들 사이의 연결 관계 같은 추가 객체가 필요합니다. 이러한 관계는 문자가 아니므로 철자 정확도만으로는 복원할 수 없습니다.
OCR 출력을 평탄화하면 공간적 증거가 사라집니다
두 값이 공백으로 분리되어 있는 이유는 서로 다른 열에 속하기 때문일 수도 있고, 한 셀이 비어 있기 때문일 수도 있으며, 스캔에 시각적 여백이 포함되어 있기 때문일 수도 있습니다.
Microsoft Research는 자유 형식 OCR 텍스트에는 명시적인 표 구조가 없으며 행, 열, 헤더를 다시 구성하려면 추가 추론이 필요하다고 설명합니다.
좌표가 삭제되면 파이프라인은 구분 기호, 반복 패턴, 값의 유형, 의미적 일관성을 바탕으로 구조를 추론해야 합니다. 모호한 레이아웃은 여러 가지 그럴듯한 재구성을 허용할 수 있습니다.
나중에 표 추출이 필요할 수 있다면 인식된 텍스트와 함께 경계 상자, 페이지 번호, 줄 ID, 신뢰도 값을 보존하세요.
행과 열은 시각적 정렬에 좌우됩니다
표에 눈에 보이는 테두리선이 없으면 일관된 간격과 정렬에 의존합니다. 기울어짐, 원근 왜곡, 흐림 또는 고르지 않은 스캔으로 인해 셀이 충분히 이동하면 단순한 행·열 휴리스틱이 제대로 작동하지 않을 수 있습니다.
표 인식 연구에서는 문서 이미지에서 논리적·물리적 표 구조를 복원하기 위해 좌표 모델링을 사용합니다.
올바르게 인식된 OCR 문자열이라도 잘못된 행에 배치되면 여전히 잘못된 표입니다. 관계 정확도는 문자 정확도와 별도로 측정해야 합니다.
헤더와 병합 셀은 계층적 관계를 만듭니다
상단 헤더 하나가 여러 하위 열을 포함할 수 있고, 왼쪽 레이블 하나가 이어지는 여러 행을 설명할 수도 있습니다. 빈 셀은 데이터 누락이 아니라 앞선 내용의 연속을 의미할 수 있습니다.
Pix2Struct는 문서의 의미가 인식된 토큰뿐만 아니라 레이아웃에도 좌우되기 때문에 시각적 맥락을 반영한 파싱으로 학습합니다.
평평한 텍스트는 헤더를 한 번만 반복한 뒤 많은 값을 나열하면서 헤더와의 지속적인 연결을 잃는 경우가 많습니다. 병합 셀과 다단계 헤더에는 단순한 줄 분할이 아니라 계층적 표 표현이 필요합니다.
HTML 방식의 행·열 병합, 셀 그래프 또는 명시적인 상위 헤더 ID를 사용하면 추출 후에도 이러한 관계를 보존할 수 있습니다.
읽기 순서 때문에 표 셀이 페이지의 다른 콘텐츠와 뒤섞일 수 있습니다
한 페이지에는 제목, 각주, 두 개의 텍스트 열, 표 옆의 레이블, 표 아래의 이어지는 텍스트가 함께 포함될 수 있습니다. 일반적인 읽기 순서 로직은 이러한 영역을 표의 행 사이에 삽입할 수 있습니다.
IBM은 OCR이 문서 데이터 추출의 한 단계일 뿐이며, 레이아웃 관계를 완전하게 표현하는 방법은 아니라고 설명합니다.
행 순서를 정하기 전에 표 감지 단계에서 표 영역을 분리해야 하며, 각주와 캡션은 별도의 메타데이터를 통해 연결된 상태로 유지해야 합니다.
여러 페이지에 걸친 표에는 이어짐을 처리하는 로직도 필요합니다. 그래야 반복되는 헤더가 일반 데이터 행으로 색인되지 않습니다.
엔드투엔드 표 모델에도 관계 검증이 필요합니다
최신 시스템은 이미지에서 표의 경계, 행, 열, 셀 인접성을 직접 예측할 수 있지만, 복잡한 레이아웃, 품질이 낮은 스캔, 학습에서 보지 못한 문서 양식은 여전히 어렵습니다.
Table Transformer는 일반적인 OCR을 넘어 구조 인식을 별도의 작업으로 제시했습니다.
ZimaSpace의 문서 검색 워크플로는 청킹과 색인 전에 의미 있는 증거를 보존하는 데 의존합니다. 평탄화된 표에서는 나중에 신뢰할 수 있는 행 단위 인용을 생성할 수 없습니다.
셀 텍스트, 행 소속, 열 소속, 헤더 연결, 병합 영역, 읽기 순서, 원본 좌표를 검증하세요. 검색된 값을 올바른 표 관계로 추적할 수 있을 때만 파이프라인이 제대로 작동합니다.
FAQ
OCR 문자 정확도가 높아도 잘못된 표가 만들어질 수 있나요?
그렇습니다. 모든 단어를 올바르게 인식하더라도 값이 잘못된 행, 열, 헤더 또는 이어지는 섹션에 할당될 수 있습니다.
스캔된 표를 RAG용 일반 텍스트로 바로 변환해야 하나요?
구조가 중요하지 않은 경우에만 가능합니다. 사실 검색을 위해서는 텍스트 형태와 함께 구조화된 표 표현과 원본 좌표를 보존하세요.
눈에 보이는 격자선이 있으면 정확한 추출이 보장되나요?
아닙니다. 선은 분할에 도움이 되지만 병합 셀, 손상된 스캔, 중첩된 헤더, OCR 정렬 오류로 인해 여전히 잘못된 관계가 생성될 수 있습니다.
기술 및 AI 허브
더 읽어보기

민감한 파일을 보호하는 홈 AI 신뢰 경계를 구현하는 기능은 무엇인가요?
가정용 AI 신뢰 경계는 저장 데이터 암호화, 최소 권한 원칙에 따른 권한 설정, 런타임 샌드박싱, 범위가 제한된 검색을 결합하며, 어느 하나의 기능만으로는 충분하지 않습니다.

비공개 검색 결과에서 자주 편집된 파일이 우선 표시되는 이유는 무엇인가요?
자주 편집되는 파일은 각 업데이트가 소스별 정규화 없이 최신성, 청크, 버전 또는 상호작용 신호를 추가할 때 순위상 이점을 얻습니다.

스마트 홈 재실 감지 모델은 왜 방문객과 거주자를 혼동할까요?
시스템이 가구의 활동 패턴은 관찰하지만 해당 활동을 발생시킨 사람을 식별할 안정적인 신원 신호가 없으면, 방문객이 거주자처럼 보일 수 있습니다.

