OCR 레이아웃 복원이 중요한 이유는 문자를 정확하게 인식하더라도 라벨, 값, 행, 열이 잘못된 순서로 출력되면 오해를 불러일으킬 수 있기 때문입니다.
스캐너가 세금 양식의 모든 단어를 인식하더라도 금액을 인접한 라벨에 잘못 연결하거나, 표를 행 단위가 아닌 열 단위로 나열할 수 있습니다. 읽기 순서는 눈에 보이는 좌표와 직렬화된 텍스트를 연결하는 중간 구조입니다. 이 구조가 잘못되면 추출, 검색, RAG가 자신 있게 재배열된 문서를 그대로 물려받게 됩니다.
문자 정확도만으로는 문서 관계를 보존할 수 없습니다
OCR은 보통 영역, 줄, 단어, 문자를 감지하는 것부터 시작합니다. 이러한 예측은 어떤 텍스트가 존재하고 어디에 나타나는지는 알려 주지만, 어떤 블록이 다른 블록 다음에 와야 하는지는 알려 주지 않습니다. 일반 텍스트로 내보내려면 하나의 순서를 선택해야 하므로, 레이아웃 복원은 위치, 시각적 그룹화, 문서 관례를 바탕으로 별도로 추론해야 합니다.
LayoutReader 연구는 영수증과 양식에서 읽기 순서가 핵심이라고 설명하며, 문서 레이아웃 메타데이터를 활용해 대규모 데이터 세트를 구축합니다. 이 연구 결과는 문자 인식기를 변경하지 않고도 줄 순서를 개선하면 성능이 뛰어난 OCR 엔진을 더 향상시킬 수 있는 이유를 보여 줍니다.
구조화된 페이지에서는 이러한 차이가 결정적입니다. 문단에서는 줄 하나가 잘못 배치되어도 별문제가 없어 보일 수 있지만, 양식에서는 같은 오류가 하나의 값을 잘못된 필드에 연결할 수 있고, 표에서는 모든 셀을 잘못된 레코드로 옮길 수 있습니다.
읽기 순서는 행, 열, 필드 쌍을 복원합니다
레이아웃 모델은 블록을 노드로 보고 블록 간 선행 관계 또는 인접 관계를 예측합니다. 기하학적 정보는 정렬, 간격, 포함 관계, 반복되는 기준선과 같은 단서를 제공하고, 텍스트는 헤더, 구두점, 필드 유형과 같은 단서를 제공합니다. 그런 다음 결과 그래프를 선형화하거나 표와 키-값 구조로 변환합니다.
순서 관계 연구는 복잡한 페이지에서 하나의 순열만으로는 가능한 모든 관계를 표현할 수 없다고 주장합니다. 사이드바, 중첩 영역, 다단 구성 요소로 인해 여러 가지 읽기 경로가 가능할 때는 쌍별 순서 관계가 더 풍부한 구조를 보존할 수 있습니다.
양식에서 유용한 결과는 긴 문자열 하나가 아니라 라벨과 값, 체크박스와 질문 사이의 관계인 경우가 많습니다. 표에서는 직렬화 후에도 행과 열의 소속이 유지되어야 합니다. 따라서 읽기 순서는 단순히 추출된 텍스트를 읽기 좋게 만드는 것이 아니라 구조 복원을 지원합니다.
레이아웃 복원이 여전히 그럴듯한 오류를 만드는 경우
회전된 스캔, 병합 셀, 손글씨, 떠 있는 주석, 반복 헤더, 테두리 없는 표는 깔끔한 페이지에서 학습한 시각적 규칙을 무력화할 수 있습니다. 특히 인접한 필드에 서로 어울리는 날짜, 통화, 이름이 포함되어 있으면 모델이 열을 조용히 넘나들면서 유창한 순서를 만들어 낼 수 있습니다.
텍스트 및 레이아웃 모델링은 문서 이해를 위해 텍스트, 2차원 위치, 시각적 특징을 함께 모델링합니다. 이러한 결합은 좌표만으로는 충분하지 않은 이유를 설명하지만, 동시에 감지 또는 OCR 오류가 이후의 구조 예측을 오염시킬 수 있다는 뜻이기도 합니다.
여러 순서가 여전히 가능하거나 잘못된 연결이 레코드를 변경하는 문서에서는 오류가 발생할 수 있습니다. 이 경우 바운딩 박스와 페이지 이미지를 보존하고, 불확실성을 표시하며, 직렬화된 텍스트를 기준 데이터로 취급하지 말고 검토를 요구해야 합니다.
셀 및 필드 복원 테스트 실행
다단 텍스트, 병합 셀, 반복 헤더, 체크박스, 라벨과 값의 쌍이 포함된 대표 페이지 10개를 선택합니다. 의도한 읽기 순서와 각 표의 행·열 및 양식 연결 관계를 기록한 소규모 기준 데이터 세트를 만듭니다. 문자 오류율만이 아니라 구조화된 출력을 평가합니다.
구조화된 문서 검색에 설명된 근거 관리 원칙에 따라 복원된 텍스트와 원본 좌표를 모두 색인합니다. 페이지에 두 번 이상 나타나는 값을 검색하고, 모든 답변이 올바른 라벨, 행, 열, 페이지 영역을 가리키는지 확인합니다.
시스템이 기준 데이터의 관계를 보존하고 모호한 레이아웃을 표시하는 경우에만 통과로 판정합니다. OCR 점수가 높아도 필드가 뒤바뀐 문제를 보완할 수는 없습니다. 오류가 특정 템플릿에 집중된다면 해당 템플릿을 전문 파서나 사람의 검토로 보내야 합니다.
기술 및 AI 허브
더 읽어보기

비공개 검색 점수 보정: 원시 유사도가 활용 가능한 신뢰도 신호로 변환되는 과정
코사인 유사도가 신뢰도가 아닌 이유, 레이블이 지정된 쿼리로 점수를 보정하는 방법, 그리고 비공개 코퍼스가 변경될 때 임계값을 모니터링하는 방법을 알아보세요.

로컬 AI NUMA 로컬리티: 메모리 배치가 가속기 공급 속도를 바꾸는 이유
CPU, RAM, PCIe 토폴로지가 가속기 데이터 공급에 어떤 영향을 미치는지, 자동 배치 결과가 달라질 수 있는 이유, 그리고 NUMA 바인딩을 안전하게 벤치마킹하는 방법을 알아보세요.

모델 파일 메모리 매핑: 공유 페이지로 중복 RAM 사용량 줄이기
매핑된 모델 페이지가 어떻게 페이지 폴트되고 공유되는지, RSS가 오해를 불러일으킬 수 있는 이유와 프로세스별로 여전히 RAM을 사용하는 캐시 및 버퍼가 무엇인지 알아보세요.

