사진, 스크린샷, PDF 전반에서 멀티모달 검색을 가능하게 하는 기능은 무엇인가요?

에바 왕 는 기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

멀티모달 검색은 각 파일이 형식마다 고유한 시각적, 텍스트적, 공간적, 출처 관련 신호를 버리지 않으면서 서로 비교 가능한 증거가 될 때 작동합니다.

가족 기록 보관 자료에는 같은 구매를 설명하는 사진으로 찍은 영수증, 결제 확인 스크린샷, PDF 명세서가 함께 있을 수 있습니다. OCR은 단어를 찾지만 로고, 레이아웃, 객체, 라벨과 값 사이의 관계는 놓칠 수 있습니다. 유용한 형식 간 검색은 형식별 추출, 공유 임베딩, 영역 수준 인덱싱, 메타데이터 융합, 원본 자산으로 돌아갈 수 있는 링크를 결합합니다.

모달리티를 인식하는 수집 과정은 서로 다른 종류의 증거를 보존합니다

사진에는 방향, 객체, 장면, OCR 처리가 필요하고, 스크린샷은 인터페이스 텍스트와 아이콘을 중점적으로 다루며, PDF에는 페이지 렌더링과 기본 텍스트 및 레이아웃 추출이 필요합니다. 이 세 가지를 모두 일반 텍스트로 취급하면 문구가 불완전할 때 필요한 신호를 바로 제거하게 됩니다.

공유 이미지-텍스트 공간은 이미지와 텍스트 쌍으로부터 공유 공간을 학습하므로, 정확한 캡션이 없어도 텍스트 쿼리로 시각적 콘텐츠를 검색할 수 있습니다. 같은 원리는 형식 간 검색에도 적용되지만, 가정용 시스템에서는 정확한 이름, 날짜, 코드를 위해 여전히 OCR과 메타데이터가 필요합니다.

모든 파생 항목에는 자산 ID, 페이지 또는 영역 좌표, 파서 버전, 캡처 시간, 원본 경로를 유지해야 합니다. 이러한 필드를 사용하면 인터페이스가 일치한 영역을 강조 표시할 수 있고, 썸네일 임베딩이 추적할 수 없는 답변 출처가 되는 것을 방지할 수 있습니다.

영역과 페이지는 각각 검색 가능한 단위가 필요합니다

하나의 전체 이미지 벡터는 서로 관련 없는 여러 요소를 뭉뚱그릴 수 있습니다. 스크린샷에는 채팅, 상태 표시줄, 제품 사진이 함께 있을 수 있고, PDF 페이지에는 표 옆에 도표가 있을 수 있습니다. 영역 단위 자르기와 페이지 수준 단위는 지역적 의미를 검색 가능하게 유지합니다.

시각적 문서 검색 방법은 문서 페이지를 시각적으로 표현하고 지연 상호작용을 사용해 쿼리 토큰과 페이지 패치를 매칭합니다. 이 설계는 레이아웃이 풍부한 PDF를 모든 페이지를 하나의 전역 벡터로 축소하지 않고 검색하는 방법을 보여줍니다.

인덱싱 단위는 연속성이 필요한 경우에만 서로 겹치게 하고, 상위 항목의 권한과 출처 정보를 상속해야 합니다. 과도한 자르기는 중복 결과를 만들고, 지나치게 큰 페이지 단위는 정밀도를 낮춥니다. 중복 제거 계층은 검색 후 같은 자산에서 나온 영역을 하나로 묶을 수 있습니다.

융합과 재순위화는 서로 비교할 수 없는 신호를 조정합니다

텍스트 BM25, OCR 임베딩, 시각 임베딩, 파일 이름, 타임스탬프, 얼굴, 폴더 맥락은 서로 다른 척도의 점수를 생성합니다. 순위 융합은 독립적인 후보 목록을 결합하고, 멀티모달 재순위화 모델은 더 풍부한 맥락으로 가장 강력한 후보를 검토할 수 있습니다.

이미지-텍스트 정렬 목적 함수는 이미지와 텍스트의 정렬이 모델 아키텍처뿐 아니라 학습 목적 함수와 데이터 규모에도 좌우된다는 점을 보여줍니다. 이는 두 공유 임베딩 모델이 스크린샷과 사진의 순위를 서로 다르게 매길 수 있는 이유를 설명하는 데 도움이 됩니다.

실패가 발생하는 경계는 뒷받침되지 않은 모달리티 간 확신입니다. 시각적으로 유사한 로고만으로는 송장 총액을 입증할 수 없고, OCR 텍스트만으로는 이미지에 없는 객체를 식별할 수 없습니다. 결과에는 어떤 모달리티가 일치했는지 표시해야 하며, 점수 보정이 불안정할 때는 별도의 결과 그룹으로 나누어 제공해야 합니다.

형식 간 검색 매트릭스 구축

사진, 스크린샷, 디지털 생성 PDF, 스캔 PDF로 표현되는 실제 개념 30가지를 선택합니다. 텍스트, 시각, 파일 이름, 날짜, 혼합 쿼리를 작성한 다음, 허용 가능한 모든 자산과 이를 뒷받침하는 증거가 포함된 정확한 페이지 또는 영역에 라벨을 지정합니다.

스크린샷-사진 검색의 모달리티 구분을 사용해 스크린샷과 사진의 Recall@10 및 정밀도를 각각 보고합니다. OCR만 사용한 경우, 시각 임베딩만 사용한 경우, 메타데이터만 사용한 경우, 융합 검색, 멀티모달 재순위화를 각각 테스트하면서 지연 시간과 중복 결과 비율을 기록합니다.

각 주요 쿼리 유형이 검토 가능한 출처 영역을 검색하고 권한 필터가 그대로 유지될 때만 통과로 판정합니다. 융합으로 평균 재현율이 향상되더라도 정확한 코드 일치 결과가 가려진다면 모든 형식을 하나의 점수로 억지로 통합하지 말고 어휘 검색 경로를 유지해야 합니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.