사진 썸네일을 다시 생성한 후 비전 검색에서 작은 개체를 놓치는 이유는 무엇인가요?

에바 왕 는 기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

썸네일 재생성 후 새로운 전처리 경로에서 임베딩에 이전에 인코딩된 픽셀이나 맥락을 제거하면 비전 검색에서 작은 객체를 놓칠 수 있습니다.

가족사진에는 원본 이미지에서 아주 작은 영역만 차지하는 자전거, 라벨, 반려동물 또는 도구가 포함될 수 있습니다. 사진 서비스가 다른 크롭, 방향 처리 규칙, 해상도 또는 압축 설정으로 미리보기를 재생성하면 원본 파일이 변경되지 않았더라도 비전 모델에는 다른 입력이 전달됩니다. 객체의 유효 크기와 주변 맥락에 따라 해당 세부 정보가 임베딩에 남을지가 결정됩니다.

썸네일 기하 구조가 살아남는 객체 픽셀 수를 결정합니다

비전 인코더는 일반적으로 입력을 고정된 정사각형 또는 직사각형 텐서로 크기 조정합니다. 원본에서 30픽셀을 차지하던 작은 객체는 유용한 특징 스케일 아래로 축소될 수 있으며, 중앙 크롭을 적용하면 가장자리의 객체가 완전히 제거될 수 있습니다.

슬라이스 기반 작은 객체 추론은 검출 전에 큰 이미지를 서로 겹치는 영역으로 나누어 작은 객체가 모델 입력에서 더 많은 픽셀을 유지하도록 합니다. 보고된 성능 향상은 원본 해상도가 높더라도 전체 프레임 축소가 유용한 세부 정보를 없앨 수 있음을 보여줍니다.

맞춤, 채우기, 중앙 크롭 정책은 서로 동일하지 않습니다. 맞춤은 패딩을 사용해 전체 프레임을 보존하고, 채우기는 경계를 자를 수 있으며, 방향 처리는 크롭 전이나 후에 이미지를 회전할 수 있습니다. 이러한 작업 중 하나라도 이전 임베딩 생성에 사용된 방식과 달라지면 재생성으로 인해 검색 결과가 달라집니다.

다중 스케일 특징도 버려진 픽셀을 복구할 수는 없습니다

최신 비전 시스템은 세밀한 공간 맵과 더 깊은 의미 특징을 결합하여 여러 스케일의 객체를 인식하는 데 도움을 줍니다. 하지만 이러한 표현도 인코더에 제공된 썸네일에서 시작하므로 크기 조정이나 압축 과정에서 제거된 정보는 이후 레이어에서 사용할 수 없습니다.

다중 스케일 특징 피라미드는 측면 연결이 포함된 하향식 특징 피라미드를 구축하여 여러 해상도에서 의미적으로 강한 특징을 제공합니다. 이 방식은 작은 객체 인식이 하나의 거친 표현보다 세밀한 공간 맵의 이점을 얻는 이유를 설명합니다.

전역 이미지 임베딩은 작은 항목이 검출기로는 발견될 수 있더라도 주요 장면을 우선시하고 해당 항목을 무시할 수 있습니다. 객체 수준 재현율이 필요한 검색 파이프라인에는 전체 썸네일 벡터 하나뿐 아니라 타일, 영역 임베딩 또는 검출된 객체 캡션이 필요할 수 있습니다.

압축과 정규화가 경계선상의 유사도를 바꿉니다

JPEG 양자화, 선명화, 색상 변환, 알파 합성 및 리샘플링 필터는 국소적인 가장자리와 텍스처를 변경합니다. 큰 객체는 의미적으로 안정적인 상태를 유지하지만, 모델의 인식 임계값에 가까운 작은 객체는 검색 컷오프 아래로 떨어질 만큼 크게 변할 수 있습니다.

집중형 고해상도 영역은 모든 곳에 비용이 많이 드는 이미지 피라미드를 적용하는 대신 유망한 작은 객체 영역에 고해상도 처리를 집중합니다. 이러한 거친 단계에서 세밀한 단계로 진행하는 설계는 관련 영역에 픽셀을 할당하면 전체 처리량을 줄이면서도 정확도를 유지할 수 있음을 보여줍니다.

모든 변경된 결과를 썸네일 결함으로 단정하는 것이 문제의 경계입니다. 새로운 임베딩 모델, 변경된 쿼리 인코더, 인덱스 재구축 또는 top-k 경쟁도 순위를 바꿀 수 있습니다. 원인을 판단하기 전에 동일한 고정 모델과 인덱스를 사용해 이전 썸네일과 새 썸네일을 비교하세요.

원본과 썸네일의 검색 성능을 테스트하세요

중앙, 가장자리, 어두운 영역 및 복잡한 배경에 작은 객체가 포함된 사진 50장을 선택하세요. 이전 썸네일을 저장하고 새로 재생성한 다음, 두 버전의 크기, 크롭 상자, 방향, 코덱, 품질, 색상 프로필 및 파일 해시를 기록하세요.

영역 인식 처리의 영역 처리 방법을 사용하여 동일한 쿼리와 인덱스로 원본 이미지, 이전 썸네일, 새 썸네일 및 타일 임베딩을 비교하세요. 객체 픽셀 수, top-k 재현율, 순위 변동 및 위치와 객체 크기별 누락을 추적하세요.

의도한 저장 공간과 연산 비용에서 필요한 작은 객체 재현율을 충족하는 경우에만 재생성된 썸네일을 유지하세요. 전역 미리보기로 충분하지 않다면 더 높은 썸네일 해상도가 객체 검색을 보장한다고 주장하는 대신, 선택한 사진에 영역 임베딩을 추가하세요.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.