이미지 해상도가 멀티모달 홈 AI 부하를 변화시키는 이유

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

이미지 해상도는 멀티모달 AI의 처리 부하를 변화시킵니다. 입력이 클수록 일반적으로 텍스트를 생성하기 전에 더 많은 시각적 패치, 크롭, 토큰, 어텐션 연산이 필요하기 때문입니다.

홈 AI 서버는 크기를 조정한 휴대폰 사진에는 빠르게 답할 수 있지만, 전체 해상도 스크린샷, 스캔한 페이지, 파노라마 또는 여러 이미지 요청에는 처리 속도가 느려질 수 있습니다. 원본 픽셀 수가 항상 언어 모델에 그대로 전달되는 것은 아닙니다. 비전 인코더가 이미지를 리사이즈하고, 크롭하고, 타일로 나눈 다음 시각적 토큰으로 변환합니다. 선택한 전처리 방식에 따라 세부 정보가 얼마나 유지되는지, 요청에 필요한 연산량·메모리·컨텍스트 공간·대기 시간이 결정됩니다.

비전 트랜스포머는 픽셀을 패치 토큰으로 변환합니다

비전 인코더는 일반적으로 이미지를 고정된 크기의 패치로 나누고, 각 패치를 임베딩으로 변환한 뒤, 그 결과로 만들어진 시퀀스를 트랜스포머 레이어로 처리합니다.

Vision Transformer 논문은 이미지를 하나로 나눌 수 없는 입력이 아니라 패치 시퀀스로 다룹니다.

패치 크기가 고정되어 있다면 이미지의 너비와 높이를 모두 늘릴수록 이미지 면적에 비례해 패치 수가 증가합니다. 따라서 각 차원을 두 배로 늘리면 이후 풀링이나 압축을 적용하기 전에 원시 패치 수가 대략 네 배가 될 수 있습니다.

전처리는 픽셀을 리사이즈로 제거하거나 타일링으로 보존할 수 있습니다

일부 파이프라인은 모든 이미지를 하나의 고정된 인코더 해상도로 리사이즈합니다. 이 경우 토큰 수는 일정하게 유지되지만, 다운샘플링 과정에서 작은 글자와 세밀한 물체가 사라질 수 있습니다.

LLaVA-UHD는 원본 해상도 슬라이싱을 사용해 큰 이미지를 가변 크기의 영역으로 나누고, 그 결과 생성된 시각적 토큰을 구성합니다.

타일링은 여러 크롭을 처리해 국소적인 세부 정보를 보존하지만, 크롭이 추가될 때마다 비전 인코더 작업이 반복되고 언어 모델에 전달되는 토큰 또는 압축된 특징이 늘어납니다.

같은 메가픽셀 수를 가진 두 파일도 화면비와 런타임의 격자 선택 규칙에 따라 필요한 타일 수가 달라지므로 서로 다른 크롭 배치를 생성할 수 있습니다.

높은 해상도는 언어 모델 내부의 시각적 토큰 수를 늘릴 수 있습니다

비전 인코딩이 끝나면 프로젝터가 이미지 특징을 언어 모델과 호환되는 토큰으로 변환합니다. 이러한 토큰은 사용자의 텍스트와 생성되는 답변과 함께 컨텍스트 위치를 차지합니다.

LLaVA-OneVision은 지원 해상도가 높아질수록 AnyRes 단계에서 시각적 토큰 수가 증가한다고 보고합니다.

시각적 토큰이 많아지면 프롬프트 프리필 작업량과 KV 캐시 수요가 증가하고, 사용자 지시나 검색된 문서 대신 이미지가 차지하는 컨텍스트도 커집니다.

따라서 비전 인코더가 자체 작업을 마친 뒤에도 고해상도 이미지가 언어 처리 측면의 속도를 늦출 수 있습니다.

-15% OFF

어텐션 비용은 토큰 압축이 이루어지는 위치에 따라 달라집니다

비전 인코더가 모든 패치를 전체 셀프 어텐션으로 처리한다면 패치 수가 늘어날수록 내부 처리 비용이 빠르게 증가할 수 있습니다. 언어 모델이 모든 시각적 토큰을 입력받는다면 멀티모달 프리필 비용도 커집니다.

고해상도 가속 연구에 따르면 AnyRes는 저해상도 처리보다 3~5배 더 많은 토큰을 생성할 수 있습니다.

토큰 풀링, 리샘플링, 학습된 압축, 선택적 크롭 재처리를 사용하면 언어 모델에 도달하기 전에 시퀀스 길이를 줄일 수 있습니다. 연산 절감 효과는 비용이 큰 단계 전후 중 어느 시점에 압축이 이루어지는지에 따라 달라집니다.

해상도 부담은 홈 AI의 동시 처리 용량을 줄입니다

대형 이미지 요청은 비전 인코더 메모리, 임시 이미지 텐서, 언어 모델 KV 캐시, 가속기 시간을 점유하는 동안 다른 가족 구성원의 채팅 요청을 대기시킬 수 있습니다.

LLaVA-Mini는 중복된 이미지 토큰이 멀티모달 추론 비용을 높이기 때문에 시각적 토큰 압축을 연구합니다.

ZimaSpace의 로컬 AI 개요에 따르면 로컬 AI 처리 용량은 AI라는 명칭 자체보다 워크로드 유형에 따라 달라집니다.

여러 텍스트 채팅을 지원하는 서버라도 동시 이미지 요청은 더 적게 처리할 수 있으며, 특히 각 이미지가 고세부 타일링 모드를 사용할 때 그럴 수 있습니다.

작업에서 보존해야 하는 근거에 맞춰 해상도를 선택하세요

장면 분류, 중복 검출, 광범위한 사진 태깅은 이미지를 크게 축소한 뒤에도 작동할 수 있습니다. 반면 OCR, 다이어그램, UI 스크린샷, 영수증, 작은 물체 검사는 더 많은 세부 정보나 대상별 크롭이 필요한 경우가 많습니다.

CARES는 적응형 해상도 선택을 통해 모든 이미지를 사용 가능한 최고 해상도로 처리하지 않아도 된다는 점을 보여줍니다.

같은 이미지와 질문을 사용해 여러 해상도를 테스트하세요. 답변 정확도, OCR 완성도, 시각적 토큰 수, 최대 메모리 사용량, 첫 토큰까지의 시간, 다른 동시 채팅에 미치는 영향을 기록하세요.

유용한 설정은 워크플로에 필요한 근거를 보존하는 가장 낮은 해상도 또는 크롭 방식입니다. 모델이 더 나은 작업 결과로 변환할 수 있을 때에만 더 많은 픽셀이 가치가 있습니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.