이미지 해상도는 멀티모달 AI의 처리 부하를 변화시킵니다. 입력이 클수록 일반적으로 텍스트를 생성하기 전에 더 많은 시각적 패치, 크롭, 토큰, 어텐션 연산이 필요하기 때문입니다.
홈 AI 서버는 크기를 조정한 휴대폰 사진에는 빠르게 답할 수 있지만, 전체 해상도 스크린샷, 스캔한 페이지, 파노라마 또는 여러 이미지 요청에는 처리 속도가 느려질 수 있습니다. 원본 픽셀 수가 항상 언어 모델에 그대로 전달되는 것은 아닙니다. 비전 인코더가 이미지를 리사이즈하고, 크롭하고, 타일로 나눈 다음 시각적 토큰으로 변환합니다. 선택한 전처리 방식에 따라 세부 정보가 얼마나 유지되는지, 요청에 필요한 연산량·메모리·컨텍스트 공간·대기 시간이 결정됩니다.
비전 트랜스포머는 픽셀을 패치 토큰으로 변환합니다
비전 인코더는 일반적으로 이미지를 고정된 크기의 패치로 나누고, 각 패치를 임베딩으로 변환한 뒤, 그 결과로 만들어진 시퀀스를 트랜스포머 레이어로 처리합니다.
Vision Transformer 논문은 이미지를 하나로 나눌 수 없는 입력이 아니라 패치 시퀀스로 다룹니다.
패치 크기가 고정되어 있다면 이미지의 너비와 높이를 모두 늘릴수록 이미지 면적에 비례해 패치 수가 증가합니다. 따라서 각 차원을 두 배로 늘리면 이후 풀링이나 압축을 적용하기 전에 원시 패치 수가 대략 네 배가 될 수 있습니다.
전처리는 픽셀을 리사이즈로 제거하거나 타일링으로 보존할 수 있습니다
일부 파이프라인은 모든 이미지를 하나의 고정된 인코더 해상도로 리사이즈합니다. 이 경우 토큰 수는 일정하게 유지되지만, 다운샘플링 과정에서 작은 글자와 세밀한 물체가 사라질 수 있습니다.
LLaVA-UHD는 원본 해상도 슬라이싱을 사용해 큰 이미지를 가변 크기의 영역으로 나누고, 그 결과 생성된 시각적 토큰을 구성합니다.
타일링은 여러 크롭을 처리해 국소적인 세부 정보를 보존하지만, 크롭이 추가될 때마다 비전 인코더 작업이 반복되고 언어 모델에 전달되는 토큰 또는 압축된 특징이 늘어납니다.
같은 메가픽셀 수를 가진 두 파일도 화면비와 런타임의 격자 선택 규칙에 따라 필요한 타일 수가 달라지므로 서로 다른 크롭 배치를 생성할 수 있습니다.
높은 해상도는 언어 모델 내부의 시각적 토큰 수를 늘릴 수 있습니다
비전 인코딩이 끝나면 프로젝터가 이미지 특징을 언어 모델과 호환되는 토큰으로 변환합니다. 이러한 토큰은 사용자의 텍스트와 생성되는 답변과 함께 컨텍스트 위치를 차지합니다.
LLaVA-OneVision은 지원 해상도가 높아질수록 AnyRes 단계에서 시각적 토큰 수가 증가한다고 보고합니다.
시각적 토큰이 많아지면 프롬프트 프리필 작업량과 KV 캐시 수요가 증가하고, 사용자 지시나 검색된 문서 대신 이미지가 차지하는 컨텍스트도 커집니다.
따라서 비전 인코더가 자체 작업을 마친 뒤에도 고해상도 이미지가 언어 처리 측면의 속도를 늦출 수 있습니다.
어텐션 비용은 토큰 압축이 이루어지는 위치에 따라 달라집니다
비전 인코더가 모든 패치를 전체 셀프 어텐션으로 처리한다면 패치 수가 늘어날수록 내부 처리 비용이 빠르게 증가할 수 있습니다. 언어 모델이 모든 시각적 토큰을 입력받는다면 멀티모달 프리필 비용도 커집니다.
고해상도 가속 연구에 따르면 AnyRes는 저해상도 처리보다 3~5배 더 많은 토큰을 생성할 수 있습니다.
토큰 풀링, 리샘플링, 학습된 압축, 선택적 크롭 재처리를 사용하면 언어 모델에 도달하기 전에 시퀀스 길이를 줄일 수 있습니다. 연산 절감 효과는 비용이 큰 단계 전후 중 어느 시점에 압축이 이루어지는지에 따라 달라집니다.
해상도 부담은 홈 AI의 동시 처리 용량을 줄입니다
대형 이미지 요청은 비전 인코더 메모리, 임시 이미지 텐서, 언어 모델 KV 캐시, 가속기 시간을 점유하는 동안 다른 가족 구성원의 채팅 요청을 대기시킬 수 있습니다.
LLaVA-Mini는 중복된 이미지 토큰이 멀티모달 추론 비용을 높이기 때문에 시각적 토큰 압축을 연구합니다.
ZimaSpace의 로컬 AI 개요에 따르면 로컬 AI 처리 용량은 AI라는 명칭 자체보다 워크로드 유형에 따라 달라집니다.
여러 텍스트 채팅을 지원하는 서버라도 동시 이미지 요청은 더 적게 처리할 수 있으며, 특히 각 이미지가 고세부 타일링 모드를 사용할 때 그럴 수 있습니다.
작업에서 보존해야 하는 근거에 맞춰 해상도를 선택하세요
장면 분류, 중복 검출, 광범위한 사진 태깅은 이미지를 크게 축소한 뒤에도 작동할 수 있습니다. 반면 OCR, 다이어그램, UI 스크린샷, 영수증, 작은 물체 검사는 더 많은 세부 정보나 대상별 크롭이 필요한 경우가 많습니다.
CARES는 적응형 해상도 선택을 통해 모든 이미지를 사용 가능한 최고 해상도로 처리하지 않아도 된다는 점을 보여줍니다.
같은 이미지와 질문을 사용해 여러 해상도를 테스트하세요. 답변 정확도, OCR 완성도, 시각적 토큰 수, 최대 메모리 사용량, 첫 토큰까지의 시간, 다른 동시 채팅에 미치는 영향을 기록하세요.
유용한 설정은 워크플로에 필요한 근거를 보존하는 가장 낮은 해상도 또는 크롭 방식입니다. 모델이 더 나은 작업 결과로 변환할 수 있을 때에만 더 많은 픽셀이 가치가 있습니다.
기술 및 AI 허브
더 읽어보기

계절에 따른 생활 패턴 변화 후 스마트 홈 예측이 부정확해지는 이유는 무엇인가요?
계절에 따른 생활 패턴의 변화는 시간, 센서, 재실 여부, 원하는 동작 간의 관계를 바꾸어, 과거 습관을 기반으로 학습한 모델을 낡게 만듭니다.

객체 추적을 활성화하면 가정용 NVR이 짧은 이벤트를 놓치는 이유는 무엇인가요?
추적을 시작하고 궤적을 확인하려면 충분한 감지가 필요하므로, 짧게 나타난 객체는 NVR이 유효한 이벤트를 생성하기 전에 사라질 수 있습니다.

모델 업그레이드 후 AI 사진 라벨이 바뀌는 이유는 무엇인가요?
모델 업그레이드는 레이블을 할당하는 데 사용되는 표현과 순위를 변경하므로, 동일한 사진도 서로 다른 의미적 또는 신뢰도 경계를 넘을 수 있습니다.

