A resolução da imagem altera a carga da IA multimodal, porque as entradas maiores geralmente criam mais patches visuais, recortes, tokens e operações de atenção antes da geração de texto.
Um servidor de IA doméstico pode responder rapidamente a partir de uma fotografia de telemóvel redimensionada, mas ficar mais lento com uma captura de ecrã de resolução total, uma página digitalizada, um panorama ou um pedido com várias imagens. A contagem original de píxeis nem sempre é transmitida diretamente ao modelo de linguagem; um codificador visual redimensiona, recorta, divide em mosaicos e converte a imagem em tokens visuais. A estratégia de pré-processamento selecionada determina quanto detalhe fino é preservado e quanto poder de processamento, memória, espaço de contexto e tempo de fila o pedido consome.
Os Vision Transformers convertem píxeis em tokens de patches
Um codificador visual divide normalmente uma imagem em patches de tamanho fixo, projeta cada patch numa incorporação e processa a sequência resultante com camadas de transformer.
O artigo sobre Vision Transformer trata uma imagem como uma sequência de patches, em vez de uma entrada indivisível.
Com um tamanho de patch fixo, aumentar a largura e a altura da imagem cria mais patches proporcionalmente à área da imagem. Duplicar cada dimensão pode, assim, produzir aproximadamente quatro vezes mais patches brutos antes de qualquer agrupamento ou compressão posterior.
O pré-processamento pode eliminar píxeis ao redimensionar ou preservá-los através da divisão em mosaicos
Alguns pipelines redimensionam todas as imagens para uma resolução fixa do codificador. A contagem de tokens mantém-se estável, mas textos pequenos e objetos detalhados podem desaparecer durante a redução da resolução.
O LLaVA-UHD utiliza o fatiamento na resolução nativa para dividir imagens grandes em secções de tamanho variável e organizar os tokens visuais resultantes.
A divisão em mosaicos preserva o detalhe local ao processar vários recortes, mas cada recorte adicional repete o trabalho do codificador visual e contribui com tokens ou características comprimidas para o modelo de linguagem.
Dois ficheiros com a mesma contagem de megapíxeis também podem produzir disposições de recortes diferentes, porque a proporção da imagem e as regras de seleção da grelha do ambiente de execução alteram o número de mosaicos necessários.
Uma resolução mais elevada pode multiplicar os tokens visuais dentro do modelo de linguagem
Após a codificação visual, um projetor converte as características da imagem em tokens compatíveis com o modelo de linguagem. Esses tokens ocupam posições de contexto juntamente com o texto do utilizador e a resposta gerada.
O LLaVA-OneVision indica que as suas fases AnyRes aumentam as contagens de tokens visuais à medida que aumenta a resolução suportada.
Mais tokens visuais aumentam o trabalho de pré-preenchimento do prompt, a necessidade de cache KV e a quantidade de contexto disponibilizada à imagem, em vez de às instruções do utilizador ou aos documentos obtidos.
Assim, uma imagem de alta resolução pode tornar mais lenta a componente de linguagem, mesmo depois de o codificador visual ter concluído o seu próprio trabalho.
O custo da atenção depende do momento em que ocorre a compressão dos tokens
Se o codificador visual processar cada patch com atenção própria completa, o seu custo interno pode aumentar rapidamente à medida que cresce a contagem de patches. Se o modelo de linguagem receber todos os tokens visuais, o pré-preenchimento multimodal também aumenta.
A investigação sobre aceleração de alta resolução observa que o AnyRes pode criar três a cinco vezes mais tokens do que o processamento de resolução mais baixa.
O agrupamento de tokens, a reamostragem, a compressão aprendida e o reprocessamento seletivo de recortes podem reduzir a sequência antes de esta chegar ao modelo de linguagem. A poupança de processamento depende de a compressão ocorrer antes ou depois da fase dispendiosa.
A exigência de resolução reduz a capacidade de IA doméstica simultânea
Um pedido com uma imagem grande pode ocupar memória do codificador visual, tensores de imagem temporários, cache KV do modelo de linguagem e tempo do acelerador, enquanto outros chats domésticos aguardam.
O LLaVA-Mini explora a compressão de tokens visuais, porque os tokens de imagem redundantes aumentam o custo da inferência multimodal.
A visão geral de IA local da ZimaSpace observa que a capacidade de IA local depende do tipo de carga de trabalho, e não apenas da designação de IA.
Um servidor que suporte vários chats de texto pode aceitar menos pedidos de imagens simultâneos, especialmente quando cada imagem utiliza um modo de divisão em mosaicos com elevado nível de detalhe.
Escolha a resolução com base nas evidências que a tarefa tem de preservar
A classificação de cenas, a deteção de duplicados e a etiquetagem geral de fotografias podem funcionar após um redimensionamento agressivo. O OCR, os diagramas, as capturas de ecrã de interfaces, os recibos e a inspeção de objetos pequenos exigem frequentemente mais detalhe ou recortes direcionados.
O CARES demonstra que a seleção adaptativa da resolução pode evitar processar todas as imagens na resolução mais elevada disponível.
Teste várias resoluções com as mesmas imagens e perguntas. Registe a precisão das respostas, a completude do OCR, a contagem de tokens visuais, a memória de pico, o tempo até ao primeiro token e o efeito noutro chat simultâneo.
A definição mais útil é a resolução ou estratégia de recorte mais baixa que preserve as evidências necessárias ao fluxo de trabalho. Mais píxeis só são valiosos quando o modelo consegue convertê-los em melhores resultados para a tarefa.
Centro de Tecnologia e IA
Mais para Ler

Porque é que as previsões da casa inteligente se tornam menos precisas após mudanças sazonais na rotina?
As rotinas sazonais alteram a relação entre o tempo, os sensores, a ocupação e as ações pretendidas, tornando obsoleto um modelo treinado com hábitos...

Porque é que um NVR doméstico não regista eventos breves quando o seguimento de objetos está ativado?
O seguimento precisa de deteções suficientes para iniciar e confirmar uma trajetória, pelo que um objeto que apareça brevemente pode desaparecer antes de o...

Porque é que as etiquetas de fotografias geradas por IA mudam após uma atualização do modelo?
Uma atualização do modelo altera a representação e a classificação utilizadas para atribuir etiquetas, pelo que a mesma fotografia pode ultrapassar diferentes limites semânticos...

