A pesquisa visual pode não detetar objetos pequenos após a regeneração das miniaturas, quando o novo processo de pré-processamento remove píxeis ou contexto anteriormente codificados pelo embedding.
Uma fotografia de família pode conter uma bicicleta, uma etiqueta, um animal de estimação ou uma ferramenta que ocupa apenas uma pequena região da imagem original. Se um serviço de fotografias regenerar as pré-visualizações com um corte, uma regra de orientação, uma resolução ou uma definição de compressão diferentes, o modelo de visão recebe uma entrada diferente, apesar de o ficheiro original permanecer inalterado. O tamanho efetivo do objeto e o contexto circundante determinam se esse detalhe sobrevive ao embedding.
A Geometria da Miniatura Determina Quantos Píxeis do Objeto Sobrevivem
Os codificadores de visão redimensionam normalmente uma entrada para um tensor quadrado ou retangular de tamanho fixo. Um objeto pequeno que ocupa 30 píxeis na imagem original pode diminuir para menos do que uma escala de funcionalidades útil, enquanto um corte centrado pode remover completamente um objeto junto à margem.
a inferência com recortes para objetos pequenos divide imagens grandes em regiões sobrepostas antes da deteção, para que os objetos pequenos mantenham mais píxeis na entrada do modelo. Os ganhos apresentados demonstram que reduzir a imagem inteira pode eliminar detalhes úteis, mesmo quando a resolução original é elevada.
As políticas de ajustar, preencher e cortar ao centro não são equivalentes. Ajustar preserva todo o enquadramento com margens, preencher pode cortar as extremidades e o tratamento da orientação pode rodar a imagem antes ou depois do corte. A regeneração altera a pesquisa quando qualquer uma destas operações difere das utilizadas no embedding anterior.
As Funcionalidades Multiescala Não Podem Recuperar Píxeis Eliminados
Os sistemas de visão modernos combinam mapas espaciais finos com funcionalidades semânticas mais profundas, ajudando a reconhecer objetos em várias escalas. Ainda assim, essa representação começa pela miniatura apresentada ao codificador; a informação removida durante o redimensionamento ou a compressão não fica disponível para as camadas posteriores.
as pirâmides de funcionalidades multiescala criam uma pirâmide de funcionalidades de cima para baixo com ligações laterais, para que existam funcionalidades semanticamente fortes em várias resoluções. O mecanismo explica por que motivo o reconhecimento de objetos pequenos beneficia de mapas espaciais finos, em vez de uma única representação grosseira.
Um embedding global da imagem pode dar prioridade à cena dominante e ignorar um item minúsculo, mesmo quando um detetor consegue encontrá-lo. Os pipelines de pesquisa que necessitam de uma recuperação eficaz ao nível dos objetos podem precisar de mosaicos, embeddings de regiões ou legendas de objetos detetados, além de um único vetor de toda a miniatura.
A Compressão e a Normalização Alteram as Similaridades Limítrofes
A quantização JPEG, a nitidez, a conversão de cor, a composição alfa e os filtros de reamostragem alteram as arestas locais e a textura. Os objetos grandes permanecem semanticamente estáveis, mas um objeto pequeno próximo do limiar de reconhecimento do modelo pode alterar-se o suficiente para ficar abaixo do limite de recuperação.
as regiões focadas de alta resolução direcionam o processamento de alta resolução para regiões promissoras com objetos pequenos, em vez de aplicar uma pirâmide de imagens dispendiosa em todo o lado. O seu desenho do geral para o específico mostra que atribuir píxeis à região relevante pode preservar a precisão com menos processamento total.
O erro está em assumir que todos os resultados alterados são um defeito da miniatura. Um novo modelo de embedding, um codificador de consultas alterado, uma reconstrução do índice ou a concorrência entre resultados do top-k também podem alterar as classificações. Compare as miniaturas antigas e novas através do mesmo modelo e índice congelados antes de atribuir a causa.
Execute um Teste de Recuperação entre a Imagem Original e a Miniatura
Selecione cinquenta fotografias que contenham objetos pequenos no centro, junto às margens, em regiões escuras e sobre fundos visualmente complexos. Guarde as miniaturas anteriores, regenere-as e registe as dimensões, as caixas de corte, a orientação, o codec, a qualidade, o perfil de cor e os hashes dos ficheiros para ambas as versões.
Utilize o método de processamento de regiões descrito em processamento sensível às regiões para comparar embeddings da imagem original, da miniatura antiga, da miniatura nova e de imagens em mosaico, utilizando as mesmas consultas e o mesmo índice. Registe os píxeis do objeto, a recuperação do top-k, as alterações de posição e as falhas por localização e tamanho do objeto.
Conserve as miniaturas regeneradas apenas se cumprirem a recuperação necessária de objetos pequenos com o custo de armazenamento e computação pretendido. Se as pré-visualizações globais continuarem a ser insuficientes, adicione embeddings de regiões a fotografias selecionadas, em vez de afirmar que uma resolução superior da miniatura garante a pesquisa de objetos.
Centro de Tecnologia e IA
Mais para Ler

Porque é que o consumo de energia da GPU aumenta bruscamente no início de um pedido de inferência local?
Veja como o aumento da frequência da GPU, o prefill do modelo, a inicialização do kernel, a alocação de memória e os intervalos de...

Porque é que a classificação da pesquisa vetorial muda quando são consultados vários segmentos de índice em conjunto?
Saiba como os limites de candidatos por segmento, os grafos aproximados, a calibração de pontuações, as atualizações e a consolidação alteram a classificação da...

Porque é que os grupos de deduplicação de fotografias se dividem depois de os metadados serem editados?
Veja como os hashes exatos, os hashes percetivos, a orientação EXIF, os carimbos de data e hora, os limiares e as versões do pipeline...

