Porque é que a pesquisa visual não deteta objetos pequenos depois de as miniaturas das fotografias serem regeneradas?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

A pesquisa visual pode não detetar objetos pequenos após a regeneração das miniaturas, quando o novo processo de pré-processamento remove píxeis ou contexto anteriormente codificados pelo embedding.

Uma fotografia de família pode conter uma bicicleta, uma etiqueta, um animal de estimação ou uma ferramenta que ocupa apenas uma pequena região da imagem original. Se um serviço de fotografias regenerar as pré-visualizações com um corte, uma regra de orientação, uma resolução ou uma definição de compressão diferentes, o modelo de visão recebe uma entrada diferente, apesar de o ficheiro original permanecer inalterado. O tamanho efetivo do objeto e o contexto circundante determinam se esse detalhe sobrevive ao embedding.

A Geometria da Miniatura Determina Quantos Píxeis do Objeto Sobrevivem

Os codificadores de visão redimensionam normalmente uma entrada para um tensor quadrado ou retangular de tamanho fixo. Um objeto pequeno que ocupa 30 píxeis na imagem original pode diminuir para menos do que uma escala de funcionalidades útil, enquanto um corte centrado pode remover completamente um objeto junto à margem.

a inferência com recortes para objetos pequenos divide imagens grandes em regiões sobrepostas antes da deteção, para que os objetos pequenos mantenham mais píxeis na entrada do modelo. Os ganhos apresentados demonstram que reduzir a imagem inteira pode eliminar detalhes úteis, mesmo quando a resolução original é elevada.

As políticas de ajustar, preencher e cortar ao centro não são equivalentes. Ajustar preserva todo o enquadramento com margens, preencher pode cortar as extremidades e o tratamento da orientação pode rodar a imagem antes ou depois do corte. A regeneração altera a pesquisa quando qualquer uma destas operações difere das utilizadas no embedding anterior.

As Funcionalidades Multiescala Não Podem Recuperar Píxeis Eliminados

Os sistemas de visão modernos combinam mapas espaciais finos com funcionalidades semânticas mais profundas, ajudando a reconhecer objetos em várias escalas. Ainda assim, essa representação começa pela miniatura apresentada ao codificador; a informação removida durante o redimensionamento ou a compressão não fica disponível para as camadas posteriores.

as pirâmides de funcionalidades multiescala criam uma pirâmide de funcionalidades de cima para baixo com ligações laterais, para que existam funcionalidades semanticamente fortes em várias resoluções. O mecanismo explica por que motivo o reconhecimento de objetos pequenos beneficia de mapas espaciais finos, em vez de uma única representação grosseira.

Um embedding global da imagem pode dar prioridade à cena dominante e ignorar um item minúsculo, mesmo quando um detetor consegue encontrá-lo. Os pipelines de pesquisa que necessitam de uma recuperação eficaz ao nível dos objetos podem precisar de mosaicos, embeddings de regiões ou legendas de objetos detetados, além de um único vetor de toda a miniatura.

A Compressão e a Normalização Alteram as Similaridades Limítrofes

A quantização JPEG, a nitidez, a conversão de cor, a composição alfa e os filtros de reamostragem alteram as arestas locais e a textura. Os objetos grandes permanecem semanticamente estáveis, mas um objeto pequeno próximo do limiar de reconhecimento do modelo pode alterar-se o suficiente para ficar abaixo do limite de recuperação.

as regiões focadas de alta resolução direcionam o processamento de alta resolução para regiões promissoras com objetos pequenos, em vez de aplicar uma pirâmide de imagens dispendiosa em todo o lado. O seu desenho do geral para o específico mostra que atribuir píxeis à região relevante pode preservar a precisão com menos processamento total.

O erro está em assumir que todos os resultados alterados são um defeito da miniatura. Um novo modelo de embedding, um codificador de consultas alterado, uma reconstrução do índice ou a concorrência entre resultados do top-k também podem alterar as classificações. Compare as miniaturas antigas e novas através do mesmo modelo e índice congelados antes de atribuir a causa.

Execute um Teste de Recuperação entre a Imagem Original e a Miniatura

Selecione cinquenta fotografias que contenham objetos pequenos no centro, junto às margens, em regiões escuras e sobre fundos visualmente complexos. Guarde as miniaturas anteriores, regenere-as e registe as dimensões, as caixas de corte, a orientação, o codec, a qualidade, o perfil de cor e os hashes dos ficheiros para ambas as versões.

Utilize o método de processamento de regiões descrito em processamento sensível às regiões para comparar embeddings da imagem original, da miniatura antiga, da miniatura nova e de imagens em mosaico, utilizando as mesmas consultas e o mesmo índice. Registe os píxeis do objeto, a recuperação do top-k, as alterações de posição e as falhas por localização e tamanho do objeto.

Conserve as miniaturas regeneradas apenas se cumprirem a recuperação necessária de objetos pequenos com o custo de armazenamento e computação pretendido. Se as pré-visualizações globais continuarem a ser insuficientes, adicione embeddings de regiões a fotografias selecionadas, em vez de afirmar que uma resolução superior da miniatura garante a pesquisa de objetos.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.