Perché la ricerca visiva non rileva gli oggetti piccoli dopo la rigenerazione delle miniature delle foto?

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

La ricerca visiva può non individuare oggetti di piccole dimensioni dopo la rigenerazione delle miniature, quando il nuovo percorso di pre-elaborazione rimuove pixel o contesto precedentemente codificati dall'embedding.

Una foto di famiglia può contenere una bicicletta, un'etichetta, un animale domestico o un utensile che occupa solo una piccola regione dell'immagine originale. Se un servizio fotografico rigenera le anteprime con un ritaglio, una regola di orientamento, una risoluzione o un'impostazione di compressione diversi, il modello di visione riceve un input differente anche se il file originale rimane invariato. Le dimensioni effettive dell'oggetto e il contesto circostante determinano se quel dettaglio sopravvive nell'embedding.

La geometria della miniatura determina quanti pixel dell'oggetto sopravvivono

Gli encoder di visione normalmente ridimensionano l'input a un tensore quadrato o rettangolare di dimensioni fisse. Un oggetto piccolo che nell'originale occupa 30 pixel può ridursi al di sotto di una scala utile per le caratteristiche, mentre un ritaglio centrale può rimuovere completamente un oggetto ai bordi.

l'inferenza sezionata per oggetti piccoli divide le immagini grandi in regioni sovrapposte prima del rilevamento, in modo che gli oggetti piccoli mantengano più pixel all'input del modello. I miglioramenti riportati dimostrano che il ridimensionamento dell'intero fotogramma può cancellare dettagli utili anche quando la risoluzione originale è elevata.

Le politiche adatta, riempi e ritaglio centrale non sono equivalenti. Adatta conserva l'intero fotogramma aggiungendo margini, riempi può ritagliare i bordi e la gestione dell'orientamento può ruotare l'immagine prima o dopo il ritaglio. La rigenerazione modifica la ricerca quando una qualsiasi di queste operazioni differisce da quella usata per l'embedding precedente.

Le caratteristiche multiscala non possono recuperare i pixel scartati

I moderni sistemi di visione combinano mappe spaziali dettagliate con caratteristiche semantiche più profonde, contribuendo a riconoscere gli oggetti a diverse scale. Questa rappresentazione inizia comunque dalla miniatura presentata all'encoder; le informazioni rimosse durante il ridimensionamento o la compressione non sono disponibili nei livelli successivi.

le piramidi di caratteristiche multiscala costruiscono una piramide di caratteristiche dall'alto verso il basso con connessioni laterali, così da ottenere caratteristiche semanticamente solide a più risoluzioni. Il meccanismo spiega perché il riconoscimento di oggetti piccoli trae vantaggio da mappe spaziali dettagliate anziché da un'unica rappresentazione grossolana.

Un embedding globale dell'immagine può dare priorità alla scena dominante e ignorare un elemento minuscolo, anche quando un rilevatore è in grado di trovarlo. Le pipeline di ricerca che richiedono un'elevata capacità di individuazione a livello di oggetto possono aver bisogno di riquadri, embedding delle regioni o didascalie degli oggetti rilevati, oltre a un unico vettore della miniatura completa.

Compressione e normalizzazione spostano le similarità al limite

La quantizzazione JPEG, la nitidezza, la conversione dei colori, la composizione alfa e i filtri di ricampionamento modificano i bordi e le texture locali. Gli oggetti grandi rimangono semanticamente stabili, ma un oggetto piccolo vicino alla soglia di riconoscimento del modello può cambiare abbastanza da scendere al di sotto della soglia di recupero.

le regioni ad alta risoluzione mirate indirizzano l'elaborazione ad alta risoluzione verso le promettenti regioni con oggetti piccoli, invece di applicare ovunque una costosa piramide di immagini. Il design dal grossolano al fine dimostra che destinare pixel alla regione pertinente può preservare la precisione riducendo l'elaborazione complessiva.

Il limite dell'analisi consiste nell'assumere che ogni risultato cambiato sia un difetto della miniatura. Anche un nuovo modello di embedding, un encoder di query modificato, la ricostruzione dell'indice o la competizione nei primi k risultati possono modificare le classifiche. Confronta le miniature precedenti e nuove usando lo stesso modello congelato e lo stesso indice prima di attribuire la causa.

Esegui un test di recupero tra originale e miniatura

Seleziona cinquanta foto contenenti oggetti piccoli al centro, ai bordi, in regioni scure e su sfondi affollati. Salva le miniature precedenti, rigenerale e registra dimensioni, riquadri di ritaglio, orientamento, codec, qualità, profilo colore e hash dei file per entrambe le versioni.

Usa il metodo di elaborazione delle regioni descritto in elaborazione basata sulle regioni per confrontare gli embedding dell'immagine originale, della vecchia miniatura, della nuova miniatura e delle immagini suddivise in riquadri, usando le stesse query e lo stesso indice. Monitora i pixel dell'oggetto, il richiamo nei primi k risultati, gli spostamenti di posizione e i mancati rilevamenti in base alla posizione e alle dimensioni dell'oggetto.

Conserva le miniature rigenerate solo se raggiungono il richiamo richiesto per gli oggetti piccoli al costo di archiviazione e calcolo previsto. Se le anteprime globali rimangono insufficienti, aggiungi embedding delle regioni per le foto selezionate invece di sostenere che una risoluzione maggiore delle miniature garantisca la ricerca degli oggetti.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.