Waarom mist Vision Search kleine objecten nadat fotominiaturen opnieuw zijn gegenereerd?

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Visueel zoeken kan kleine objecten missen nadat miniaturen opnieuw zijn gegenereerd, wanneer het nieuwe voorbewerkingspad pixels of context verwijdert die eerder in de embedding waren gecodeerd.

Een familiefoto kan een fiets, label, huisdier of gereedschap bevatten dat slechts een klein deel van de oorspronkelijke afbeelding inneemt. Als een fotoservice voorbeelden opnieuw genereert met een andere uitsnede, oriëntatieregel, resolutie- of compressie-instelling, krijgt het visiemodel andere invoer, ook al blijft het oorspronkelijke bestand ongewijzigd. De effectieve objectgrootte en omliggende context bepalen of dat detail in de embedding behouden blijft.

De geometrie van miniaturen bepaalt hoeveel objectpixels behouden blijven

Visie-encoders schalen invoer doorgaans naar een vaste vierkante of rechthoekige tensor. Een klein object dat in het origineel 30 pixels inneemt, kan krimpen tot onder een bruikbare kenmerkschaal, terwijl een middelste uitsnede een object aan de rand volledig kan verwijderen.

gesegmenteerde inferentie voor kleine objecten deelt grote afbeeldingen vóór detectie op in overlappende gebieden, zodat kleine objecten bij de modelinvoer meer pixels behouden. De gerapporteerde verbeteringen laten zien dat het verkleinen van het volledige beeld nuttige details kan wissen, zelfs wanneer de oorspronkelijke resolutie hoog is.

Beleid voor passend maken, vullen en centreren bij uitsnijden is niet gelijkwaardig. Passend maken behoudt het volledige beeld met opvulling, vullen kan randen afsnijden en oriëntatieverwerking kan vóór of na het uitsnijden plaatsvinden. Regeneratie verandert de zoekresultaten wanneer een van deze bewerkingen afwijkt van de bewerkingen die voor de vorige embedding zijn gebruikt.

Multischaalkenmerken kunnen verwijderde pixels niet herstellen

Moderne visiesystemen combineren fijne ruimtelijke kaarten met diepere semantische kenmerken, waardoor objecten op meerdere schalen kunnen worden herkend. Die representatie begint echter nog steeds met de miniatuur die aan de encoder wordt aangeboden; informatie die tijdens het schalen of comprimeren is verwijderd, is niet beschikbaar voor latere lagen.

multischaal-kenmerkpiramides bouwen een top-down-kenmerkpiramide met laterale verbindingen, zodat semantisch sterke kenmerken op meerdere resoluties beschikbaar zijn. Dit verklaart waarom de herkenning van kleine objecten baat heeft bij fijne ruimtelijke kaarten in plaats van één grove representatie.

Een globale afbeeldingsembedding kan de dominante scène prioriteren en een klein voorwerp negeren, zelfs wanneer een detector het wel kan vinden. Zoekpijplijnen die objectniveau-recall nodig hebben, kunnen naast één vector voor de volledige miniatuur tegels, embeddings van regio's of bijschriften van gedetecteerde objecten vereisen.

Compressie en normalisatie verschuiven grensgevallen in overeenkomst

JPEG-kwantisatie, verscherping, kleurconversie, alfacompositie en resamplingfilters veranderen lokale randen en textuur. Grote objecten blijven semantisch stabiel, maar een klein object nabij de herkenningsdrempel van het model kan genoeg veranderen om onder de ophaaldrempel te vallen.

gerichte gebieden met hoge resolutie stuurt verwerking met hoge resolutie naar veelbelovende gebieden met kleine objecten, in plaats van overal een dure beeldpiramide toe te passen. Het coarse-to-fine-ontwerp laat zien dat het toewijzen van pixels aan de relevante regio de nauwkeurigheid kan behouden met minder totale verwerking.

De foutgrens ontstaat wanneer wordt aangenomen dat elk gewijzigd resultaat een defect aan de miniatuur is. Ook een nieuw embeddingmodel, een gewijzigde query-encoder, het opnieuw opbouwen van de index of concurrentie binnen de top-k kan rangschikkingen veranderen. Vergelijk oude en nieuwe miniaturen met hetzelfde bevroren model en dezelfde index voordat je de oorzaak vaststelt.

Voer een ophaaltest uit met het origineel en de miniatuur

Selecteer vijftig foto's met kleine objecten in het midden, aan de randen, in donkere gebieden en tegen drukke achtergronden. Bewaar de vorige miniaturen, genereer ze opnieuw en leg voor beide versies de afmetingen, uitsnijdvakken, oriëntatie, codec, kwaliteit, het kleurprofiel en de bestandshashes vast.

Gebruik de regiogerichte verwerkingsmethode in regiobewuste verwerking om embeddings van het oorspronkelijke beeld, de oude miniatuur, de nieuwe miniatuur en tegels te vergelijken met dezelfde zoekopdrachten en index. Houd het aantal objectpixels, de top-k-recall, rangverschuivingen en gemiste resultaten bij per locatie en objectgrootte.

Behoud opnieuw gegenereerde miniaturen alleen als ze voldoen aan de vereiste recall voor kleine objecten tegen de beoogde opslag- en verwerkingskosten. Als globale voorbeelden onvoldoende blijven, voeg dan regio-embeddings toe voor geselecteerde foto's in plaats van te beweren dat een hogere miniatuurresolutie objectzoekopdrachten gegarandeerd verbetert.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.