Die visuelle Suche kann kleine Objekte nach der Neugenerierung von Vorschaubildern übersehen, wenn der neue Vorverarbeitungspfad Pixel oder Kontext entfernt, die zuvor in der Einbettung codiert wurden.
Ein Familienfoto kann ein Fahrrad, Etikett, Haustier oder Werkzeug enthalten, das nur einen kleinen Bereich des Originalbilds einnimmt. Wenn ein Fotodienst Vorschauen mit einem anderen Zuschnitt, einer anderen Ausrichtungsregel, Auflösung oder Komprimierungseinstellung neu erzeugt, erhält das visuelle Modell eine andere Eingabe, obwohl die Originaldatei unverändert bleibt. Die effektive Objektgröße und der umgebende Kontext bestimmen, ob dieses Detail die Einbettung übersteht.
Die Geometrie des Vorschaubilds bestimmt, wie viele Objektpixel erhalten bleiben
Visuelle Encoder skalieren eine Eingabe normalerweise auf einen Tensor mit fester quadratischer oder rechteckiger Form. Ein kleines Objekt, das im Original 30 Pixel groß ist, kann unter eine nützliche Merkmalsgröße schrumpfen, während ein mittiger Zuschnitt ein Objekt am Rand vollständig entfernen kann.
Die Inferenz für kleine Objekte mit Bildaufteilung teilt große Bilder vor der Erkennung in überlappende Bereiche auf, damit kleine Objekte am Modelleingang mehr Pixel behalten. Die berichteten Verbesserungen zeigen, dass die Verkleinerung des gesamten Bildausschnitts nützliche Details entfernen kann, selbst wenn die ursprüngliche Auflösung hoch ist.
Die Richtlinien „Einpassen“, „Ausfüllen“ und „Mittiger Zuschnitt“ sind nicht gleichwertig. Beim Einpassen bleibt der gesamte Bildausschnitt mit Rand erhalten, beim Ausfüllen können die Ränder abgeschnitten werden, und die Ausrichtung kann vor oder nach dem Zuschneiden geändert werden. Eine Neugenerierung verändert die Suche, sobald sich eine dieser Operationen von den für die vorherige Einbettung verwendeten Operationen unterscheidet.
Mehrskalige Merkmale können verworfene Pixel nicht wiederherstellen
Moderne visuelle Systeme kombinieren feine räumliche Karten mit tieferen semantischen Merkmalen und können dadurch Objekte auf mehreren Maßstabsebenen erkennen. Diese Repräsentation beginnt jedoch weiterhin mit dem dem Encoder präsentierten Vorschaubild. Informationen, die beim Skalieren oder Komprimieren entfernt wurden, stehen den späteren Schichten nicht zur Verfügung.
Mehrskalige Merkmalpyramiden erstellen eine Merkmals-Pyramide von oben nach unten mit seitlichen Verbindungen, sodass semantisch starke Merkmale auf mehreren Auflösungen vorhanden sind. Dieser Mechanismus erklärt, warum die Erkennung kleiner Objekte von feinen räumlichen Karten statt von einer einzigen groben Repräsentation profitiert.
Eine globale Bildeinbettung kann die dominante Szene priorisieren und einen winzigen Gegenstand ignorieren, selbst wenn ein Detektor ihn finden kann. Suchpipelines, die eine hohe Trefferquote auf Objektebene benötigen, können zusätzlich zu einem einzigen Vektor für das gesamte Vorschaubild Kacheln, Bereichseinbettungen oder Bildunterschriften für erkannte Objekte erfordern.
Komprimierung und Normalisierung verschieben Ähnlichkeiten an der Schwelle
JPEG-Quantisierung, Schärfung, Farbumwandlung, Alpha-Komposition und Resampling-Filter verändern lokale Kanten und Texturen. Große Objekte bleiben semantisch stabil, aber ein kleines Objekt nahe der Erkennungsschwelle kann sich so stark verändern, dass es unter den Abrufgrenzwert fällt.
Fokussierte Bereiche mit hoher Auflösung lenken die Verarbeitung mit hoher Auflösung auf vielversprechende Regionen mit kleinen Objekten, statt überall eine kostenintensive Bildpyramide anzuwenden. Das Grob-zu-fein-Design zeigt, dass die Zuweisung von Pixeln zur relevanten Region die Genauigkeit bei geringerem Gesamtverarbeitungsaufwand erhalten kann.
Die Fehlergrenze besteht darin, jede veränderte Ausgabe als Fehler des Vorschaubilds anzunehmen. Auch ein neues Einbettungsmodell, ein geänderter Anfrage-Encoder, eine Neuerstellung des Index oder die Konkurrenz um die Top-k-Ergebnisse können die Rangfolge verändern. Vergleichen Sie alte und neue Vorschaubilder zunächst mit demselben unveränderten Modell und Index, bevor Sie die Ursache bestimmen.
Führen Sie einen Abruftest mit Originalen und Vorschaubildern durch
Wählen Sie fünfzig Fotos aus, die kleine Objekte in der Mitte, an den Rändern, in dunklen Bereichen und vor unruhigen Hintergründen enthalten. Speichern Sie die bisherigen Vorschaubilder, erzeugen Sie sie neu und erfassen Sie für beide Versionen die Abmessungen, Zuschnittboxen, Ausrichtung, den Codec, die Qualität, das Farbprofil und die Dateihashes.
Verwenden Sie die Bereichsverarbeitungsmethode aus bereichsbewusster Verarbeitung, um Einbettungen des Originalbilds, des alten Vorschaubilds, des neuen Vorschaubilds und gekachelte Einbettungen mit denselben Abfragen und demselben Index zu vergleichen. Verfolgen Sie Objektpixel, Top-k-Trefferquote, Rangverschiebungen und Fehlklassifizierungen nach Position und Objektgröße.
Behalten Sie neu erzeugte Vorschaubilder nur dann bei, wenn sie die erforderliche Trefferquote für kleine Objekte bei den vorgesehenen Speicher- und Rechenkosten erreichen. Wenn globale Vorschauen weiterhin nicht ausreichen, fügen Sie für ausgewählte Fotos Bereichseinbettungen hinzu, statt zu behaupten, eine höhere Vorschauauflösung garantiere die Objektsuche.
Tech- & KI-Zentrum
Mehr zum Lesen

Warum steigt die GPU-Leistung zu Beginn einer lokalen Inferenzanfrage sprunghaft an?
Sehen Sie, wie das Hochfahren des GPU-Takts, das Vorfüllen des Modells, die Kernel-Initialisierung, die Speicherzuweisung und die Sampling-Intervalle zu Leistungsspitzen beim Start der Inferenz...

Warum ändert sich das Ranking der Vektorsuche, wenn mehrere Indexsegmente gemeinsam abgefragt werden?
Erfahren Sie, wie Kandidatenlimits pro Segment, approximative Graphen, Score-Kalibrierung, Aktualisierungen und Konsolidierung das Ranking bei der privaten Vektorsuche verändern.

Warum werden Gruppen zur Fotodublettenbereinigung nach der Bearbeitung von Metadaten aufgeteilt?
Erfahren Sie, wie exakte Hashes, perzeptuelle Hashes, die EXIF-Ausrichtung, Zeitstempel, Schwellenwerte und Pipeline-Versionen dazu führen, dass private Fotoduplikatgruppen aufgeteilt werden.

