サムネイルを再生成した後に画像検索で小さな物体を見失うことがあるのは、新しい前処理経路によって、埋め込みが以前エンコードしていたピクセルやコンテキストが削除される場合があるためです。
家族写真には、自転車、ラベル、ペット、工具など、元画像のごく小さな領域しか占めないものが含まれることがあります。写真サービスが異なるトリミング、向きの処理ルール、解像度、圧縮設定でプレビューを再生成すると、元ファイルが変わっていなくても、画像モデルが受け取る入力は変わります。埋め込みにその細部が残るかどうかは、物体の実効サイズと周囲のコンテキストによって決まります。
サムネイルのジオメトリが、残る物体のピクセル数を決める
画像エンコーダーは通常、入力を固定サイズの正方形または長方形のテンソルにリサイズします。元画像で30ピクセルを占める小さな物体は、有効な特徴スケールを下回るまで縮小されることがあります。また、中央クロップによって、端にある物体が完全に切り取られる場合もあります。
小物体のスライス推論では、検出前に大きな画像を重なり合う領域へ分割することで、モデル入力時に小さな物体のピクセルをより多く保持します。報告された性能向上は、元の解像度が高くても、フレーム全体の縮小によって有用な細部が失われる可能性を示しています。
フィット、フィル、中央クロップの各ポリシーは同じではありません。フィットは余白を付けてフレーム全体を保持し、フィルは境界を切り取ることがあり、向きの処理ではクロップの前後に画像を回転させる場合があります。これらの処理のいずれかが以前の埋め込み生成時と異なると、再生成によって検索結果が変わります。
マルチスケール特徴でも、破棄されたピクセルは復元できない
現代の画像システムは、細かな空間マップと、より深い意味特徴を組み合わせ、複数のスケールで物体を認識できるようにします。それでも、その表現はエンコーダーに入力されたサムネイルから始まります。リサイズや圧縮で削除された情報は、後続の層では利用できません。
マルチスケール特徴ピラミッドは、横方向の接続を持つトップダウン型の特徴ピラミッドを構築し、複数の解像度で意味的に強い特徴を得られるようにします。この仕組みにより、小物体の認識が単一の粗い表現ではなく、細かな空間マップから恩恵を受ける理由が説明できます。
グローバル画像埋め込みは、検出器なら見つけられる小さな物体であっても、画像の主なシーンを優先して無視することがあります。物体レベルの再現率が必要な検索パイプラインでは、サムネイル全体から作る1つのベクトルに加えて、タイル、領域埋め込み、または検出物体のキャプションが必要になる場合があります。
圧縮と正規化によって、境界付近の類似度が変動する
JPEG量子化、シャープ化、色変換、アルファ合成、リサンプリングフィルターは、局所的なエッジやテクスチャを変化させます。大きな物体は意味的に安定していますが、モデルの認識しきい値付近にある小さな物体は、検索のカットオフを下回るほど変化することがあります。
高解像度の注目領域は、高コストな画像ピラミッドを画像全体に適用するのではなく、有望な小物体領域へ高解像度処理を集中させます。その粗密な処理設計は、関連領域にピクセルを割り当てることで、総処理量を抑えながら精度を維持できることを示しています。
失敗の境界は、結果が変わるたびにサムネイルの不具合だと考えてしまうことです。新しい埋め込みモデル、変更されたクエリエンコーダー、インデックスの再構築、top-kの競合によってもランキングは変わります。原因を特定する前に、同じ固定モデルとインデックスを使って新旧のサムネイルを比較してください。
元画像とサムネイルの検索性能を比較するテストを実施する
中央、端、暗い領域、複雑な背景に小さな物体が含まれる写真を50枚選びます。以前のサムネイルを保存してから再生成し、両方のバージョンについて、寸法、クロップ範囲、向き、コーデック、品質、カラープロファイル、ファイルハッシュを記録します。
領域を考慮した処理の領域処理方式を使い、同じクエリとインデックスで、元画像、旧サムネイル、新サムネイル、タイル分割した画像の埋め込みを比較します。物体のピクセル数、top-k再現率、順位の変動、位置と物体サイズ別の見逃しを追跡します。
意図したストレージ容量と計算コストで、必要な小物体の再現率を満たす場合にのみ、再生成したサムネイルを採用してください。全体プレビューでは不十分な場合は、サムネイルの解像度を上げれば物体検索が保証されると主張するのではなく、選択した写真に領域埋め込みを追加します。
テック&AIハブ
もっと読む

ローカル推論リクエストの開始時にGPUの消費電力が急増するのはなぜですか?
推論開始時に、GPUクロックの上昇、モデルのプレフィル、カーネルの初期化、メモリの割り当て、サンプリング間隔によって電力スパイクがどのように発生するかをご覧ください。

複数のインデックスセグメントを同時にクエリすると、ベクトル検索のランキングが変わるのはなぜですか?
セグメントごとの候補数制限、近似グラフ、スコアのキャリブレーション、更新、統合によって、プライベートなベクトル検索のランキングがどのように変わるかを学びます。

メタデータを編集すると写真の重複排除グループが分割されるのはなぜですか?
完全一致ハッシュ、知覚ハッシュ、EXIFの向き、タイムスタンプ、しきい値、パイプラインのバージョンによって、プライベートな写真の重複グループが分割される仕組みをご覧ください。

