メタデータの編集後に写真の重複グループが分かれることがあるのは、厳密な同一性と知覚的な同一性が、それぞれ異なるバイト列、描画されたピクセル、グループ化ルールに依存するためです。
日付、場所、評価、向きを変更しても、写真そのものを編集したようには見えないかもしれません。しかし、ファイルのバイト列とカタログのレコードは変化します。暗号学的なファイルハッシュで重複排除するシステムもあれば、デコードしたピクセルのフィンガープリントを使うシステム、撮影時刻、カメラ、サイズ、埋め込み表現などを組み合わせるシステムもあります。メタデータを無視、正規化、または画像に反映するかどうかによって、編集後のコピーが以前のグループに残るかどうかが決まります。
厳密なハッシュでは、どのバイト変更も新しいファイルとして扱われる
暗号学的ダイジェストは、1つのバイト列を識別します。EXIF、XMP、埋め込みサムネイル、カラープロファイル、コンテナのパディングを書き換えると、元の画像ピクセルが同じようにデコードされる場合でも、そのバイト列は変化します。そのため、ファイル単位の厳密な重複排除では、異なるオブジェクトとして正しく報告されます。
知覚ハッシュと厳密なハッシュの違いでは、通常のハッシュとは異なり、知覚ハッシュが視覚的に類似した画像に対して近い値を保つ理由を説明しています。これにより、ストレージレベルの重複検出と外観レベルのグループ化が区別され、重複の定義を明確にする必要性が示されます。
サイドカーのメタデータを使えば元のファイルの書き換えを避けられますが、カタログの状態は変化します。システムは、画像ストリーム用のコンテンツハッシュと完全なファイル用の別の識別情報を保持できます。これにより、ストレージの重複排除、編集履歴、視覚的なグループ化を併存させながら、それらが同じ関係であるかのように扱うことを避けられます。
向きとレンダリングによって、フィンガープリントの対象となるピクセルが変わることがある
EXIFの向き情報は、保存されたピクセルの行をどのように表示するかをビューアーに伝えます。一方の重複排除処理がデコードした生のピクセルをハッシュし、別の処理が先に向きを適用する場合、同じ写真から異なる回転を表すフィンガープリントが生成されることがあります。この違いは、後で家庭内のテストを行う際にも確認できます。
メタデータに依存しないフィンガープリントでは、ファイル名、サイズ、解像度、その他のメタデータに依存しない知覚フィンガープリントについて説明しています。重要なのは、ハッシュ処理を、たまたま実行されたデコード経路ではなく、意図的に正規化した視覚表現に対して行うことです。
カラーマネジメント、アルファ背景、編集指示として保存されたクロップ、再生成されたプレビューにも同様の曖昧さがあります。安定したパイプラインでは、グループ化キーを計算する前に、向き、リサイズ、色空間、クロップ方針、ハッシュアルゴリズムのバージョンを明示します。自動化を進める前に、中間結果を検査できる状態にしておく必要があります。
しきい値と候補ルールによって、類似写真を同じグループに残すかどうかが決まる
知覚ハッシュや埋め込み表現が生成するのは、絶対的な重複判定ではなく距離です。メタデータの編集によって比較される項目が変わることがあり、視覚的な正規化のわずかな違いによって、境界付近のペアが設定したしきい値をまたぐこともあります。
制御された変換に敏感な類似度の評価では、画像変換の下で従来型の知覚ハッシュとディープ特徴量を比較しています。その結果は、リサイズ、圧縮、回転、クロップなどの変更に対する反応が手法ごとに異なり、普遍的な重複スコアが1つ存在するわけではないことを示しています。
失敗しやすい境界は、視覚的に似ているすべての画像を統合してしまうことです。連写、編集後の書き出し、同じ場面を撮影した家族2人の写真は近い位置関係にあっても、別のオリジナルとして扱うべきです。グループ化ではファイルの同一性を維持し、外観だけを根拠に削除するのではなく、類似性の根拠を示す必要があります。
固定した重複排除パイプラインでメタデータ編集を再現する
撮影時刻、GPS、評価、キーワード、EXIFの向き、埋め込みサムネイル、カラープロファイル、サイドカーのメタデータだけを変更したコピーを作成します。リサイズ、再圧縮、回転、クロップを施した写真や、視覚的に類似した連写写真も、別の対照データとして追加します。この境界は、実際の運用条件に近い環境で個別に測定する必要があります。
コンテンツフィンガープリントを使ってフィンガープリントを比較します。各編集の前後で、完全なファイルハッシュ、正規化したピクセルハッシュ、知覚距離、埋め込み距離、候補フィルターの判定、しきい値、アルゴリズムのバージョン、最終的なグループ所属を記録します。複数のソースが限られたコンテキストを奪い合うときに、実際の影響が現れます。
厳密な同一性と視覚的な類似性を分けて保持し、破壊的なクリーンアップの前に手動確認を必須にします。メタデータだけの編集でグループが分かれる場合は、対象フィールドを正規化するか、正しいフィンガープリントを再計算します。別々の連写写真が統合され始めるまで、視覚的なしきい値を緩めてはいけません。
テック&AIハブ
もっと読む

ローカル推論リクエストの開始時にGPUの消費電力が急増するのはなぜですか?
推論開始時に、GPUクロックの上昇、モデルのプレフィル、カーネルの初期化、メモリの割り当て、サンプリング間隔によって電力スパイクがどのように発生するかをご覧ください。

複数のインデックスセグメントを同時にクエリすると、ベクトル検索のランキングが変わるのはなぜですか?
セグメントごとの候補数制限、近似グラフ、スコアのキャリブレーション、更新、統合によって、プライベートなベクトル検索のランキングがどのように変わるかを学びます。

残響のある部屋でローカル音声アシスタントが自分の発話に割り込まれるのはなぜですか?
音響エコーパス、残響、非線形スピーカー、ダブルトーク、バージインのしきい値によって、ローカル音声アシスタントが自分の声を聞いてしまう仕組みを学びましょう。

