写真、スクリーンショット、PDFを横断したマルチモーダル検索を可能にする機能とは?

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

マルチモーダル検索は、各ファイルを、その形式固有の視覚的・テキスト的・空間的・出所情報のシグナルを失うことなく、比較可能な証拠に変換したときに機能します。

家族のアーカイブには、撮影した領収書、支払い確認画面のスクリーンショット、同じ購入について説明するPDF明細書が含まれている場合があります。OCRは単語を見つけられますが、ロゴ、レイアウト、物体、ラベルとその値の関係を見落とすことがあります。実用的なクロスフォーマット検索では、モダリティ固有の抽出と共有埋め込み、領域レベルのインデックス作成、メタデータの融合、元のアセットに戻れるリンクを組み合わせます。

モダリティを考慮した取り込みで異なる種類の証拠を保持する

写真には、向き、物体、シーン、OCRの処理が必要です。スクリーンショットではインターフェースのテキストやアイコンが重視され、PDFではページのレンダリングに加えて、ネイティブテキストとレイアウトの抽出が必要になります。3種類すべてを単なるテキストとして扱うと、文言が不完全な場合に必要となるシグナルそのものが失われます。

共有画像・テキスト空間は、画像とテキストのペアから共有空間を学習し、正確なキャプションがなくてもテキストクエリで視覚的コンテンツを検索できるようにします。同じ原理がクロスフォーマットの再現率向上を支えますが、家庭向けシステムでは、正確な名前、日付、コードのためにOCRとメタデータも必要です。

派生した各項目には、アセットID、ページまたは領域の座標、パーサーのバージョン、取得時刻、ソースパスを保持する必要があります。これらのフィールドにより、インターフェースは一致した領域を強調表示でき、サムネイルの埋め込みが追跡不能な回答ソースになるのを防げます。

領域とページにはそれぞれ検索可能な単位が必要

画像全体のベクトルを1つだけ使うと、複数の無関係な要素が曖昧になることがあります。スクリーンショットにはチャット、ステータスバー、商品写真が含まれる場合があり、PDFページには表の横に図が配置されていることがあります。領域の切り出しとページレベルの単位によって、局所的な意味を検索可能な状態に保てます。

視覚文書検索手法は文書ページを視覚的に表現し、遅延インタラクションを使ってクエリのトークンとページのパッチを照合します。この設計は、レイアウト情報の豊富なPDFを、各ページを1つのグローバルベクトルに縮約せず検索する方法を示しています。

インデックス作成の単位は、連続性に必要な場合に限って重複させ、その後、親の権限と出所情報を継承させるべきです。過度な切り出しは重複ヒットを生み、粗すぎるページ単位は精度を低下させます。重複除去レイヤーを使えば、検索後に同じアセットに属する領域をまとめられます。

融合と再ランキングで比較できないシグナルを調整する

テキストBM25、OCR埋め込み、視覚埋め込み、ファイル名、タイムスタンプ、顔、フォルダーのコンテキストは、異なる尺度のスコアを生成します。ランク融合では独立した候補リストを組み合わせ、マルチモーダル再ランキングでは、より豊富なコンテキストを使って有力候補を検査できます。

画像・テキスト整合性の目的関数は、画像とテキストの整合性がモデルアーキテクチャだけでなく、学習の目的関数とデータ規模にも左右されることを示しています。これは、2つの共有埋め込みモデルがスクリーンショットと写真を異なる順序でランキングする理由の説明に役立ちます。

限界となるのは、裏付けのないクロスモーダルな確信度です。視覚的によく似たロゴだけでは請求書の合計金額を証明できず、OCRテキストだけでは画像に存在しない物体を特定できません。結果にはどのモダリティが一致したかを示し、スコアのキャリブレーションが不十分な場合は、別々の結果グループに分けて表示するべきです。

クロスフォーマット検索マトリクスを構築する

写真、スクリーンショット、デジタル生成PDF、スキャンPDFで表現される実際の概念を30個選びます。テキスト、視覚、ファイル名、日付、複合クエリを作成し、許容できる各アセットと、裏付けとなる証拠を含む正確なページまたは領域にラベルを付けます。

スクリーンショットと写真の検索におけるモダリティの違いを用いて、スクリーンショットと写真それぞれのRecall@10と適合率を個別に報告します。OCRのみ、視覚埋め込みのみ、メタデータのみ、融合検索、マルチモーダル再ランキングでテストを繰り返し、レイテンシーと重複結果率を記録します。

重要な各クエリ分類で検証可能なソース領域が取得され、権限フィルターが維持されている場合にのみ合格とします。融合によって平均再現率が向上しても正確なコードの一致が隠れてしまう場合は、すべての形式を1つのスコアに無理に通すのではなく、字句検索の経路を残します。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.