ドメインが変わると、学習した類似性の幾何学が新しい語彙やタスクに適合しなくなり、埋め込みモデルが関連性のないホームドキュメントを同じグループにまとめることがあります。
プライベートインデックスは、個人メモやマニュアルから始まり、医療記録、ソースコード、請求書、法務ファイル、学術論文、多言語アーカイブへと拡大することがあります。同じ汎用埋め込みモデルは、すべてのチャンクを1つのベクトル空間にマッピングし続けますが、「類似している」という意味は変化しています。専門用語、繰り返し使われるテンプレート、新しい文書の長さ、異なるクエリ意図によって、関連性のない記録同士が近くに配置されることがあります。以下では、明らかなインデックス作成エラーがなくても、ドメインシフトによって近傍構造がどのように変化するのかを説明します。
埋め込みの類似性はモデルの学習分布を反映する
埋め込みモデルは、事前学習データとコントラスト学習の例から、どのテキスト同士を近くに配置すべきかを学習します。これらの例によって、ホームコーパスがインデックス化される前から、類似性に関する実用的な基準が定義されています。
Google Researchは、ドメイン外検索を評価し、対象コレクションが学習分布と異なる場合に表現品質が変化することを示しています。
幅広いトピックの言い換えを関連付けるよう学習したモデルは、新しい家庭内コレクションで重要となる、正確なエンティティ、手順、記録種別を区別できない場合があります。
新しい語彙によって、異なる文書が1つの大きなトピックに押し込まれることがある
専門文書では、一般的なテキストではあまり使われない用語が共有されることがよくあります。モデルは大まかなトピックを認識できても、近接する概念を区別するためのドメイン固有の対比が十分でない場合があります。
ドメイン適応埋め込みに関する研究では、対象データでファインチューニングした後、技術分野における精度や類似性の挙動が変化する可能性が示されています。
ドメインが変わると、複数の関連性のないファイルが最近傍になることがあります。どのファイルにも同じ技術用語が含まれていても、答えている質問は異なる場合があります。
密な表現が共通するトピックしか保持していない場合、エンティティ名、単位、日付、文書の役割を扱うには、語彙検索やメタデータフィルターが必要になることがあります。
繰り返しテンプレートや長い文書がベクトルを支配することがある
請求書、レポート、フォーム、エクスポートされたログでは、関連性のない記録同士でも、ヘッダー、免責事項、フィールド名、定型文が繰り返されることがあります。
Length-Induced Embedding Collapseでは、コンテンツが追加されるにつれて長文埋め込みがより似通い、同じクラスタに集まる可能性があることを示しています。
チャンクの大部分を定型文が占めると、ベクトルは内部に含まれる固有の出来事、人物、デバイス、判断ではなく、テンプレートごとにクラスタ化される可能性があります。
繰り返しテキストを削除し、構造化フィールドを保持し、意味のある小さなセクションを埋め込むことで、より識別力の高い近傍構造を取り戻せます。
ハブネスによって、一部の文書が多くの文書と似ているように見える
高次元のベクトル空間にはハブが存在することがあります。ハブとは、非常に多くのクエリや他の文書に対して最近傍になる文書のことです。
Sentence-BERTの分析では、埋め込みのハブネスが非対称な近傍構造を生み、分類エラーを増加させることが示されています。
一般的な概要、用語集、繰り返し使われるテンプレートは、コーパスの変更後にハブとなり、関連性のないホームドキュメントがその周囲にグループ化される原因になることがあります。
類似度スコアの補正、ハブネスの診断、再ランキング、コーパス固有の適応によって影響を軽減できますが、適切な対策は測定された幾何学的構造によって異なります。
1つのチャンクに複数のトピックを混在させると、意味が絡み合う
手順、トラブルシューティング、保証に関する文章、個人メモを組み合わせた長いチャンクは、複数の意味を同時に要約する1つのベクトルを生成します。
IBM Researchは、対象検索タスクにおいて、ドメイン固有埋め込みが汎用モデルよりも専門的な関係性を適切に保持することを報告しています。
ドメインが変わると新しい文書構造が導入されることが多いため、以前の文字数ベースのチャンク分割が、分けて扱うべきセクションを突然1つにまとめてしまう可能性があります。
以前の類似度しきい値では、マッチとノイズを区別できなくなる
家庭内メモに合わせて調整したしきい値は、何千もの技術記録が追加された後には機能しない場合があります。正例とランダムな類似度の分布が近づく可能性があるためです。
継続検索に関する研究では、対象分布が変化した後も、以前のコサイン類似度のしきい値が有効だと仮定するのではなく、埋め込みドリフトを測定しています。
そのため、埋め込みモデル、データベース、検索コードを変更していなくても、インデックスが誤った近傍をより多く返すことがあります。
しきい値は、新しいコーパス、クエリの種類、チャンクサイズ、ベクトル検索前に使用するメタデータフィルターごとに再調整する必要があります。
新しいドメインを中心に評価セットを再構築する
代表的なクエリを作成し、正例、難しい負例、ほぼ重複するテンプレート、専門用語、同じトピックを共有していてもグループ化すべきでない文書にラベルを付けます。
ファインチューニングした検索に関する研究は、新しいドメインには独自のクエリセットと関連性評価が必要である理由を示しています。
ZimaSpaceのセマンティックファイル検索ガイドでは、抽出、チャンク分割、メタデータ、検索を1つのローカルパイプラインとして評価する必要性を説明しています。
再現率、難しい負例の順位、クラスタ純度、ハブの出現頻度、スコア分布、再ランキング結果を使って、旧コーパスと新コーパスを比較します。新しいドメインで重要な違いが検索結果に再び現れるようになって初めて、問題は解決されたといえます。
テック&AIハブ
もっと読む

機密ファイルを取り巻くホームAIの信頼境界を実現する機能とは?
家庭用AIの信頼境界は、保存時暗号化、最小権限のアクセス許可、ランタイムサンドボックス化、スコープを限定した検索を組み合わせたものであり、単一の機能だけでは成り立ちません。

プライベート検索結果が頻繁に編集されたファイルを優先する原因とは?
頻繁に編集されるファイルは、更新のたびに鮮度、チャンク、バージョン、またはインタラクションシグナルが追加され、ソースによる正規化が行われない場合、ランキング上の優位性を獲得します。

スマートホームの在宅検知モデルが来客と住人を混同する原因とは?
システムが世帯の活動パターンを観測していても、その活動を生み出している人物の安定した識別情報がない場合、来訪者が居住者のように見えることがあります。

