AI検索では、語彙を変更すると、文字どおりの一致だけでなく、ランキングに使われる意味的な近傍も変わるため、結果が異なることがあります。
たとえば、ある家庭が物置を「スタジオ」と呼び始め、メモや写真、音声コマンドの中で特定の人物を「コーチ」と呼ぶようになったとします。ローカル検索サービスは、複数のプライベートコレクションにまたがって、既存のエンティティに対する新しい表現を受け取ることになります。検索結果が改善するかどうかは、変化する家庭内の文脈をまたいで、辞書、インデックス、埋め込み、フィードバック履歴がそれらの表現をどれだけ早く結び付けられるかに左右されます。
語彙の変更は、まず候補の再現率に影響する
検索は、どのレコードを検討対象にするかを決めることから始まります。新しい家庭内用語が古い文書に一度も登場しない場合、完全一致やトークンベースの検索では、その文書を見逃す可能性があります。エイリアスマップやクエリ拡張を使えば、以前の用語を追加して再現率を回復できますが、その分、候補集合も大きくなります。
検索における同義語に関する実践的なガイダンスでは、同義語を、同じ概念に一致させるべき代替表現として説明しています。プライベートインデックスでは、その関係が記録または学習されて初めて、「スタジオ」と「物置」が同等になります。
セマンティック検索の動作は異なりますが、影響を受けないわけではありません。新しいあだ名が埋め込み空間内で複数の概念の近くに位置することで、再インデックスを行わなくても近似候補が変わる場合があります。まず候補の再現率が変化し、その後、再ランキングによって新たに候補に加わったレコードのうち、どれが上位に表示されるかが決まります。
繰り返しの使用によってランキングの文脈が再重み付けされる
クリック、修正、最近の会話、書き換えられたクエリから学習するシステムもあります。家庭内用語を繰り返し使うと、ある解釈がより有力になり、古い表現の相対的な重みが下がることがあります。そのため、アーカイブ済みのすべての文書に新しい語が含まれていなくても、インターフェースが家族の意図を「理解」しているように見えることがあります。
語彙の不一致に関する研究では、ユーザーと文書が異なる用語で同じ意図を表現できることから、語彙の不一致を検索における中心的な問題として捉えています。拡張によってアクセス性が向上するのは、追加された用語が意図された意味を保つ場合に限られます。
この効果は、普遍的なモデル更新ではなく、文脈に依存します。ある人にとっての「コーチ」は、家族の一員、バス、ブランドのいずれかを意味する可能性があります。人物、部屋、時間、コンテンツタイプが表現されていなければ、新しい用語によって複数の無関係なクラスタが引き寄せられ、適合率が低下することがあります。
語彙の適応が役に立たなくなる場合
ラベルが曖昧であったり、ほとんど使われなかったり、一貫性なく付与されていたりすると、適応はうまくいきません。また、テキストや画像の表現がそもそもインデックス化されていないレコードを復元することもできません。同義語を増やせば自動的に検索が改善するわけではなく、拡張範囲を広げることで再現率が上がる一方、ノイズの多い候補の下に目的の項目が押し下げられることもあります。
ファジーマッチングの解説では、完全一致でなくても、スペルミスや単語の変形を一致させられる理由が説明されています。この仕組みは表面的な変化には対応できますが、それだけで家庭内の不足した意味を補うことはできません。
モデル、チャンク分割、またはフィルターの更新後にランキングが変わった場合も、語彙による説明だけでは不十分です。クエリが変わっていないのに別の結果になった場合、別のインデックスやランキングコンポーネントが変化していない限り、固定されたエイリアステーブルでは説明できません。家庭内の言語が原因だと判断する前に、バージョンとタイムスタンプの証拠が必要です。
新しい用語を教える前に、固定クエリセットを実行する
古い用語、新しい用語、曖昧なあだ名を含む代表的なクエリを20件作成し、それぞれについて期待する上位3件を保存します。インデックスのスナップショット、埋め込みモデル、フィルター、再ランキングモデルを固定したまま、エイリアスを一度に1つずつ追加する前後で、このセットを実行します。
語彙の変更と適合性の評価をローカルで確認・レビューできるように、ローカルナレッジベースと一緒にテストを管理します。期待した項目が取得されたかどうかと、最終的な順位の両方を記録してください。
候補の再現率は改善したのに順位が悪化した場合は、拡張の重みや再ランキングを調整します。項目が候補集合に一度も入らない場合は、エイリアスまたは文書表現を更新します。語彙を編集していないのに古いクエリと新しいクエリの両方が変化した場合は、代わりにインデックスやモデルのバージョン変更を調査してください。
テック&AIハブ
もっと読む

ローカルRAGの検索品質を測定し、再現率・適合率・引用カバレッジを解釈する方法
ローカルRAGのテストセットを構築し、主要な検索指標を算出し、それらのトレードオフを解釈し、回答の主張が引用された根拠によって裏付けられているかを監査する。

サンプリングレートが同じ場合、センサー数の増加に伴ってスマートホームの機能計算がより重要になるのはなぜですか?
デバイス数の増加に伴うセンサーごとおよびセンサー間の計算処理を追跡し、非線形な融合コストを特定して、自動化処理に遅延が生じる前に特徴量パイプラインのベンチマークを実施します。

同じクエリ量でも、ドキュメントライブラリが拡大するとRAG評価コストが重要になるのはなぜか?
ユーザークエリを増やさずにコーパスの拡大がRAG評価の工数を増加させる理由と、層別テストによってコストをリスクに応じて抑えられる仕組みを理解する。

