プライベート検索スコアのキャリブレーション:生の類似度を実用的な信頼度シグナルに変換する方法

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

検索スコアのキャリブレーションは、定義したプライベート検索タスクにおける観測された関連性とスコアを関連付けることで、生の類似度を実用的な信頼度シグナルに変換します。

ある埋め込みモデルではコサインスコア0.82が非常に優れていても、別のモデルでは普通の値かもしれません。その意味は、チャンク分割、文書の言語、クエリの難易度、コーパスの密度によっても変わります。キャリブレーションではラベル付きの例を使って、特定のスコア範囲の結果が実際に関連している頻度を推定します。これにより、しきい値や棄却ルールを直感ではなく証拠に基づいて設定できます。

類似度は候補を順位付けするが、確率は表さない

コサイン類似度、内積、距離は、幾何学的なランキングシグナルです。特定のモデルと正規化の条件のもとで、クエリベクトルと文書ベクトルを比較します。値が0から1の間に収まっていても、それが関連性の確率を同じ割合で示すわけではありません。

Pineconeのインデックス概要では、セマンティック検索がクエリベクトルに最も近いレコードを返す仕組みを説明しています。この仕組みによって相対的な近傍関係は定まりますが、生のスコアの尺度は、メトリック、エンコーダー、コーパス、クエリに依然として依存します。この違いは、現実的な家庭内の運用条件でも重要です。

そのため、別の環境からコピーしたしきい値では、家庭内の適切な一致を拒否したり、もっともらしいノイズを受け入れたりする可能性があります。最初のステップは、想定するタスクにおける関連性を定義することです。たとえば、単にトピックを共有しているだけでなく、チャンクが回答を直接裏付けているかどうかを基準にします。

ラベル付きクエリでスコア範囲を実測結果に対応付ける

現実的なクエリのホールドアウトセットを作成し、候補チャンクを、裏付けになるもの、関連するもの、無関係なものとして判定します。その後、ロジスティック回帰、等張回帰、ビン分割による信頼度マッピングなどのキャリブレーターを使い、生のスコアや補助特徴量を観測された関連性の頻度に対応付けます。

検索のキャリブレーションに関する研究では、検索の不確実性を点数スコアとともに扱うべきだと論じ、キャリブレーションを考慮したランキングとカットオフ予測を示しています。これは、ランキングスコアを直接解釈するのではなく、検証データから意思決定用のシグナルを学習する方法を支持するものです。

キャリブレーションは条件付きです。スコア分布が異なる場合は、言語、文書タイプ、クエリの種類ごとに別のマッピングが必要になることがあります。得られた結果は、棄却、より広い検索の要求、再ランキングの開始に利用できますが、ランキング品質は引き続き別途測定する必要があります。

コーパスとモデルの変更はキャリブレーションドリフトを引き起こす

近い重複文書を多数追加したり、チャンクサイズを変更したり、埋め込みモデルをアップグレードしたり、ハイブリッド検索を有効にしたりすると、候補とスコアの分布が変わります。トップkの再現率が安定して見えても、以前は信頼できたしきい値が過信を招くようになる可能性があります。後の診断やレビューに備えて、中間状態を見える形で残しておく必要があります。

scikit-learnの信頼度キャリブレーションに関するドキュメントでは、生の予測性能と確率の信頼性を区別し、信頼度ダイアグラムとキャリブレーション手法を紹介しています。検索スコアを関連性の確率としてモデル化した後も、同じ評価ロジックを適用できます。

失敗の境界は、適合に使用したデータと意思決定の定義の範囲外で、キャリブレーション済みの信頼度を使うことです。キャリブレーションによって、欠落した証拠、偏ったラベル、誤ったエンティティマッチを修正することはできません。比較可能な条件下で観測された正しさを推定するだけです。

検索の信頼性ダイアグラムを作成する

判定済みの候補チャンクを含む、代表的な家庭内クエリを少なくとも50件収集し、別のテスト分割を維持します。予測信頼度をビン分けし、各ビンを観測された関連性の割合と比較します。さらに、再現率、適合率、ランキング品質、カバレッジと併せてキャリブレーション誤差を記録します。

RAG検索評価の評価フレームワークを使い、検索品質と回答の引用カバレッジを分けて扱います。直接的な質問、略語、多言語クエリ、OCRテキスト、回答不能なケースをテストしてください。これらはスコア分布が異なる可能性があるためです。自動化を有効にする前に、その依存関係を別途測定する必要があります。

棄却または再ランキングのしきい値は、誤受け入れと誤拒否のコストを測定してから設定します。エンコーダー、チャンク分割、統合方式、コーパス構成を変更するたびに再適合または再検証を行ってください。そうしなければ、その値は信頼度ではなく類似度として表示します。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.