プライベート検索の再ランキング:第2のモデルが最終的な証拠の順序をどのように変えるか

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

2つ目のモデルは、各クエリと候補のペアを同時に読み取り、第1段階のベクトル比較では表現できない、より細かな関連性シグナルを適用することで、証拠の順序を変えます。

プライベートアーカイブでは、20個のもっともらしいチャンクを数ミリ秒で取得できても、最も有用な文章が、クエリと同じ語彙を共有する一般的な内容の下に埋もれていることがあります。リランカーは、その小さな候補集合により多くの計算を割り当て、各ペアに新しいスコアを付けます。文書、埋め込み、ユーザーの質問のいずれも変わっていないのに、最終的なコンテキストが改善する場合があります。

第1段階の検索は速度予算内で網羅性を最適化する

密ベクトル検索やハイブリッド検索では、コーパス全体のコンパクトな表現を比較します。多数の候補をスキャンまたは探索できるほど高速である必要があるため、現在のクエリとは独立して各文書を符号化します。そのため広い再現率には有利ですが、否定、役割、時系列、厳密な条件などの細かな関係を見落とすことがあります。

クエリと文書のペアについての概要では、リランカーをクエリと文書を一緒にスコアリングするクロスエンコーダーとして説明しています。この共同アテンションは、個別に生成したベクトルを比較するより表現力に優れていますが、大規模なライブラリ内のすべての文書に適用するにはコストが高すぎます。

二段階検索では処理を分担します。第1のモデルが候補プールを作り、第2のモデルがその候補に精度を注ぎます。正しい証拠が候補プールに入らなければ、リランキングで取り戻すことはできません。そのため、候補再現率は解決できない依存条件になります。

共同スコアリングによって生成モデルに届く証拠が変わる

リランカーは完全なクエリを各候補の隣に置いて確認できるため、正確な含意、エンティティの一致、必要な条件を評価できます。広く似ているだけの概要を下げ、質問に直接答える狭い範囲の段落を上位にすることも可能です。そのため、LLMに渡されるtop-kには異なる証拠が含まれます。

クロスエンコーダーの相互作用についての詳しい解説では、クロスエンコーダーが共同処理によってバイエンコーダーの類似度の限界を解消する仕組みを説明しています。この追加の相互作用こそが、2回目のベクトル検索ではなく、順序改善のメカニズムです。この違いによって、最終的な家庭内の判断結果も変わります。

コンテキストウィンドウとアテンションには限りがあるため、順序は重要です。より良い文章が先頭にあれば回答の土台になりますが、下位にある重複内容が補完的な証拠を押し出すことがあります。したがってリランキングでは、単に同じ事実を10通り並べるのではなく、関連性と網羅性の両方を考慮すべきです。

リランキングによってプライベート検索が悪化する場合

リランカーは学習時の優先傾向を引き継ぎます。表よりも整った文章を優先したり、家庭内の方言よりも主要言語を優先したり、暗黙的な証拠よりも明示的なキーワードの一致を優先したりすることがあります。候補プールが小さいと第1段階での取りこぼしが増幅され、候補プールが大きいと遅延が増え、インタラクティブ検索の応答にムラが出る可能性があります。

証拠の多様性に関する最近の議論では、関連性だけに基づくリランキングが証拠の多様性を低下させる可能性が指摘され、その後に多様性を確保する段階を設ける動機となっています。これは、関連性スコアが高いからといって、より完全な証拠集合になるとは限らない理由を示しています。この境界は、後の証拠レビューでも確認できます。

リランカーがドメインに適合していない場合や、遅延がインタラクションの予算を超える場合、その主張は成り立ちません。検証済みの回答を一貫して下位にしたり、情報源の多様性を失わせたり、根拠のある回答を改善しないまま順序だけを変えたりする場合は、リランカーを迂回または置き換えるべきです。

対応する検索実行で順序を評価する

クエリ、許容できる証拠の文章、重要な情報源カテゴリを含むテストセットを作成します。各クエリについて第1段階のランキングとリランキング後の順序を保存し、候補プール内の再現率、最終カットオフ時の適合率、逆順位、引用による裏付け、遅延を測定します。

思い出に残るデモ用の質問ではなく、第1段階のリランキングで示されているアプローチに従い、再現可能な評価を行います。特にスプレッドシート、多言語テキスト、否定、日付、ほぼ重複するチャンクについて、順位の逆転を手作業で確認します。したがって、この依存関係は実際の運用で個別に測定する必要があります。

テストセット全体で、許容できない遅延や多様性の低下を招くことなく、裏付けのある証拠を上位にできる場合に限り、リランカーを維持します。最終回答のスコアが低下した場合は、候補再現率とリランカーの品質を別々に調査すべきです。2つの段階では失敗の仕方が異なるためです。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.