ライブラリが大きくなるほどRAG評価が重要になるのは、ユーザーが同じ数の質問をしていても、検索の曖昧さとリグレッションの範囲が広がるためです。
アーカイブが1万チャンクから100万チャンクに増えても、ある家庭が週に100回検索する状況は変わらないかもしれません。しかし今では、順位を競合する類似文書、古いバージョン、異なる言語、権限境界がクエリごとに増えています。少数の固定テストセットでは、新しく追加されたあらゆるコンテンツ層における検索失敗の可能性をカバーできる割合が小さくなります。
候補が増えるほど、もっともらしい誤りを検索する方法も増える
近似検索では、すべての文章を正確にスコアリングするわけではありません。コーパスが拡大すると、冗長で古い証拠を含め、クエリの近くに位置するチャンクが増える可能性があります。クエリ数とtop-kを固定しても、適合率が低下することがあります。
検索戦略に関する統制研究では、生成条件を固定したうえで、密ベクトル検索、ハイブリッド検索、再ランキング検索、検索範囲を拡張した検索を比較し、戦略の変更によって適合率と再現率に測定可能なトレードオフが生じることを示しています。
したがって評価では、回答が存在するかどうかだけでなく、適合性、順位、バージョン、権限を確認する必要があります。文書が増えるほど、流暢な回答がもっともらしいものの権威性のない重複文書を引用する可能性も高まります。
コーパスの多様性に伴い、カバレッジとラベリングも増える
テストセットは、文書の種類、言語、日付、エンティティ、クエリの意図を代表するものです。ライブラリに新しいコンテンツ群が加わると、以前の質問ではリスク全体をサンプリングできなくなります。実稼働のトラフィックが変わらなくても、カバレッジを追加するには適合性の判定と期待される証拠の定義が必要です。
情報カバレッジに関する研究では、従来の適合率と再現率では、結果が異なる情報ニーズをカバーしているかどうかを見落とす可能性があると論じています。コーパスの多様性は、クエリ量より速く増加することがあります。
各インデックス、チャンク分割器、埋め込みモデル、フィルターポリシー、再ランキング手法のバリエーションによって、比較の数は増加します。自動評価者は作業量を減らしますが、推論コストと独自のキャリブレーション作業が発生します。評価コストとは、コーパスの増加によって挙動が変わったかどうかを把握するための費用です。
ライブラリのサイズが主なコスト要因にならない場合
クエリが一意の識別子を対象とし、決定的なフィルターによって先に候補が絞り込まれる場合、インデックスのサイズはほとんど影響しないことがあります。均質な重複文書で構成された大規模なコーパスは、意味のあるクエリの多様性を増やさず、ストレージだけを増加させる可能性があります。
主張の検証可能性に関するフレームワークでは、クエリと回答をカバレッジ単位および検証可能性単位に分解し、評価の負担がコーパスのサイズだけでなく、主張の構造にも左右されることを示しています。
また、回答ごとの高コストな生成や人手レビューが評価コストの大部分を占める場合、この仕組みは成り立ちません。その場合、ライブラリの増加は二次的な要因です。テストを増やせば自動的に改善するわけではなく、重複した質問によってリスクのカバレッジが増えないまま費用だけが増える可能性があります。
新しいコーパスのリスクに評価費用を結び付ける
中核となるリグレッションセットを維持し、ライブラリに新しい言語、文書タイプ、権限クラス、期間、高価値エンティティが加わった場合にのみ、層化した質問を追加します。必要な証拠と既知の難しいネガティブ例にラベルを付けます。高コストな生成指標を実行する前に、検索のみの指標を実行します。
インデックスの鮮度イベントにテストの更新を結び付け、新しくインデックス化されたファイルや見逃されたファイルが発生した際に、構造化されていない全面的な再実行ではなく、対象を絞った評価を実行します。傾向を比較できるよう、固定のホールドアウトセットを保持します。
実稼働クエリあたりの費用ではなく、カバーした層および発見した不具合あたりの費用を追跡します。通常は低リスクの層をサンプリングし、権限に敏感なコンテンツや頻繁に変更されるコンテンツは完全にテストします。新しい層の1つだけでスコアが変動する場合は、スイート全体を拡張する前に、その範囲を修正して再実行します。
テック&AIハブ
もっと読む

ローカルRAGの検索品質を測定し、再現率・適合率・引用カバレッジを解釈する方法
ローカルRAGのテストセットを構築し、主要な検索指標を算出し、それらのトレードオフを解釈し、回答の主張が引用された根拠によって裏付けられているかを監査する。

サンプリングレートが同じ場合、センサー数の増加に伴ってスマートホームの機能計算がより重要になるのはなぜですか?
デバイス数の増加に伴うセンサーごとおよびセンサー間の計算処理を追跡し、非線形な融合コストを特定して、自動化処理に遅延が生じる前に特徴量パイプラインのベンチマークを実施します。

同じモデル規模でも、ワークフローのステップ数が増えるほどエージェントツールのオーバーヘッドが重要になるのはなぜか?
エージェントの各ステップで、シリアル待機、コンテキストの増大、リトライ、信頼性がどのように累積するかを追跡し、モデル推論とは分けて実行コストを測定する。

