ローカルRAGの検索品質を測定し、再現率・適合率・引用カバレッジを解釈する方法

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

ラベル付けされた証拠、検索メトリクス、主張レベルの引用チェックを代表的なクエリセット上で個別に評価すれば、ローカルRAGの品質を測定できます。

流暢な回答でもソースの見落としを隠すことがあり、一方で優れた検索器が正しい文章を生成器に渡しても、生成器が不適切に引用することがあります。まず、関連チャンクが既知のクエリから始め、回答を生成する前にtop-kリストをスコアリングします。引用カバレッジは回答レイヤーに属するものであり、検索再現率の代替として使用してはなりません。

メトリクスを計算する前に正解データを作成する

各テストクエリについて、許容できるすべての証拠チャンク、または少なくとも妥当な判定対象プールを特定します。直接検索、統合が必要な質問、最新性が関係するケース、略語、言語、アクセス権限の境界を含めます。調整に使用する質問と、ホールドアウトセットを分けてください。

RAG評価の実践的な概要では、エンドツーエンドのスコアでは失敗箇所を特定できないため、検索器と生成器のコンポーネントを個別に評価することが推奨されています。

大規模なライブラリでは、正解データが不完全になることがあります。複数の検索器から結果を集めて統合し、その全体を判定します。未判定のチャンクをすべて無関係とみなすのではなく、不確実なケースとして記録してください。弱いラベルは、精密に見えて誤解を招くメトリクスを生みます。

再現率と適合率は異なる検索上の問いに答える

Recall@kは、上位k件で取得された関連チャンク数を、既知の関連チャンク総数で割った値です。Precision@kは、上位k件に含まれる関連チャンク数をkで割った値です。通常、kを大きくすると再現率は向上しますが、ノイズも増えるため、2つのメトリクスを合わせて確認する必要があります。

適合率と再現率の古典的な定義は、情報検索におけるこのトレードオフを示します。ただし、順位は考慮されないため、早い順位の証拠が重要な場合はMRRまたはnDCGを追加してください。

関連する文章が1つだけあるクエリでは、その文章が5件の結果のどこかに含まれていればRecall@5は1.0ですが、Precision@5はわずか0.2です。これは再ランキング器には許容できても、コンテキストの小さい生成器にはノイズが多すぎる可能性があります。メトリクスの目標値は、後段で利用できる証拠の予算によって異なります。

引用カバレッジはリンクではなく主張を検証する

生成された回答を検証可能な主張に分解します。引用カバレッジは、根拠が必要な主張のうち、裏付けられている主張の割合です。引用の正確性は、引用された各文章が、付随する主張を実際に裏付けているかを問うものです。リンクが多数含まれていても、カバレッジが低い回答はあり得ます。

引用を考慮した検索に関する最近の研究では、1つの総合的な関連性スコアでは、根拠のない回答の断片を明らかにできないため、クエリカバレッジと原子的な主張の検証可能性が評価されています。

主張が一貫して分割されていない場合や、一般知識とソースが必要な主張をポリシーなしに混在させている場合、引用カバレッジは意味を失います。また、回答が完全であることを証明するものでもありません。引用を増やせば自動的に根拠付けが改善するわけではありません。

診断上の分離を維持する判定ルールを使用する

まず検索を実行し、順位付けされたチャンクID、スコア、バージョンを保存します。Recall@k、Precision@k、MRRまたはnDCGを計算し、その後、固定した結果から回答を生成して、忠実性、回答の関連性、引用カバレッジ、引用の正確性を評価します。

管理されたRAG評価メトリクスでは、コンテキスト適合率、コンテキスト再現率、忠実性、回答の関連性をまとめて報告しており、単一のスコアでは不十分である理由を示しています。

検索再現率が最低基準を満たし、適合率がコンテキスト予算の範囲内に収まり、回答におけるすべての重要な主張が裏付けられているか、明確に条件付きで示されている場合にのみリリースを合格とします。再現率が不足している場合は、インデックス作成または検索を改善します。正しい証拠が存在するのに引用が不十分な場合は、生成と帰属処理を改善します。

検索と引用に1つのリリースゲートを適用する

小規模な家庭用システムでは、代表的なクエリを少なくとも50件作成し、ドキュメントの種類や言語が増えたら100~200件に拡張します。上位5件と上位10件の証拠を判定し、結果セットを固定してから、生成された主張を監査します。全体平均に加えて、最も成績の悪いクエリ層も報告してください。

表形式のソースと文章形式のソースが一緒に平均化されないよう、RAG形式の評価コンテンツの近くにテストを配置します。すべてのチャンクIDと関連性判定をバージョン管理してください。

Recall@5を0.85、引用の正確性を0.95とするような初期基準は、普遍的な標準ではなく、ローカル環境での出発点としてのみ使用します。リスクに応じて基準を厳しくしてください。より高い総合スコアを得るために、権限の正確性や、影響の大きい根拠のない主張を犠牲にしてはなりません。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.