ホームナレッジベースにおけるRAGの引用精度を決める要因とは?

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

RAGの引用精度は、関連する文書を単に列挙することではなく、適切な出典範囲を取得し、それを裏付ける正確な主張に結び付けられるかどうかに左右されます。

家庭用ナレッジベースは、保険証券、家電の取扱説明書、スキャンした請求書などを基に回答できても、誤ったページを引用することがあります。正しい文書が存在していても、根拠となる文が分割されたり、別のチャンクより下位にランキングされたり、生成された別の主張に誤って関連付けられたりする可能性があります。したがって、引用品質は取り込み、検索、生成、整合性、バージョン管理のすべてを反映します。

出典とチャンクの品質が証拠の上限を決める

OCRの誤り、欠落した表、古いコピー、失われた見出しは、検索が始まる前に証拠を損ないます。チャンクの境界は、主張を裏付けるために必要な記述、限定条件、識別コンテキストを保持しなければなりません。数字だけを含む断片は一致しても、それが何を測定しているのかを証明できない場合があります。

高度なチャンク分割戦略を比較した研究では、固定長チャンクが概念を分断したり無関係な内容を混在させたりするため、文書の分割方法が検索性能を変えることが示されています。引用精度は、引用に利用できる範囲の品質を超えることはありません。

メタデータには、文書のバージョン、ページ、セクション、座標を保持し、引用が検証可能な証拠に解決されるようにします。重複排除では、過去の回答で使用された履歴バージョンを消去せず、古いコピーと現行コピーが競合するのを防ぐ必要があります。

検索と生成では主張レベルの整合性を維持する必要がある

検索システムは、トピックには関連していても、最終文を裏付けるものではないページを上位に返すことがあります。再ランキングでは直接的な裏付けを優先し、生成では主張の境界と出典識別子を見える状態に保つことで、各事実記述をコンテキスト内に実際に存在する証拠へ対応付ける必要があります。

引用の忠実性に関する研究では、引用の正確性と引用の忠実性を区別し、見かけ上は裏付けているように見える引用でも、モデルが別の情報に依拠した後で付けられている可能性があると報告されています。そのため、表面的な一致だけでは信頼性を過大評価する可能性があります。

引用の網羅性と正確性は別のものです。回答内の2つの主張には正確な引用があっても、3つが裏付けられていない場合があります。また、すべての文を、どの主張も正確には支えていない1つの広範な文書に引用することもできます。両方の側面を独立して測定する必要があります。この区別は、後の家庭内テストでも確認できます。

後処理でリンクは修正できても、欠落した証拠は補えない

検証システムは、生成された各主張を候補となる文章と比較し、引用をより適切な出典へ移動したり、裏付けのない主張を削除したりできます。これにより生成後の整合性の誤りは検出できますが、取り込みや検索で提供されなかった証拠を取り戻すことはできません。

引用修正システムは、生成された引用を検索済みの記事と照合し、追加コストを抑えながら引用精度を向上させたと報告しています。その結果は、回答の草稿作成後に専用の整合性処理段階を設ける価値を示しています。自動化を進める前に、中間結果を検証可能な状態に保つ必要があります。

失敗の境界は、検索結果の集合内にそれを含意する出典がないにもかかわらず、確信を持って主張してしまうことです。検証システムは、最も似て見える引用を割り当てて回答を根拠付きに見せるのではなく、回答を控えるか、再検索するか、主張を削除する必要があります。

引用の裏付けと網羅性を分けて評価する

クリーンなPDF、OCRスキャン、表、重複バージョン、回答なしのケースを含め、検証済みの回答範囲を持つ50個の質問を作成します。生成された回答を原子的な主張に分割し、各引用がその主張を含意しているか、またすべての事実上の主張に引用があるかを判定します。

RAG評価フレームワークの再現率、適合率、網羅性の枠組みを使用しつつ、引用の含意、バージョンの正確性、解決可能なページまたは領域も追加します。結果は単一の集計スコアだけで報告せず、文書の種類ごとに比較します。この境界は、現実的な運用条件下で個別に測定する必要があります。

引用が現在の検証可能な範囲に解決され、裏付けのない主張が回答の控え、または別の検索試行を引き起こす場合にのみ合格とします。出典が関連していても文を含意していない場合は、部分的な成功ではなく、不正確な引用として数えます。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.