なぜRAGパイプラインは正しいファイルを引用するのに、間違った箇所を示すのでしょうか?

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

RAGパイプラインでは、ドキュメントの発見に成功していても、チャンク検索や引用マッピングに失敗すると、正しいファイルを引用しながら誤った箇所を示すことがあります。

大きなファイルには、同じ用語を使うセクション、繰り返し現れる見出し、似た例、同じ事実の複数のバージョンが含まれていることがよくあります。ファイルレベルの検索システムは、関連するマニュアル、レポート、家庭内メモを正しく特定できても、箇所レベルの段階で隣接する別のチャンクを選択することがあります。その結果、回答モデルは不足している詳細を自身の知識や別のチャンクから推測しながら、選択されたファイルのメタデータを付与してしまう可能性があります。信頼できる引用には、ドキュメント、ページ、チャンク、範囲、生成という各段階での独立した正確性が必要です。

ドキュメント再現率と箇所再現率は異なる検索問題

ファイルは、タイトル、メタデータ、または全体の埋め込みが質問と一致することで高くランク付けされることがあります。しかし、それだけでは、回答を含む段落が取得されたチャンク集合に含まれているとは限りません。

実用的なRAG障害ガイドでは、検索障害のレイヤーを分けて考え、最終回答だけでなく正確なチャンクを確認することを推奨しています。

パイプラインでは、ドキュメント再現率、ページ再現率、チャンク再現率を個別に測定する必要があります。正しいファイル名でも、回答の該当範囲を見落としている可能性があります。

チャンク境界によって証拠と文脈が分断されることがある

固定サイズで分割すると、見出しが1つのチャンクに、主張が別のチャンクに、例外や表のラベルがさらに別のチャンクに入ることがあります。

Edtekのガイドでは、誤ったチャンク境界によって、クエリには言及していても完全な回答を含まない箇所が生成される仕組みを説明しています。

多くのチャンクが同じトピックを共有しているため、検索システムは正しいファイルを選択できる場合があります。しかし、生成モデルに不完全な箇所が渡されると、あたかもその主張を証明しているかのように、ファイルレベルのソースを引用してしまいます。

構造ベースのチャンク分割、親子検索、隣接チャンクの拡張は、ソース内のオフセットを追跡できる場合にのみ役立ちます。

引用メタデータが誤った粒度で付与されることがある

パイプラインによっては、ページ、セクション、バウンディングボックス、文字オフセットを保存せず、1つのドキュメントURLやファイル名をすべてのチャンクにコピーしています。

Tensorlakeの引用ガイドでは、空間アンカーをドキュメントの前処理から検索、回答生成まで引き継ぐ方法を紹介しています。

ファイルだけを指すポインターで証明できるのは、コーパス内の項目の出所であって、その文を裏付けるバイト列がどこにあるかではありません。箇所レベルの引用には、安定したチャンク識別子と位置メタデータが必要です。

引用にインデックス作成時のスナップショットまたはコンテンツハッシュも記録しない限り、OCR、PDFの再レイアウト、編集済みドキュメントによってオフセットが無効になることがあります。

似た箇所によって生成モデルがIDを混同することがある

コンテキストには、同じファイルから取得された、表現の似た複数のチャンクが含まれることがあります。モデルが1つの箇所の内容を使いながら、近くにある別のチャンクの引用ラベルを出力する可能性があります。

引用が重要なRAGに関する記事では、近接箇所の誤りは、引用されたドキュメントが権威あるものであっても起こり得ると警告しています。

チャンクには、明確で互いに似ていないIDを付け、引用を裏付けるテキストのすぐ隣に保持してください。統合後に別の引用マップをモデルに記憶させようとすると、不一致のリスクが高まります。

決定論的な引用文とチャンクの照合により、引用された箇所に主張または引用文が含まれていない場合を検出できます。

再ランキングではトピックの類似度だけでなく箇所の裏付けを評価する必要がある

第1段階の検索で、正しいファイルから多数のチャンクが取得されることがあります。再ランキングでは、単に同じトピックを共有するセクションではなく、クエリに直接答えるセクションを見分ける必要があります。

Databricksのチャンク分割ガイドでは、後続の検索段階で箇所を正確にランク付けするには、一貫性のある検索単位が必要だと強調しています。

完全なクエリで再ランキングを行い、箇所の見出しと親コンテキストを保持し、要求された項目、日付、エンティティ、証拠の種類を欠くチャンクには低いスコアを付けてください。

ZimaSpaceのドキュメント検索ワークフローでは、これらを1つの汎用的な「RAG品質」スコアにまとめず、別々の段階として扱っています。

引用を表示する前に正確な箇所を検証する

生成後、各事実文または引用文を、その裏付けを含むチャンクに対応付けます。正しいファイルだけを指している引用は却下してください。

Infolitzでは、引用をファイル全体のレベルで再構成するのではなく、ソースを含むチャンクに付与することを推奨しています。

箇所の適合率、証拠の完全性、引用文の包含、引用オフセットの有効性、引用された範囲が生成された主張を正確に裏付けているかを評価します。

引用をクリックしたときに正しいドキュメントのどこかが開くだけでなく、必要十分な最小の箇所が開くようになって初めて、システムは修正されたと言えます。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.