合成クエリ拡張は、もっともらしい言い換えや分野固有の用語を追加することで、質問と保存された証拠の間にある語彙の隔たりを埋め、RAGの再現率を向上させることがよくあります。
家族の一人が「ボイラーの点検」と尋ねても、スキャンされた請求書には「年次温水暖房サービス」と記載され、家庭内で使われる表現が一度も登場しないことがあります。語句の完全一致に基づく検索ではこのつながりを見逃します。クエリ拡張では、別の表現や仮の回答を生成し、それぞれの表現で検索してから、再ランキングの前に候補を統合します。これにより、関連する証拠がコンテキストウィンドウに入る経路を複数確保できます。
1つの質問が複数の検索意図を表すことがある
短い家庭内のクエリでは、正式な製品名、日付、場所、または情報源で使われている用語が省略されることがあります。拡張によって、関連フレーズ、サブクエリ、または合成パッセージを生成し、こうした潜在的な解釈を明示できます。スパース検索では新たな一致語が得られ、密検索では追加の意味的な視点が得られます。
Query2doc手法では、言語モデルに疑似文書を生成させ、それを元のクエリに追加します。実験では、基盤となる検索器を再学習しなくても、追加テキストによってスパース検索と密検索の両方を改善できることが示されています。
この仕組みによって、クエリがより真実になるわけではありません。候補生成の対象範囲を広げた後、元の質問に答える候補と、生成された補足説明に答える候補を、統合と再ランキングで見分ける必要があります。この違いは、後の家庭内テストでも確認できます。
合成パッセージがクエリと文書の語彙の隔たりを埋める
仮想文書は、そこに含まれる事実が創作であっても、想定される証拠の文体や語彙に似せることができます。システムはこの合成パッセージを埋め込み、その近くにある実際の文書を検索します。生成はユーザーに提示する証拠ではなく、意味的な橋渡しとして使われます。
仮想文書埋め込みでは、ゼロショット密検索のために仮想文書を作成してから埋め込みます。重要なのは、生成テキストが検索を導く一方で、最終回答で認められる証拠は返却されたコーパス文書だけだという明確な分離です。
複数の拡張によって、略語、愛称、翻訳、技術的詳細の異なるレベルをカバーできます。候補の統合によって再現率は向上しますが、重複除去と再ランキングが必要です。そうしなければ、10個の書き換えによって、ほぼ同一または関連性の低いチャンクがリストを占有する可能性があります。
拡張がもっともらしいが誤ったトピックへ逸脱することがある
生成器は、曖昧な名前を誤って解釈したり、その家庭が所有していない製品を持ち出したり、日付を捏造したりする可能性があります。そうした語句によって、誤った対象について内部的には整合した文書が検索され、元のスパースクエリよりも確信度の高いノイズが生じることがあります。
補完的なクエリ書き換えに関する統制研究では、組み合わせによって一部のデータセットではカバレッジが向上する一方、曖昧な質問のベンチマークでは悪化する可能性が示されています。この結果は、拡張をクエリの種類に応じて制御し、強力なベースラインと比較評価する必要性を示しています。
失敗しやすいのは、中心となる対象や意図が不確かなクエリです。元のクエリを保持し、合成テキストを検索補助として明示し、統合時の影響を制限し、拡張結果が証拠セットについて一致しない場合は回答を控えてください。
拡張の貢献度を検証する
略語、くだけた名称、翻訳、クエリには含まれない正式な用語を含む、実際の家庭内の質問を30件作成します。検証済みの根拠チャンクを記録し、同じインデックス、top-k予算、再ランキング器を使って、元のクエリのみの検索と提案する拡張経路を実行します。
略語検索の評価手法を使って、再現率と引用カバレッジを追跡します。追加された関連チャンクごとに、どの書き換えで見つかったかを保存します。また、新たに生じた無関係な候補ごとに、逸脱の原因となった用語と、再ランキングで除外されたかどうかを記録します。
許容できない精度低下や遅延を伴わず、ホールドアウトデータの再現率を向上させる場合にのみ拡張を有効にします。改善が単に候補予算の拡大によるものなら、合成された表現の効果だと判断する前に、同じ予算で元のクエリを実行した結果と比較してください。
テック&AIハブ
もっと読む

ホームナレッジベースにおけるRAGの引用精度を決める要因とは?
関連性のあるソースでも誤った引用になり得る理由、サポートと網羅性を左右するパイプラインの段階、そして家庭向けRAGの主張を監査する方法を学びます。

ローカルLLMで信頼性の高いJSON出力を可能にする機能とは?
JSON構文を強制する機能、意味的な正確性を保護する機能、そしてスキーマ、プロンプト、失敗ケース全体でローカルモデルをテストする方法をご確認ください。

ローカルAIのデータ来歴:なぜすべての回答に追跡可能なソースパスが必要なのか
ソースパスによってローカルAIの回答を検証可能にする方法、引用だけでは不十分な理由、そして更新や削除を通じてデータの系譜をテストする方法を学びます。

