信頼性の高いバージョン選択では、ベクトル類似度が最新のテキストを優先してくれると期待するのではなく、文書の同一性と時間的な有効性を検索条件として扱う必要があります。
NASには、複数の機器マニュアル、保険契約書、編集済みの家族計画など、文言がほぼ同一の文書がいくつも保存されている場合があります。関連性と有効性は異なるシグナルであるため、密ベクトル検索では、現在有効な改訂版より古い改訂版が上位に表示されることがあります。バージョン対応パイプラインでは、不変の改訂版を保存し、後継関係と有効日をモデル化し、クエリの時点を解釈して、使用した正確な改訂版を引用します。
安定したソースIDと改訂版IDで同一性と場所を分離する
1つの論理文書には安定したソースIDを保持し、取得した各改訂版には、不変の改訂版ID、コンテンツハッシュ、取り込み時刻、有効期間、ライフサイクル状態、パスの対応関係を付与します。チャンクは曖昧な「最新」ラベルではなく、両方の識別子を継承します。
バージョン対応検索フレームワークは、バージョン系列、コンテンツ境界、変更内容を明示的にモデル化し、バージョン依存の質問において単純なRAGを大きく上回る成果を報告しています。この設計は、類似したテキストに構造化されたバージョン情報が必要な理由を示しています。この区別は、その後の家庭環境でのテストでも確認できます。
後継関係のリンクによって、ある改訂版が以前の文書を完全に置き換えるのか、一部のセクションだけを修正するのか、それとも別の製品バージョンに対して有効なままなのかを表現できます。パスの変更時刻だけではこうした関係を表せず、実際の有効性ではなくコピー操作を反映している可能性もあります。
クエリの時点と適用対象を検索に組み込む
クエリでは、現在の規則、昨年時点の規則、特定のファームウェアバージョン向けの手順などが求められる場合があります。クエリ処理では、候補の順位付け前に、明示的および暗黙的な時間的制約に加え、製品、管轄区域、所有者、ライフサイクルのコンテキストを抽出します。
時間依存検索の制約に関するデータセット研究は、質問に時間的制約が含まれている場合、意味的なマッチングによって古い証拠が検索される可能性を説明しています。これは、時間依存の検索を静的な事実想起とは分けて評価する必要性を裏付けています。自動化を進める前に、中間結果を検査可能な状態に保つ必要があります。
ベクトル検索の前に適格な改訂版を絞り込み、その後、時間的スコアリングによって重複する候補の順位を変更できます。システムは常に最新のファイルを優先すべきではありません。過去に関する質問では、指定された時点で有効だった改訂版が必要です。
重複する改訂には競合処理と系譜ロジックが必要
更新によって1つの条項だけが置き換えられ、文書の残りの部分は有効なままになることがあります。各スナップショットを独立したチャンクに分割すると、類似した重複が大量に生じ、古い改訂済み条項と、現在も変更されていない内容を組み合わせてしまう可能性があります。バージョンの系譜には、セクション単位の境界と有効性が必要です。
意味・時間検索アプローチは、重複しながら進化する文書に対して意味的関連性と時間的関連性を組み合わせ、nDCG@10の向上を報告しています。これは、改訂版同士が意味的に類似している場合、時間が単なるメタデータ上の同点判定要素ではない理由を示しています。この境界は、現実的な運用条件の下で個別に測定すべきです。
失敗の境界となるのは、適用対象が不明な場合です。有効日が欠落している、ファイル名が曖昧である、または有効な改訂版同士が競合している場合は、自動的に「最新」を選ばず、確認を求めるか回答を保留する必要があります。レビュー担当者がソース記録を解決できるよう、競合する候補とそのメタデータを保持します。
現在・過去・曖昧なバージョンに関するクエリをテストする
完全な置き換え、一部改訂、遡及適用された改訂、重複コピー、名前変更されたファイル、下書き、アーカイブ済みバージョン、そして有効日が欠落した文書を含むフィクスチャを作成します。各質問について、正しい改訂版または想定される回答保留をラベル付けします。複数のソースが限られたコンテキストを奪い合うときに、実際の影響が現れます。
回答ソースの系譜にある系譜チェーンを使った選択結果と比較します。適格なバージョンの再現率、誤ったバージョンの割合、混在バージョンによる回答、引用の解決率、明示的な日付、相対的な日付、ファームウェアバージョン、現在の状態を尋ねる質問への対応を測定します。この依存関係は、最終インターフェースでも明示的に保つ必要があります。
すべての回答が適用対象となる不変の改訂版を引用し、曖昧なケースが未解決のまま残る場合にのみ合格とします。新しさを重視すると現在に関するクエリは改善する一方、過去に関するクエリが壊れる場合は、単一の鮮度重みを増やすのではなく、適用対象の絞り込みと一般的な順位付けを分離します。
テック&AIハブ
もっと読む

NASファイル全体でのハイブリッド検索を可能にするコンポーネントとは?
正確な識別子と意味が、権限を回避したり不十分な証拠を隠したりすることなく、どのようにして1件の順位付けされたNAS検索結果に結び付くのかを学べます。

エージェントの計画が利用可能なツール権限と乖離する要因とは?
発見、委任、ポリシーフィードバック、再計画によって、AIエージェントが提案する手順と、ツールで実際に実行できることとの整合性がどのように保たれるかを学びます。

複数ステップのAI自動化で人間による承認を可能にするコンポーネントとは?
自動化がワーカーを占有せずに一時停止し、レビュー可能な変更を提示したうえで、遅延や再起動の後も承認された正確な分岐から再開する仕組みをご覧ください。

