ソースの鮮度は、個人用ホームAIナレッジベースに影響します。意味的に関連性の高い文書でも、すでに有効ではない家庭の状態を説明している可能性があるためです。
ローカルRAGシステムは、ルーター設定、家電のマニュアル、医療メモ、プロジェクトファイル、サービス手順、カレンダー、家族の記録などを、数か月から数年にわたってインデックス化することがあります。ソースが変更されても、古いチャンクが同じ質問に対して自動的に類似度を失うわけではありません。依然として非常に優れた意味的マッチであり続ける可能性があります。したがって、信頼できる回答には、単にファイルの日付を新しく保つだけでは不十分です。システムは、バージョン、信頼性、有効期間、削除状態、そしてユーザーが現在の状態を求めているのか、過去の状態を求めているのかを追跡する必要があります。
意味的関連性だけでは、どの事実が現在有効か分からない
埋め込み検索やキーワード検索は、クエリに似た文章を上位に表示します。しかし、ある設定、方針、住所、服薬スケジュールが別のものに置き換えられたことを、本質的に理解しているわけではありません。
時間的有効性に関する研究は、ある値が置き換えられた後でも、矛盾する事実や重複した事実が同程度に検索され続ける理由を示しています。
そのため、新しいソースは自動的に古いソースより上位になるのではなく、古いソースと競合することがあります。関連性だけで再ランキングすると、両方の文章が同じ表現の質問に答えている場合、誤ったバージョンを上位に表示する可能性があります。
鮮度の管理にはファイルシステムの更新日時だけでは不十分
更新日時からはファイルが変更されたことは分かりますが、どの記述が変更されたのか、新しいルールがいつ有効になったのか、また、そのファイルが質問に対して権威ある情報源なのかまでは分かりません。
IA-RAGは時間間隔をモデル化し、1つの大まかな日付を完全な時間モデルとして扱うのではなく、期間、重複、有効性を考慮して検索できるようにします。
有用なチャンクメタデータには、ソースのバージョン、取り込み日時、有効開始日と有効終了日、所有者、文書ステータス、親レコードへのリンクなどが含まれます。これらのフィールドによって、システムは現在有効、期限切れ、下書き、アーカイブ済み、過去の期間に有効だった証拠を区別できます。
コピーされたファイルでは、ファイルシステム上の日付が元の情報の古さではなく、コピー操作の日時を示している可能性があるため、さらに複雑になります。
更新後も古いチャンクと新しいチャンクが共存することがある
多くのパイプラインでは、以前のバージョンを削除せず、新しく埋め込み化したチャンクを追加します。その結果、変更された事実の周辺だけ文言が異なる、ほぼ重複したチャンクが検索結果に現れます。
古いリポジトリコンテキストに関する統制研究では、古くなった検索結果の証拠が単なるノイズとして振る舞うのではなく、モデルを積極的に古い状態へ誘導することが分かりました。
安定した文書IDとチャンクの系譜情報を使用し、再取り込み時に正しい過去のレコードを廃止または置換できるようにします。コンテンツハッシュは変更されていない内容の検出に役立ちます。一方、バージョン間の関係を記録すれば、履歴を保持しつつ、現在の状態を尋ねる質問に対してすべてのバージョンが同じ条件で候補になることを防げます。
削除もインデックスに反映させる必要があります。ソースファイルを削除しても、ベクトル、要約、キャッシュを残したままにすると、現在の所有者が存在しない証拠が作られます。
後継関係を記録すれば、履歴を保持しながら現在の情報と混同せずに済む
家庭では、最新のルーター設定と、障害発生前に使っていた設定の両方が必要になることがあります。古いバージョンをすべて削除すれば現在の検索は安全になりますが、過去を追跡できなくなります。
T-GRAGは時間的ナレッジグラフを使用し、変化する情報を表現し、時間的制約のもとで競合を解決します。
よりシンプルなホーム環境での実装では、レコードを「置換済み」としてマークし、置き換えたレコードを記録したうえで、質問が過去の日付や変更履歴を求めていない限り、廃止されたバージョンを除外できます。
この方法では、アーカイブとしての保持と、デフォルト検索の対象になるかどうかを分離できます。古い証拠を確認できる状態に保ちながら、現在の信頼できる情報源と暗黙に競合させずに済みます。
新しい情報が常に優れているとは限らず、クエリの意図で決まる
「現在のバックアップスケジュールは?」のような質問では、有効な最新バージョンを優先すべきです。一方、「7月より前に有効だったスケジュールは?」という質問では、過去の記録が必要です。
鮮度と関連性に関する従来の研究は、時間的な要求が文書だけでなくクエリの性質でもあることを示しています。
アシスタントは、明示された日付、「現在」や「以前」などの語、変更の比較を求めるタスクを検出すべきです。時間的な意図が不明確で、バージョン間に矛盾がある場合は、黙って1つを選ぶのではなく、競合を示す必要があります。
鮮度はエンドツーエンドの保守契約としてテストする必要がある
事実が変更された場合、ファイル名が変更された場合、1つのソースが削除された場合、2つの権威ある情報源が食い違う場合、そしてユーザーが現在と過去の両方について質問した場合を想定したテストケースを作成します。
ZimaSpaceのプライベート文書検索ワークフローは、取り込み、チャンク化、メタデータ、検索、引用を分離しています。そのため、誤った証拠が残った段階を特定しやすくなります。
更新遅延、古いチャンクの割合、現在の回答の正確性、過去の回答の正確性、削除済みソースの漏洩、引用されたバージョンを測定します。また、インデックスのバックアップやレプリカにも同じ廃止イベントが反映されることを確認します。
プライベートナレッジベースが新鮮であるとは、単に最近インデックス作成ジョブが実行されたということではありません。ソースの変更が、予測可能な検索状態の変化を引き起こすことを意味します。
FAQ
プライベートナレッジベースから古い文書は必ず削除すべきですか?
いいえ。過去のバージョンは価値があります。ただし、有効性のメタデータを付与し、質問が履歴を求めていない限り、現在の状態に関する回答からは除外すべきです。
再ランキングで古いソースの問題を解決できますか?
鮮度やバージョンの信頼性がランキングロジックに含まれている場合に限り、解決できる可能性があります。関連性だけで再ランキングすると、質問に近い表現を持つ古い文章が優先されることがあります。
ホームナレッジベースはどのくらいの頻度で更新すべきですか?
間隔はソースの変化の速さに合わせるべきです。カレンダーやデバイスの状態にはイベント駆動型の更新が必要になる場合がありますが、変化の少ないマニュアルははるかに低い頻度で確認できます。
テック&AIハブ
もっと読む

時系列のダウンサンプリングはスマートホームの異常検知にどのような影響を与えるか?
バケット幅、集計、アンチエイリアシング、欠損データ、イベント期間、マルチスケール保持によって、スマートホームの異常検出再現率がどのように変化するかをご覧ください。

占有グリッドは弱いスマートホーム信号をどのように統合するのか?
空間セル、センサーモデル、対数オッズ更新、減衰、相関した証拠、しきい値が、弱いホームセンサー信号を在室推定に変える仕組みを学びましょう。

測光正規化はプライベートな顔クラスタリングにどのような影響を与えるか?
照明補正によって、顔の切り出し画像、埋め込み、クラスタ間距離、しきい値、過剰正規化、プライベート写真検索の評価がどのように変わるかをご覧ください。

