メモリのランキングが繰り返し登場する古い事実をより強い証拠として扱い、矛盾する記録間の明示的な上書き関係を欠いていると、最近の訂正が負けることがあります。
家庭用エージェントは、古いパスワードを複数の要約、チャット、メモに保存した後で、「ゲストWi-Fiのパスワードが変わった」と一度だけ聞くことがあります。その後のクエリでは、必ずしも最新の真実ではなく、最も高いスコアを得たメモリが取得されます。バージョン、出所、競合処理のロジックがなければ、繰り返しの多さが新しさを上回り、訂正が今日の時点では弱い例外のように見えてしまいます。
繰り返されるメモリは検索上の優位性を蓄積する
メモリシステムでは、観察、要約、抽出された事実を別々の項目として保存することがよくあります。同じ事実を繰り返すと、意味的に類似したベクトルが複数作られるため、クエリによって同じ内容のコピーが複数返されることがあります。一見すると一致しているように見えますが、実際には重複であり、後段のモデルが裏付けとして解釈する可能性があります。
メモリの新鮮さに関する実用的な概要では、会話状態、検索、新しさ、出所、削除をそれぞれ別の設計課題として区別しています。メモリを単一の未分化な類似度インデックスとして扱うと、矛盾する事実を解決するために必要な関係が見えなくなります。この違いによって、最終的な家庭内の判断が変わります。
その結果、頻度バイアスが生じます。古いメモリが5件コンテキストを占有する一方で、訂正が取得対象の下限を下回るのです。top-kを増やせば競合が明らかになる可能性はありますが、どの記録を優先すべきかをエージェントに伝えることはできません。
訂正に必要なのは新しいタイムスタンプだけでなく上書き関係
堅牢なストアでは、定義された対象、述語、スコープ、有効時点について、事実Bが事実Aに置き換わることを表現します。古い記録は履歴として残せますが、現在の検索では除外または重みを下げます。出所情報には、誰が訂正したのか、どの権威あるイベントに基づくのかを記録します。
暗黙的なメモリ競合に関する研究では、新しい観察が明示的な否定を使わずに古いメモリを無効にする、暗黙的な競合が特定されています。「私たちはデンバーに引っ越した」は、「もうオースティンには住んでいない」と明言していなくても、現在の居住地を変えます。
新しさだけでは不十分です。古い事実の中には今も有効なものがあり、新しい発言の中には一時的なものや誤りもあるからです。上書き関係は、時間に意味的な関係、権威性、スコープを組み合わせることで、履歴を保持しながら、それを現在の真実として提示しないようにします。
自動的な競合解決が危険になる場面
モデルは、勤務先の住所と自宅の住所、一時的な予定と恒常的な希望など、異なる2つの事実を矛盾していると誤認する可能性があります。古い項目を自動的に削除すると、有用なコンテキストが失われ、後から訂正を監査することが難しくなります。
メモリの統合に関する概要では、短期層と長期層を分け、両者の間の制御された移動を重視しています。昇格、統合、忘却のポリシーが何を残すかを決めます。これらは中立的な保存操作ではありません。この境界は、後の証拠確認でも維持されます。
ID、スコープ、権威性が曖昧な場合、この仕組みは機能しません。その境界では、両方の記録を保持し、競合を提示して確認を求めてください。ユーザーが編集できるメモリストアでは、別のモデル推論に頼らず、訂正、統合、分割、削除を行えるようにする必要があります。
メモリの上書きテストを実行する
1つの事実を作成し、表現を変えた3つのやり取りで繰り返した後、有効日を明示した訂正を提示します。直接的なクエリ、言い換えによるクエリ、その事実に依存するタスクを通じたクエリを実行します。取得されたメモリID、スコア、タイムスタンプ、最終的なアクションを記録します。
ユーザー編集可能なメモリで推奨されているように、メモリをユーザーが編集できるようにし、正規の事実を変更したときに監査証跡を消去せず、後続の検索が更新されることを確認します。次に、一時的な例外を追加し、スコープが維持されるかをテストします。
現在のクエリが訂正を使用し、履歴に関する質問では古い状態を復元でき、曖昧な例外では黙って上書きせず確認を求める場合にのみ合格とします。メモリの要約または圧縮の後にも再度実行してください。これらの段階で古い事実が再生成される可能性があるためです。
テック&AIハブ
もっと読む

多言語埋め込み:1つのベクトル空間が言語の異なる家庭内文書をどのようにつなぐか
多言語間で整合された埋め込みが文書をどのようにつなぐのか、検索品質が変動する理由、そしてクロス言語のエビデンスカバレッジをローカルでテストする方法をご覧ください。

プライベート検索の再ランキング:第2のモデルが最終的な証拠の順序をどのように変えるか
第1段階の類似度と第2段階の関連性が一致しない理由、リランキングがプライベートRAGに役立つ場合、そして並べ替え後の根拠を評価する方法をご覧ください。

ローカルLLMのサンプリング:デコード設定が反復と安定性を変える理由
temperature、top-p、min-p、シード、ペナルティがどのように作用し合うか、そしてランダム性と品質を混同せずにデコード設定をテストする方法を学びましょう。

