家族アーカイブのローカルRAG:情報源の系譜が調査と想起をどう変えるか

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

出典系譜を導入すると、家族アーカイブのRAGでは、取得されたすべての主張を、その背後にある正確な原本、派生物、変換、バージョンまで追跡できるようになります。

家系調査を行う人は、スキャンした証明書、手書きの手紙、インタビュー記録、編集済みのキャプション、同じ写真の複数のコピーを検索することがあります。通常の意味検索では、何が変更または省略されたのかを明らかにしないまま、扱いやすい派生物を取得してしまう可能性があります。出典系譜はこれらの関係を保持するため、適切な資料を含む再現率を確保しながら、調査上の結論を直接確認可能な一次資料に結び付けたままにできます。

出典系譜は原本と検索可能な派生物を区別する

家族アーカイブには、原画像、補正済みスキャン、OCRテキスト、翻訳された記録、トリミングされたコピー、そして何年も後に書かれたキャプションが含まれていることがあります。埋め込みはこれらのどれかを高く順位付けできますが、どのオブジェクトが歴史的出来事に最も近いのかまでは表現しません。出典系譜は、その欠けていた関係を追加します。

アーカイブ調査では、コピーまたは解釈された資料が、最初に残された記録にはない誤りを持ち込む可能性があるため、原資料と派生資料を区別します。役立つRAGインデックスは、すべてのファイルを同等のチャンクに平坦化するのではなく、この区別を保持すべきです。

そのため、検索結果では、OCRチャンクからスキャン画像、スキャン画像から物理資料、翻訳から記録、注釈から寄稿者へと続く親子関係を、主張と並べて表示できます。調査者は速度のために派生物を利用しながら、結論を受け入れる前に、利用可能な最も確かな資料へ戻ることができます。

プロヴェナンスは再現率をテキストの発見から文脈の回復へ変える

従来のRecall@kでは、関連するチャンクが表示されたかどうかを確認します。アーカイブにおける再現率は、結果が日付、作成者、コレクション、関係性、原本の配置順まで提示するかどうかにも左右されます。その文脈を欠いた段落は、クエリの言葉には答えていても、記録の意味を誤って伝える可能性があります。

デジタルアーカイブの証拠に関する研究では、選択、検索、メタデータが、デジタルコレクションで調査者が目にする証拠の基盤を形作ることが説明されています。つまり、検索設計は中立的な照会レイヤーではなく、歴史解釈の一部なのです。

出典系譜に対応したシステムは、無関係な分岐を混在させることなく、1件の一致結果から兄弟項目、親項目、同時代の記録へと展開できます。ユーザーには上位の一節だけでなく、それが人物、出来事、アルバム、または取得記録に属する理由も表示されます。調査は、証拠を起点とするグラフ探索になります。

出典系譜では家族資料の弱さを修復できない場合

出典系譜は連鎖を記録できますが、最初の資料が正確であることを証明するものではありません。自信を持ってラベル付けされた写真でも人物を取り違えている可能性があり、オーラルヒストリーは事実ではなく記憶を保持している場合があります。OCRは手書き文字を欠落させることがあり、メタデータだけでは失われた原本を再構成できません。

家系調査に関する研究では、家系調査を行う人が複数のデジタルプラットフォームを組み合わせ、情報を選択的に保存していることが示されています。その結果、ローカルインデックスを構築する前から欠落や不整合が生じます。

プロヴェナンスが増えれば、自動的に真実性が高まるわけではありません。連鎖はユーザーによる証拠の評価と修正を助けますが、裏付けのない主張を検証済みの事実に変えることはできません。機微な家族関係については、出典系譜が元の記録以上の情報を公開しないよう、アクセス制御も必要です。

1つの主張を回答から原本までたどって検証する

氏名、日付、場所、関係性、写真、インタビュー、相反する証言を含む、家系調査に関する質問を30件選びます。期待される資料オブジェクト、許容される派生物、必要な文脈、そしてその主張が不確かなままかどうかをラベル付けします。

プライベートAIの出典系譜を使用した場合と使用しない場合で検索を実行します。資料レベルのRecall@k、重複の統合、文脈の網羅率、バージョンの正確性、確認可能な原本まで到達した回答数を測定します。

作成者、日付、管理状況、変換、バージョン、関連記録を調査者が特定するのに役立つ出典系譜フィールドを保持します。未検証の注釈で終わる主張にはフラグを付け、不確実性を見える状態にし、流暢な要約によって証拠の連鎖がひそかに置き換えられることがないようにします。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.