ドキュメントをインポートする前のプライベートRAGストレージチェックリスト

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

元データ、抽出テキスト、チャンク、埋め込み、メタデータ、ログ、権限、削除、復旧のそれぞれに明確な保存上の役割を定義してから、プライベートなドキュメントをインポートしてください。

取り込み前にドキュメントを分類する

ドキュメントの所有者、機密性、保持期間、法的または家庭内の制限、コンテンツをローカルネットワークの外部に持ち出してよいかどうかを一覧化します。RAGシステムに不要なファイルは削除してください。

セキュリティに重点を置いたRAGベクトルデータベース分析では、埋め込み、ドキュメントテキスト、メタデータが、同じ検索体験を支えている場合でも、それぞれ異なる情報漏えい経路を生むことが説明されています。

  • 所有者と機密性ラベルを割り当てる。
  • 利用を許可するユーザーまたはグループを定義する。
  • 保持および削除の要件を記録する。
  • 秘密情報、トークン、不要な個人データを除外する。

ソース、派生データ、実行時状態を分離する

不変のソースエクスポートを、解析済みテキスト、チャンク、埋め込み、ベクトルインデックス、アプリケーションメタデータ、会話ログ、一時キャッシュから分離して保管します。各レイヤーには異なる再構築コストがあります。

安定したドキュメントID、ソースバージョン、チャンクの順序番号、埋め込みモデルのバージョンを使用します。これらのキーがないと、再試行によって重複が発生し、インデックスとソースを確実に照合できなくなります。

プロンプトログと検索ログは機密データとして扱います。元のソースファイルが保護されていても、クエリの意図やドキュメントの断片が明らかになる可能性があります。

復旧上の役割に応じてストレージを選ぶ

データの役割 主な要件 復旧時の対応
元のドキュメント 完全性とアクセス制御 正確なソースバージョンを復元する
抽出テキストとチャンク 追跡可能性 再生成または復元する
埋め込みとインデックス 高速な検索 バージョン管理されたソースから再インデックスする
メタデータデータベース 識別性と一貫性 アプリケーション整合性を保って復元する
ログ 保持期間を限定した監査 必要な場合のみ復元する

本番環境のベクトルストレージには、先行書き込みログ、スナップショット、コンパクションへの対応、復元テストが必要です。このベクトルデータベースアーキテクチャの概要でも、埋め込み、メタデータ、ソースバージョンを同期させておく必要性が強調されています。

エンジンが整合性のためにメタデータデータベースやWALを必要とする場合、ベクトルファイルだけをバックアップしないでください。唯一のソースコピーを取り込み用ワークスペース内に保存しないでください。

アクセス、削除、バックアップを検証する

サービスIDとユーザーIDを分離し、最小権限のコレクションまたは名前空間、暗号化された通信、脅威モデルに適したストレージ暗号化を使用します。バックアップ認証情報はRAGアプリケーションの外部で管理してください。

1つのドキュメントを削除するテストを行います。検索対象から除外し、派生したすべてのチャンクを削除またはトゥームストーン化し、インデックスを更新して、完了を記録します。ソースを削除したのに埋め込みが検索可能なままなら、削除は不完全です。

小規模なコレクションを分離したインスタンスに復元し、ドキュメント数、バージョン、検索結果、アクセスルールを比較します。

インポートまたは停止の判断基準を設ける

すべてのドキュメントクラスに所有者があり、ストレージの役割が分離され、アクセスを取り消すことができ、削除が反映され、ソースとアプリケーションの状態を復元できる場合にインポートします。

埋め込みやログに機密情報が含まれる可能性があるか判断できない場合、または再インデックスにかかる時間が復旧目標を超える場合は延期します。ホームサーバーOSガイドを参考に、RAGサービスに適したホストへ配置できます。

パイプラインが、非公開にすべきデータに対してパブリックなオブジェクトストレージ、共有された管理者認証情報、またはバージョン管理されていないインデックスを必要とする場合は、停止してください。

よくある質問

埋め込みは匿名データとして安全に扱えますか?

いいえ。埋め込みにはソースコンテンツに関する情報が保持される可能性があるため、元のドキュメントと同じアクセス、保持、削除の審査に従う必要があります。

バックアップせずにベクトルインデックスを再構築できますか?

はい。正確なソースバージョン、解析ルール、チャンクID、埋め込みモデル、アプリケーションメタデータが保持され、再構築時間が復旧目標を満たす場合に限ります。

プロンプトログと検索ログはベクトルデータベースと一緒に保存すべきですか?

必要な場合に限ります。ログにはクエリ、ドキュメントの断片、ユーザーIDが含まれる可能性があるため、独自の保持ポリシーとアクセスポリシーを設定してください。

まとめ

現実の設置場所とネットワーク環境で、すべての必須要件を満たすことを確認してから購入してください。そうでなければ、待つか、設計を縮小するか、よりシンプルなプラットフォームを選びましょう。

購入ガイド

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.