Un système RAG privé peut-il rechercher des documents chiffrés sans les déchiffrer lorsqu’ils sont au repos ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Oui — si « sans les déchiffrer au repos » signifie que les documents restent chiffrés sur le support de stockage et ne sont déchiffrés qu’au sein d’un processus de confiance lorsqu’ils doivent être indexés ou récupérés. Il s’agit d’une conception réaliste pour un système RAG domestique privé. La recherche sémantique classique ne peut toutefois pas simplement fournir un texte chiffré opaque à un modèle de représentation vectorielle et lui demander de comprendre le document.

L’architecture pratique consiste donc à chiffrer le stockage au repos, à déchiffrer les données en mémoire de manière contrôlée, à utiliser des index dérivés chiffrés ou protégés par un contrôle d’accès, ainsi qu’à appliquer une séparation stricte des clés. La recherche directe dans du texte chiffré n’est possible qu’avec des techniques cryptographiques spécialisées, qui ne remplacent pas directement une base de données vectorielle classique.

« Chiffré au repos » ne signifie pas « jamais déchiffré »

Le chiffrement des données au repos protège les fichiers lorsqu’ils sont stockés sur un disque, un SSD, une cible de sauvegarde ou un appareil éteint. Un processus disposant de la clé appropriée peut tout de même déchiffrer les données lorsqu’une opération légitime doit être effectuée.

Document chiffré sur le disque
          |
          | lecture autorisée
          v
Mémoire du processus RAG de confiance
  ├─ déchiffrer
  ├─ analyser / segmenter
  ├─ vectoriser
  └─ récupérer
          |
          v
Index chiffré / base de données protégée

Cela ressemble au fonctionnement de nombreuses bases de données et de nombreux systèmes de fichiers chiffrés : le support de stockage ne contient pas de texte en clair exploitable, mais les applications peuvent voir le texte en clair après autorisation.

Cette conception est compatible avec un assistant IA privé sur un NAS. L’essentiel est de définir où le texte en clair peut exister et pendant combien de temps.

Pourquoi la recherche vectorielle classique ne peut pas effectuer de recherche sur du texte chiffré brut

Un modèle de représentation vectorielle a besoin de caractéristiques significatives provenant du texte, de l’image ou de l’audio. Le chiffrement conventionnel détruit intentionnellement les motifs visibles afin que le texte chiffré ne conserve pas les relations sémantiques dont le modèle a besoin.

Si deux phrases en clair sont similaires, leurs textes chiffrés de manière sécurisée ne devraient pas sembler commodément similaires. Cela divulguerait des informations sur les textes originaux.

Un parcours d’ingestion RAG normal procède donc comme suit :

  1. Authentifiez le processus.
  2. Déchiffrez le document en mémoire ou dans une zone temporaire strictement contrôlée.
  3. Extrayez et normalisez le contenu.
  4. Créez des segments et des représentations vectorielles.
  5. Stockez les données de recherche dérivées sous leur propre politique de protection.
  6. Supprimez le texte en clair temporaire lorsque l’ingestion est terminée.

L’affirmation selon laquelle « les documents chiffrés restent chiffrés au repos » peut rester vraie tout au long de ce processus, car le texte en clair n’a jamais besoin de devenir un fichier persistant sur le disque.

Les représentations vectorielles ne sont pas identiques au document original — mais elles restent sensibles

Une erreur courante consiste à chiffrer les PDF tout en laissant les représentations vectorielles, le texte des segments, les noms de fichiers, les métadonnées et les instantanés de bases de données vectorielles sans protection. Cela déplace le problème de confidentialité au lieu de le résoudre.

Artefact Peut-il révéler des informations ? Traitement recommandé
Fichier original Oui, directement Chiffrer au repos
Texte extrait des segments Oui, directement Chiffrer ou éviter le stockage persistant en clair
Vecteur de représentation Potentiellement, en tant que dérivé sémantique Protéger comme des données sensibles
Nom de fichier / balises Souvent Minimiser et contrôler l’accès
Index vectoriel Peut révéler des relations et des appartenances Chiffrer le stockage et restreindre l’accès
Sauvegarde / instantané Contient des copies historiques Chiffrer indépendamment

La documentation actuelle de sécurité de Qdrant souligne qu’un déploiement auto-hébergé doit être explicitement sécurisé. Le chiffrement du stockage relève de la responsabilité de l’infrastructure dans les environnements autogérés ; il ne faut pas le considérer comme acquis simplement parce que la base de données est locale.

Pour un système de recherche privé, considérez les représentations vectorielles comme faisant partie de la base de connaissances protégée, et non comme de simples fichiers de cache inoffensifs.

Où les clés de déchiffrement doivent-elles être conservées ?

Ne stockez pas la clé de déchiffrement à côté des documents chiffrés dans un fichier de configuration lisible par tous. L’objectif est que le vol du disque ou la copie d’une sauvegarde ne suffise pas à récupérer les données.

Une conception plus robuste pour un laboratoire personnel sépare les éléments suivants :

  • volume de données : documents et fichiers de base de données chiffrés ;
  • matériel de clé : trousseau de clés du système d’exploitation, stockage de clés matériel ou magasin de secrets protégé séparément ;
  • identité du service : le processus RAG ne reçoit que les clés dont il a besoin ;
  • clés de sauvegarde : conservées ailleurs que dans l’unique copie de la sauvegarde chiffrée.

Le chiffrement du disque seul ne peut pas protéger un serveur en fonctionnement entièrement déverrouillé contre une compromission au niveau administrateur. Il protège contre une autre menace : les disques volés, les copies hors ligne, le matériel mis au rebut et l’accès non autorisé aux supports de sauvegarde.

Comment éviter les fichiers temporaires en clair ?

De nombreux analyseurs de documents créent discrètement des fichiers temporaires. Les pipelines d’OCR peuvent décompresser des pages, les convertisseurs de documents bureautiques peuvent écrire des formats intermédiaires et les outils PDF peuvent mettre en cache les ressources extraites.

Auditez le chemin d’ingestion et choisissez l’un des trois modèles suivants :

  • transférez directement les octets déchiffrés vers l’analyseur ;
  • utilisez un système de fichiers temporaire en mémoire vive pour les fichiers intermédiaires ;
  • placez le stockage temporaire sur un volume chiffré et supprimez-le immédiatement après le traitement.

Examinez également les journaux. Un journal de « débogage » qui affiche le texte des documents, les invites, les segments récupérés ou les arguments des outils peut devenir la plus grande copie non chiffrée de la base de connaissances.

Le chiffrement homomorphe peut-il rechercher les documents sans déchiffrement ?

Le chiffrement homomorphe est la technologie vers laquelle la plupart des gens se tournent lorsqu’ils veulent effectuer des calculs sur des données chiffrées. La documentation de Microsoft SEAL explique que les schémas homomorphes peuvent effectuer certains calculs tandis que les valeurs restent chiffrées.

Mais cela énonce également une limite importante : le chiffrement homomorphe entraîne une surcharge considérable en matière de performances et ne prend efficacement en charge que certaines opérations. Microsoft SEAL prend en charge des opérations arithmétiques telles que l’addition et la multiplication chiffrées ; les comparaisons générales, le tri et les expressions régulières ne sont généralement pas pratiques de la même manière qu’avec un calcul en clair.

Des calculs de distance approchés peuvent être construits avec des schémas tels que CKKS ; la recherche sur la recherche vectorielle préservant la confidentialité est donc bien réelle. Cela ne signifie pas pour autant qu’une recherche sémantique chiffrée équivaut à installer Qdrant, pgvector ou Weaviate et à activer une option « requête chiffrée ».

Approche Aspects pratiques du RAG à domicile Compromis principal
Disque chiffré + déchiffrement en mémoire Élevé Le processus en cours peut accéder au texte en clair
Volume de base de données chiffré Élevé Protège le stockage, pas un environnement d’exécution compromis
Chiffrement interrogeable / homomorphe Spécialisée Complexité, modèles de fuite, performances
Téléverser le texte chiffré vers une base de données vectorielle ordinaire Pas utile Aucune structure sémantique ne subsiste

Une conception RAG privée plus sûre

Pour la plupart des foyers et des petites équipes, le meilleur rapport sécurité-complexité se présente ainsi :

Jeu de données NAS chiffré
      |
      | Clé limitée au service
      v
Conteneur d’ingestion RAG
      |
      +-- texte en clair uniquement en mémoire / stockage temporaire chiffré
      |
      +-- vecteurs d’intégration + métadonnées
      v
Volume de base de données vectorielle chiffré
      |
      v
Service de récupération local
      |
      | nombre minimal de segments récupérés
      v
Modèle local ou modèle cloud approuvé

Si un modèle cloud intervient, le stockage peut rester parfaitement chiffré tandis que le texte récupéré quitte tout de même le domicile dans l’invite. Le chiffrement du stockage et le contrôle de l’exfiltration des données sont deux problèmes distincts. Le guide sur les limites de confiance de l’IA locale est utile ici : le composant autorisé à déchiffrer les données ne devrait pas automatiquement être autorisé à les transmettre.

Liste de contrôle du chiffrement d’un RAG privé

  • Chiffrez le volume contenant les documents sources.
  • Protégez également le stockage de la base de données vectorielle, les instantanés et les sauvegardes.
  • Conservez les clés en dehors des répertoires ordinaires de documents.
  • N’accordez au service RAG que les accès minimaux nécessaires aux clés et aux chemins.
  • Évitez les caches d’extraction persistants en clair.
  • Inspectez les répertoires temporaires utilisés pour l’OCR, la conversion et le débogage.
  • Par défaut, n’enregistrez pas les segments privés récupérés dans les journaux.
  • Séparez les autorisations de récupération locale des autorisations d’envoi vers le cloud.
  • Testez la récupération avant de faire tourner ou de supprimer les clés de chiffrement.

Le guide sur la recherche documentaire et le RAG peut aider à appliquer cette couche de sécurité à l’extraction, au découpage en segments, à la génération d’embeddings et à la récupération.

FAQ

Une base de données vectorielle peut-elle indexer directement un PDF chiffré avec AES ?

Non. Le contenu doit être déchiffré par un processus autorisé avant qu’un modèle d’embeddings textuel ou multimodal classique puisse en extraire la sémantique.

Le chiffrement intégral du disque protège-t-il un serveur RAG en fonctionnement ?

Seulement en partie. Une fois le volume déverrouillé, les processus privilégiés peuvent le lire. Le chiffrement intégral du disque offre la meilleure protection contre les accès hors ligne, les disques volés et les supports copiés.

Faut-il chiffrer les embeddings ?

Pour les connaissances privées sensibles, oui : protégez le stockage contenant les embeddings et les index, limitez l’accès à la base de données et incluez ces fichiers dans le même audit de sécurité que les documents sources.

Verdict final

Un système RAG privé peut conserver les documents chiffrés au repos sans renoncer à la recherche sémantique classique. Le schéma réaliste consiste à déchiffrer les données de manière contrôlée et temporaire dans une mémoire de confiance, et non à effectuer une recherche magique sur un texte chiffré opaque. Protégez les embeddings et les index dérivés, séparez les clés des données, éliminez les fichiers temporaires en clair et considérez la recherche homomorphe comme une conception cryptographique spécialisée plutôt que comme une fonctionnalité RAG domestique courante.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.