Oui, mais le RAG hybride ne conserve les documents en local que si la récupération, l’application des politiques et la construction des prompts empêchent les passages sensibles de franchir la frontière du cloud.
Un family office peut stocker ses contrats sur un NAS domestique, créer localement les représentations vectorielles et appeler un modèle cloud uniquement pour les raisonnements complexes. Les originaux ne sont jamais téléversés sous forme de fichiers, mais un paragraphe récupéré peut tout de même apparaître mot pour mot dans un prompt d’API. La confidentialité dépend donc du texte qui franchit la frontière, des contrôles de conservation du fournisseur et de la capacité du routeur local à répondre ou à expurger les données avant toute requête externe.
Le stockage local ne signifie pas automatiquement une divulgation locale
Un système RAG hybride sépare le plan documentaire du plan de raisonnement. Les fichiers, le texte analysé, les métadonnées, les représentations vectorielles et l’index vectoriel peuvent rester sur un serveur domestique. Au moment de la requête, la récupération locale sélectionne quelques segments, et seuls ces segments, accompagnés de la question et des instructions, doivent parvenir au modèle cloud. Cela réduit fortement l’exposition, sans toutefois l’éliminer.
L’architecture RAG originale associe un récupérateur à un générateur en fournissant les passages récupérés comme contexte au modèle. C’est cette connexion qui constitue la frontière de confidentialité : les représentations vectorielles peuvent rester en local, mais le générateur peut tout de même voir le texte sélectionné. Chiffrer le NAS ou masquer le nom du fichier source ne protège pas un passage une fois que l’application en a placé le contenu dans un prompt sortant.
Une conception utile consiste à étiqueter chaque objet de données selon son rôle. Les originaux et le stockage du texte intégral sont réservés au local ; les représentations vectorielles et les index sont consultables localement ; les passages récupérés peuvent être communiqués sous conditions ; les prompts et les réponses suivent la politique du fournisseur sélectionné. Ce modèle en couches est cohérent avec l’utilisation d’un assistant IA privé comme passerelle contrôlée, plutôt que de considérer un disque local comme une solution complète de confidentialité.
Une passerelle de politiques doit s’exécuter après la récupération, et non avant
Des autorisations appliquées uniquement lors de l’ingestion sont trop générales. Un même document peut contenir des informations produit publiques, des tarifs internes, des adresses personnelles et des notes couvertes par le secret professionnel. Le système a besoin d’une passerelle post-récupération qui évalue les segments exacts sélectionnés pour cet utilisateur et cette destination. Elle peut bloquer, expurger, résumer localement ou acheminer toute la question vers un modèle local.
Des outils comme la détection Presidio peuvent identifier et anonymiser les informations personnelles courantes avant que le texte ne quitte l’environnement de confiance. La détection ne constitue toutefois pas une preuve de sécurité : des noms de projets, des conditions commerciales, un contexte médical ou une combinaison inhabituelle de faits ordinaires peuvent être sensibles sans correspondre à un schéma standard de données personnelles. Les règles de classification doivent refléter le corpus réel.
La politique doit évaluer séparément l’autorisation de l’utilisateur et l’éligibilité au traitement cloud. Une personne peut être autorisée à lire un document local sans être autorisée à le transmettre à un tiers. À l’inverse, un segment approuvé pour un traitement cloud doit tout de même être réduit au plus petit passage nécessaire pour répondre. Davantage de contexte récupéré n’est pas automatiquement plus sûr ou plus précis ; cela augmente à la fois la surface de divulgation et le bruit du prompt.
Les contrôles du fournisseur réduisent les risques, mais ne redéfinissent pas le local
Les conditions de confidentialité du cloud sont importantes, car les prompts sortants deviennent des données traitées par le fournisseur même lorsque le fichier source reste chez vous. Le chiffrement en transit protège le réseau, tandis que la conservation, la surveillance des abus, le stockage de l’état de l’application, le traitement régional et les politiques d’entraînement des modèles déterminent ce qui se passe ensuite. Ces contrôles peuvent rendre une conception hybride acceptable, mais ils ne transforment pas une inférence cloud en traitement local.
Les contrôles actuels des données de l’API OpenAI distinguent les journaux de surveillance des abus de l’état de l’application et indiquent quels points de terminaison peuvent bénéficier de la conservation nulle des données. Les détails peuvent varier selon la fonctionnalité, l’éligibilité du compte et la configuration. Un examen de confidentialité doit donc lier le routeur à un point de terminaison et à des paramètres approuvés, plutôt que de s’appuyer sur une promesse générale selon laquelle les données d’API ne sont pas utilisées pour l’entraînement.
L’affirmation « local uniquement » devient fausse lorsque des segments bruts, des noms de fichiers, l’historique des conversations, les traces d’outils ou les prompts mis en cache sont transmis sans décision explicite de la politique. Elle devient également fausse lorsqu’une application change silencieusement de fournisseur après une erreur. Le routage hybride doit adopter un refus par défaut pour les collections protégées : si le chemin cloud approuvé est indisponible, il faut répondre localement avec une qualité moindre ou refuser, plutôt que d’envoyer le même contexte ailleurs.
Utilisez un registre des divulgations pour vérifier la frontière
Testez la confidentialité au niveau de la requête sortante, et non du tableau de bord de stockage. Injectez dans un corpus de test des chaînes sentinelles uniques représentant des données personnelles, des noms de projets confidentiels et des clauses restreintes. Posez des questions conçues pour les récupérer, capturez la charge utile complète de l’API après rendu et notez quelle règle de politique a autorisé, transformé ou bloqué chaque élément.
Les protections des données professionnelles peuvent inclure le chiffrement, le traitement régional et une conservation configurable, comme le résument les engagements relatifs aux données professionnelles d’OpenAI. Le registre des divulgations doit consigner, pour chaque appel externe, le service exact, le point de terminaison, le mode de conservation, la région de destination, les champs du prompt et le résultat de l’expurgation. Réexécutez le test après toute modification du modèle, du framework ou du fournisseur.
N’approuvez l’architecture que lorsque les chaînes sentinelles réservées au local n’apparaissent jamais dans les charges utiles sortantes capturées, que les segments transmissibles sont réduits au minimum et que les solutions de repli du fournisseur respectent la même politique. Si une chaîne sentinelle sensible s’échappe, corrigez la passerelle post-récupération au lieu de déplacer les originaux dans un autre dossier. La frontière est la requête sérialisée qui quitte le réseau domestique, et non l’emplacement physique du document source.
| Couche | Emplacement par défaut | Règle cloud |
|---|---|---|
| Fichiers originaux | Serveur domestique | Ne jamais envoyer |
| Représentations vectorielles et index | Serveur domestique | Conserver en local sauf approbation explicite |
| Segments récupérés | Zone de préparation locale | Classer, réduire, puis autoriser ou bloquer |
| Question et instructions | Routeur local | Supprimer les identifiants lorsque c’est possible |
| Réponse cloud | Retour vers l’application locale | Appliquer la politique de conservation et d’audit |
FAQ
Les représentations vectorielles locales révèlent-elles le texte original ?
Les représentations vectorielles ne remplacent pas le contrôle d’accès. Elles sont moins directement lisibles que le texte source, mais peuvent conserver des informations sémantiques et être vulnérables à des attaques par inférence. Stockez-les et autorisez leur accès comme des données dérivées sensibles.
Le modèle local peut-il résumer un segment avant son utilisation dans le cloud ?
Oui, mais un résumé peut conserver des faits sensibles ou introduire des substitutions trompeuses. Appliquez la même classification au résumé, comparez-le à la source et traitez-le comme un nouvel objet de données sortant plutôt que comme une garantie automatique de confidentialité.
La conservation nulle des données suffit-elle à elle seule ?
Non. Elle traite un risque côté fournisseur. L’application a toujours besoin d’une récupération selon le principe du moindre privilège, d’une inspection des données sortantes, de contrôles d’identité, du verrouillage des points de terminaison, de journaux qui évitent de stocker des secrets et d’une règle définissant ce qui ne doit jamais quitter le serveur domestique.
Centre Tech & IA
Plus à lire

Plongements multilingues : comment un espace vectoriel unique relie des documents domestiques dans différentes langues
Découvrez comment les embeddings alignés relient des documents dans différentes langues, pourquoi la qualité de la recherche varie et comment tester localement la couverture...

Conflits de mémoire des agents : pourquoi des corrections récentes peuvent céder face à d’anciens faits répétés
Découvrez comment les anciens souvenirs en double prennent le dessus sur les corrections, dans quels cas les règles de récence échouent et comment tester...

Réordonnancement privé des résultats de recherche : comment un second modèle modifie l’ordre final des éléments probants
Découvrez pourquoi la similarité de première étape et la pertinence de deuxième étape divergent, quand le réordonnancement améliore le RAG privé et comment évaluer...

