Un bac à sable pour outils contient les effets secondaires d’un agent IA en imposant des limites de ressources et de capacités en dehors du modèle, même lorsque l’action proposée est dangereuse.
Un agent domestique peut générer du code pour renommer des photos, inspecter des documents ou appeler un service réseau. Au lieu de s’exécuter avec l’intégralité du compte du propriétaire, le bac à sable expose une vue limitée du système de fichiers, un réseau restreint, un nombre limité de processus, des ressources CPU et mémoire plafonnées, ainsi que des identifiants limités à la tâche. Les actions peuvent toujours échouer ou être malveillantes, mais leur rayon d’action potentiel est plus réduit.
L’isolation crée un environnement d’exécution plus restreint
Les conteneurs, machines virtuelles, microVM, utilisateurs restreints, espaces de noms et filtres d’appels système séparent le processus de l’outil de l’hôte. Les images de base en lecture seule et les montages explicites déterminent quels fichiers sont visibles et quelles modifications peuvent persister. Cette distinction reste visible lors des tests domestiques ultérieurs.
Une vue d’ensemble d’une frontière d’isolation d’agent définit cette frontière au moyen d’un accès restreint au système de fichiers, de sorties réseau limitées et d’interactions contrôlées avec l’hôte. Le mécanisme clé est l’application de ces règles indépendamment du raisonnement du modèle ou de sa volonté de coopérer. Le résultat intermédiaire doit rester vérifiable avant la poursuite de l’automatisation.
La solidité de l’isolation dépend de la frontière et de la configuration. Un conteneur partageant des sockets hôte puissants ou de nombreux montages peut être moins confiné qu’un simple processus exécuté avec un compte soigneusement restreint. Cette frontière doit être mesurée séparément dans des conditions d’exploitation réalistes.
Les contrôles de capacité limitent les effets secondaires qui peuvent s’échapper
Le bac à sable intercepte les écritures de fichiers, la création de processus, l’accès aux appareils, les connexions sortantes et les appels d’outils, puis applique des listes d’autorisation, des règles de chemin, des destinations, des méthodes, des quotas et des règles d’approbation. Les opérations refusées sont bloquées avant d’atteindre le système actif. La conséquence pratique apparaît lorsque plusieurs sources se disputent un contexte limité.
Les recherches sur l’isolation des outils selon le principe du moindre privilège recommandent le moindre privilège, l’exécution isolée, l’autorisation explicite, la journalisation d’audit et des contrôles de défaillance limités. Ces couches traitent les différentes voies par lesquelles un agent manipulé pourrait transformer des instructions en effets externes. Cette dépendance doit rester explicite dans l’interface finale.
Une capacité en lecture seule est plus sûre qu’un shell général accompagné d’une consigne lui interdisant d’écrire. Le refus technique reste efficace lorsque le modèle se méprend, est victime d’une injection ou génère simplement la mauvaise commande. Le résultat doit donc être vérifié par rapport aux éléments probants d’origine.
L’état éphémère et l’audit limitent la persistance et la récupération
Les espaces de travail éphémères peuvent être détruits après une exécution, tandis que certains résultats seulement franchissent la frontière après validation. Les limites de ressources empêchent les bombes à fork ou l’épuisement du stockage, et des journaux d’événements complets facilitent l’enquête sans accorder à l’agent le contrôle de ces journaux.
Une analyse de l’application des règles concernant les effets secondaires à l’exécution place la couche d’application entre l’inférence et les effets secondaires afin que les appels puissent être autorisés, bloqués et enregistrés. Cet emplacement sépare l’intention du modèle de l’autorité d’exécution. Cette distinction reste visible lors des tests domestiques ultérieurs.
La frontière de défaillance est un bac à sable doté d’identifiants étendus, de montages de production accessibles en écriture, de sorties réseau sans restriction ou d’un chemin d’évasion privilégié. Le confinement réduit l’impact ; il ne rend pas le code généré correct et n’élimine pas les vulnérabilités du noyau ou de la configuration.
Sondez le bac à sable avec des tests d’effets secondaires refusés
Tentez des lectures en dehors des chemins autorisés, des écritures dans des fichiers protégés, des échappements par liens symboliques, l’épuisement des processus et de la mémoire, des appels système interdits, l’accès aux sockets de l’hôte, des changements de privilèges, des destinations non autorisées, la lecture d’identifiants, la persistance après la suppression de l’environnement et la falsification des journaux. Le résultat intermédiaire doit rester vérifiable avant la poursuite de l’automatisation.
Utilisez une exécution sûre des outils afin d’aligner les tests sur les capacités déclarées de l’agent. Vérifiez que les tâches autorisées fonctionnent toujours, que les appels refusés génèrent des enregistrements explicites et que l’approbation s’applique à des cibles précises plutôt qu’à une autorisation générale réutilisable. Cette frontière doit être mesurée séparément dans des conditions d’exploitation réalistes.
Ne libérez le bac à sable que lorsque chaque effet interdit échoue dans des scénarios d’enchaînement adversarial et de redémarrage. Gardez par défaut les identifiants de production et les outils irréversibles à l’extérieur, puis ajoutez la capacité minimale propre à la tâche, étayée par un flux de travail concret.
Centre Tech & IA
Plus à lire

Comment un courtier secret fournit-il des identifiants à un agent d’IA sans les exposer dans les prompts ?
Suivez l’identité de charge de travail, les politiques, l’émission de jetons, l’injection des requêtes, la rédaction, l’expiration et la révocation au sein d’une architecture...

Comment le décodage contraint produit-il un JSON valide selon le schéma ?
Comprenez la compilation des schémas, le masquage des jetons, l’état de l’analyseur, les sous-ensembles pris en charge, la latence, la troncature et pourquoi la...

Comment un routeur IA choisit-il entre un petit modèle local et un modèle plus grand ?
Suivez le routage des modèles, des caractéristiques de la demande et des contrôles de politique jusqu’aux estimations des capacités, aux solutions de repli, aux...

