Eine Tool-Sandbox begrenzt die Nebenwirkungen von KI-Agenten, indem sie Ressourcen- und Fähigkeitsgrenzen außerhalb des Modells durchsetzt - selbst wenn die vorgeschlagene Aktion unsicher ist.
Ein Heimagent kann Code zum Umbenennen von Fotos generieren, Dokumente prüfen oder einen Netzwerkdienst aufrufen. Statt mit dem vollständigen Konto des Besitzers ausgeführt zu werden, erhält die Sandbox eine eingeschränkte Dateisystemansicht, ein begrenztes Netzwerk, eine begrenzte Anzahl an Prozessen, festgelegte CPU- und Arbeitsspeicherressourcen sowie aufgabenbezogene Zugangsdaten. Aktionen können weiterhin fehlschlagen oder bösartig sein, aber ihr erreichbarer Schadensradius ist kleiner.
Isolation schafft eine kleinere Ausführungsumgebung
Container, virtuelle Maschinen, MicroVMs, eingeschränkte Benutzer, Namespaces und Syscall-Filter trennen den Tool-Prozess vom Host. Schreibgeschützte Basis-Images und explizite Mounts bestimmen, welche Dateien sichtbar sind und welche Änderungen dauerhaft bestehen bleiben können. Diese Unterscheidung bleibt bei späteren Tests im Haushalt sichtbar.
Eine Übersicht über eine Isolationsgrenze für Agenten definiert die Grenze durch eingeschränkten Dateisystemzugriff, ausgehenden Netzwerkverkehr und Interaktionen mit dem Host. Der entscheidende Mechanismus ist die vom Denken oder der Befolgungsbereitschaft des Sprachmodells unabhängige Durchsetzung. Das Zwischenergebnis muss überprüfbar bleiben, bevor die Automatisierung fortgesetzt wird.
Die Stärke der Isolation hängt von der Grenze und der Konfiguration ab. Ein Container, der leistungsfähige Host-Sockets oder weitreichende Mounts gemeinsam nutzt, kann weniger gut abgeschottet sein als ein einfacher Prozess, der unter einem sorgfältig eingeschränkten Konto läuft. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Fähigkeitskontrollen begrenzen, welche Nebenwirkungen nach außen dringen können
Die Sandbox fängt Dateischreibvorgänge, Prozesserstellung, Gerätezugriffe, ausgehende Verbindungen und Tool-Aufrufe ab und wendet anschließend Allow-Lists, Pfadrichtlinien, Zielvorgaben, Methoden, Kontingente und Genehmigungsregeln an. Abgelehnte Vorgänge werden gestoppt, bevor sie das Live-System erreichen. Die praktische Konsequenz zeigt sich, wenn mehrere Quellen um begrenzten Kontext konkurrieren.
Die Forschung zur Tool-Isolation nach dem Prinzip der geringsten Rechte empfiehlt minimale Berechtigungen, isolierte Ausführung, ausdrückliche Autorisierung, Prüfprotokollierung und begrenzte Fehlerkontrollen. Diese Ebenen adressieren unterschiedliche Wege, über die ein manipulierter Agent Anweisungen in externe Auswirkungen umsetzen könnte. Diese Abhängigkeit sollte in der finalen Benutzeroberfläche ausdrücklich sichtbar bleiben.
Eine schreibgeschützte Fähigkeit ist sicherer als eine allgemeine Shell mit der Aufforderung, nicht zu schreiben. Eine technische Verweigerung bleibt wirksam, wenn das Modell etwas missversteht, manipuliert wurde oder einfach den falschen Befehl generiert. Das Ergebnis muss daher anhand der ursprünglichen Belege überprüft werden.
Vergänglicher Zustand und Protokollierung begrenzen Persistenz und Wiederherstellung
Temporäre Arbeitsbereiche können nach einem Durchlauf zerstört werden, während ausgewählte Ausgaben erst nach der Validierung die Grenze überschreiten. Ressourcenlimits verhindern Fork-Bomben oder eine Erschöpfung des Speicherplatzes, und vollständige Ereignisprotokolle unterstützen Untersuchungen, ohne dem Agenten Kontrolle über diese Protokolle zu geben.
Eine Analyse zur Durchsetzung von Nebenwirkungsgrenzen zur Laufzeit positioniert die Durchsetzungsebene zwischen Inferenz und Nebenwirkungen, sodass Aufrufe erlaubt, blockiert und protokolliert werden können. Diese Positionierung trennt die Absicht des Modells von der Autorität zur Laufzeit. Diese Unterscheidung bleibt bei späteren Tests im Haushalt sichtbar.
Die Fehlergrenze ist eine Sandbox mit weitreichenden Zugangsdaten, beschreibbaren Produktions-Mounts, uneingeschränktem ausgehendem Netzwerkverkehr oder einem privilegierten Fluchtweg. Die Eindämmung reduziert die Auswirkungen, macht generierten Code jedoch weder korrekt noch beseitigt sie Schwachstellen im Kernel oder in der Konfiguration.
Prüfen Sie die Sandbox mit Tests zu verweigerten Nebenwirkungen
Versuchen Sie, außerhalb erlaubter Pfade zu lesen, geschützte Dateien zu schreiben, Symlink-Ausbrüche herbeizuführen, Prozesse und Arbeitsspeicher zu erschöpfen, verbotene Syscalls auszuführen, auf Host-Sockets zuzugreifen, Berechtigungen zu ändern, nicht autorisierte Ziele zu kontaktieren, Zugangsdaten auszulesen, nach dem Abbau dauerhaft zu bestehen und Protokolle zu manipulieren. Das Zwischenergebnis muss überprüfbar bleiben, bevor die Automatisierung fortgesetzt wird.
Verwenden Sie sichere Tool-Ausführung, um die Tests an den vom Agenten erklärten Fähigkeiten auszurichten. Überprüfen Sie, dass erlaubte Aufgaben weiterhin funktionieren, verweigerte Aufrufe explizite Einträge erzeugen und die Genehmigung an exakt definierte Ziele gebunden ist statt an eine wiederverwendbare pauschale Freigabe. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Geben Sie die Sandbox erst frei, wenn jede verbotene Auswirkung unter Bedingungen mit Angreiferverhalten und Neustarts fehlschlägt. Halten Sie Produktionszugangsdaten und irreversible Tools standardmäßig außerhalb und fügen Sie anschließend nur die kleinste aufgabenspezifische Fähigkeit hinzu, die von einem konkreten Arbeitsablauf unterstützt wird.
Tech- & KI-Zentrum
Mehr zum Lesen

Was ist Embedding-Drift, und wann muss ein privater Suchindex neu erstellt werden?
Entschlüsseln Sie Modell-, Vorverarbeitungs-, Korpus- und Abfragedrift, unterscheiden Sie zwischen Überwachung und Inkompatibilität und entscheiden Sie, wann ein privater Index neu erstellt werden muss.

Was ist Tokenizer-Kompatibilität, und warum kann sie den Modellwechsel beeinträchtigen?
Entschlüsseln Sie Vokabularidentität, die Semantik spezieller Token, Chatvorlagen, zwischengespeicherte Token, Adapter und Kompatibilitätsprüfungen für den Wechsel lokaler Modelle.

Was ist Modellresidenz, und wann sollte ein lokaler KI-Dienst die Gewichte geladen lassen?
Entschlüsseln Sie Gewichtsspeicherort, Cache-Ebenen, Kaltstarts, Verdrängung, Multiplexing, Speicherdruck und wann ein KI-Dienst zu Hause warm bleiben sollte.

