Sichere Tool-Ausführung entsteht durch externe Durchsetzung rund um das Modell: eingeschränkte Aufrufe, klar abgegrenzte Berechtigungen, Richtlinienprüfungen, Isolation, Genehmigungen, Ergebnisverifizierung und dauerhaft protokollierte Prüfdatensätze.
Ein selbst gehosteter Agent kann NAS-Dateien lesen, Shell-Befehle ausführen, Lichter steuern oder Nachrichten senden, sodass aus einer plausiblen Modellantwort ein realer Seiteneffekt werden kann. Das Modell sollte eine Operation vorschlagen und nicht direkt uneingeschränkte Zugangsdaten erhalten. Eine vertrauenswürdige Ausführungsschicht löst das Ziel auf, prüft Identität und Richtlinie, holt bei Bedarf eine Genehmigung ein, führt die Operation innerhalb festgelegter Grenzen aus und verifiziert das Ergebnis.
Typisierte Tool-Aufrufe machen Absichten zu prüfbaren Anfragen
Ein Tool-Schema definiert zulässige Operationen, erforderliche Argumente, Typen, Wertebereiche und Aufzählungen. Die deterministische Validierung weist fehlerhafte oder unbekannte Felder vor der Ausführung zurück, während die Zielauflösung einen verständlichen Namen in das aktuelle Gerät, den Pfad, den Empfänger oder die Ressourcenkennung umwandelt.
Die Forschung zur Sicherheit von Agentensystemen betrachtet Agentensicherheit als Systemproblem, das Isolation, Zugriffskontrolle, Herkunftsnachweise und vertrauenswürdige Ausführungsgrenzen umfasst. Das spricht dafür, die Durchsetzung außerhalb der probabilistischen Planung und Generierung zu halten. Diese Unterscheidung bleibt auch bei späteren Tests im Haushalt sichtbar.
Strukturierte Ausgaben sind notwendig, reichen aber nicht aus. Eine vollkommen gültige Anfrage kann dennoch den falschen Ordner löschen oder der falschen Person eine Nachricht senden. Daher vergleichen semantische Validatoren die vorgeschlagene Aktion mit dem aktuellen Zustand, der Benutzeridentität, dem Zweck des Workflows und den ausdrücklichen Richtlinien.
Berechtigungen und Sandboxes begrenzen den maximalen Schaden
Das Ausführungs-Gateway gewährt eng begrenzte, kurzlebige Berechtigungen, etwa Lesezugriff auf ein einzelnes Verzeichnis oder die Steuerung einer einzelnen Lichtgruppe. Eine Sandbox beschränkt während der Ausführung zusätzlich Dateisystempfade, Prozesse, Netzwerkziele, CPU, Arbeitsspeicher, Laufzeit und Ausgabegröße.
Eine praxisnahe Analyse von Ausführungs-Sandboxes für Agenten vergleicht Container, MicroVMs und WebAssembly und betont dabei die standardmäßige Verweigerung des Zugriffs auf Hostressourcen. Die Wahl der Isolation verändert Startkosten und Kompatibilität, doch jede Option benötigt explizite Freigaben. Das Zwischenergebnis muss prüfbar bleiben, bevor die Automatisierung fortgesetzt wird.
Zugangsdaten bleiben außerhalb des Modellkontexts und werden nur für einen autorisierten Aufruf injiziert. Separate Sandboxes schützen den Host vor Codeausführung, während Berechtigungsprüfungen externe Dienste schützen. Keine der beiden Kontrollen ersetzt die andere. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Genehmigung und Verifizierung schützen vor folgenreichen Seiteneffekten
Die Richtlinie klassifiziert Aktionen nach Risiko und entscheidet, ob sie erlaubt, abgelehnt, simuliert oder zur menschlichen Genehmigung vorgelegt werden. Der Genehmigungsbildschirm muss das aufgelöste Ziel, die exakten Parameter, die erwarteten Änderungen und die Herkunft anzeigen, statt vage zum „Fortfahren“ aufzufordern.
Die Anleitung von NVIDIA zum Sandboxing agentischer Workflows beschreibt die manuelle Genehmigung als gängige Kontrolle und erörtert die Reibung, die selektives Sandboxing und Durchsetzung motiviert. Das bestärkt die Platzierung der Genehmigung an der irreversiblen Grenze, statt jeden schreibgeschützten Schritt zu unterbrechen.
Die Fehlergrenze liegt bei einem übermäßig privilegierten Tool oder einem nicht verifizierten Ergebnis. Eine Genehmigung macht einen verborgenen Befehl nicht sicher, und ein erfolgreicher Exit-Code beweist nicht, dass der beabsichtigte Zustand geändert wurde. Workflows mit hoher Auswirkung benötigen unabhängige Nachbedingungen, begrenzte Wiederholungsversuche, Idempotenzschlüssel und einen Prüfdatensatz mit Vorschlägen, Ablehnungen, Genehmigungen, Ausführungen und Prüfungen.
Teste die Durchsetzungsschicht, nicht das Versprechen des Agenten
Erstelle Testfälle für fehlerhafte Argumente, Pfad-Traversal, nicht autorisierte Dateien, blockierte Netzwerkziele, durch Prompts eingeschleuste Anweisungen, veraltete Ziele, doppelte Wiederholungsversuche, manipulierte Genehmigungen, Zeitüberschreitungen und ein Tool, das fälschlicherweise Erfolg meldet. Führe sie mit denselben Berechtigungen aus, die in der Produktion verwendet werden.
Nutze das Prinzip der unabhängigen Prüfung aus den unabhängigen Ergebnisprüfungen, um den Zustand nach jeder erlaubten Aktion zu verifizieren. Bestätige, dass abgelehnte Operationen das Tool nie erreichen, Genehmigungen an den exakten Anfrage-Hash gebunden sind, Zugangsdaten nicht in Prompts und Protokollen landen und Wiederholungsschlüssel doppelte Seiteneffekte verhindern.
Führe das System erst ein, wenn die Kontrollen bei nicht verfügbarem Richtliniendienst, Genehmigungskanal oder Verifizierer ausfallsicher sperren. Wenn die Sicherheit davon abhängt, dass das Modell sich an eine Regel erinnert, verschiebe diese Regel in eine ausführbare Richtlinie, bevor du das Tool freigibst.
Tech- & KI-Zentrum
Mehr zum Lesen

Welche Komponenten ermöglichen eine hybride Suche über NAS-Dateien?
Erfahren Sie, wie exakte Bezeichner und semantische Bedeutung zu einem einzigen, gerankten NAS-Suchergebnis gelangen, ohne Berechtigungen zu umgehen oder schwache Belege zu verbergen.

Welche Funktionen ermöglichen eine zuverlässige Auswahl von Dokumentversionen in RAG?
Sehen Sie, wie RAG die zutreffende Revision statt der ähnlichsten veralteten Kopie auswählt und wie sich explizite, implizite und überlappende Aktualisierungen testen lassen.

Welche Faktoren führen dazu, dass Agentenpläne von den verfügbaren Tool-Berechtigungen abweichen?
Erfahren Sie, wie Discovery, Delegation, Richtlinienfeedback und Neuplanung dafür sorgen, dass die vorgeschlagenen Schritte eines KI-Agenten mit den tatsächlichen Möglichkeiten seiner Tools übereinstimmen.

