Piaskownica narzędzi ogranicza skutki uboczne agenta AI, wymuszając granice zasobów i uprawnień poza modelem, nawet gdy proponowane przez niego działanie jest niebezpieczne.
Agent domowy może wygenerować kod do zmiany nazw zdjęć, przeglądania dokumentów lub wywołania usługi sieciowej. Zamiast wykonywać go z pełnymi uprawnieniami konta właściciela, piaskownica udostępnia ograniczony widok systemu plików, restrykcyjną sieć, ograniczoną liczbę procesów, limity procesora i pamięci oraz dane uwierzytelniające przypisane do konkretnego zadania. Działania nadal mogą się nie powieść lub być złośliwe, ale ich potencjalny zasięg jest mniejszy.
Izolacja tworzy mniejsze środowisko wykonywania
Kontenery, maszyny wirtualne, microVM-y, użytkownicy z ograniczeniami, przestrzenie nazw i filtry wywołań systemowych oddzielają proces narzędzia od hosta. Obrazy bazowe tylko do odczytu i jawne punkty montowania określają, które pliki są widoczne i które zmiany mogą zostać zachowane. Rozróżnienie to pozostaje widoczne podczas późniejszych testów domowych.
Przegląd granicy izolacji agenta definiuje ją poprzez ograniczony dostęp do systemu plików, ruch wychodzący z sieci i interakcję z hostem. Kluczowym mechanizmem jest egzekwowanie zasad niezależne od rozumowania modelu językowego lub jego gotowości do współpracy. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja podejmie dalsze działania.
Siła izolacji zależy od granicy i konfiguracji. Kontener współdzielący potężne gniazda hosta lub szerokie punkty montowania może zapewniać mniejsze ograniczenie niż prosty proces uruchomiony na starannie ograniczonym koncie. Tę granicę należy mierzyć osobno w realistycznych warunkach działania.
Bramki uprawnień ograniczają skutki uboczne, które mogą wydostać się na zewnątrz
Piaskownica przechwytuje zapisy plików, tworzenie procesów, dostęp do urządzeń, połączenia wychodzące i wywołania narzędzi, a następnie stosuje listy dozwolonych elementów, zasady dotyczące ścieżek, miejsc docelowych i metod, limity oraz reguły zatwierdzania. Odrzucone operacje są zatrzymywane, zanim dotrą do działającego systemu. Praktyczne znaczenie tego rozwiązania ujawnia się, gdy kilka źródeł konkuruje o ograniczony kontekst.
Badania nad izolacją narzędzi zgodną z zasadą najmniejszych uprawnień zalecają minimalne uprawnienia, izolowane wykonywanie, jawne autoryzowanie, rejestrowanie audytowe i kontrolowane mechanizmy awarii. Warstwy te odnoszą się do różnych dróg, którymi zmanipulowany agent może przekształcić instrukcje w zewnętrzne skutki. Ta zależność powinna pozostać jawna w końcowym interfejsie.
Uprawnienie tylko do odczytu jest bezpieczniejsze niż ogólna powłoka z instrukcją, aby nie zapisywać danych. Techniczne odrzucenie pozostaje skuteczne, gdy model źle zrozumie polecenie, zostanie poddany wstrzyknięciu lub po prostu wygeneruje niewłaściwe polecenie. Wynik należy zatem sprawdzić względem pierwotnych danych.
Nietrwały stan i audyt ograniczają trwałość oraz możliwości odzyskiwania
Nietrwałe obszary robocze można usunąć po zakończeniu działania, a wybrane wyniki przekraczać przez granicę dopiero po weryfikacji. Limity zasobów powstrzymują bomby fork lub wyczerpanie przestrzeni dyskowej, a pełne dzienniki zdarzeń ułatwiają analizę bez przyznawania agentowi kontroli nad tymi dziennikami.
Analiza egzekwowania skutków ubocznych w czasie działania umieszcza warstwę egzekwowania między wnioskowaniem a skutkami ubocznymi, dzięki czemu wywołania można zezwalać, blokować i rejestrować. Takie umiejscowienie oddziela zamiar modelu od uprawnień wykonawczych. Rozróżnienie to pozostaje widoczne podczas późniejszych testów domowych.
Granica awarii powstaje wtedy, gdy piaskownica ma szerokie dane uwierzytelniające, zapisywalne punkty montowania produkcyjnych danych, nieograniczony ruch wychodzący lub uprzywilejowaną ścieżkę ucieczki. Ograniczenie zasięgu zmniejsza skutki; nie sprawia jednak, że wygenerowany kod staje się poprawny, ani nie eliminuje podatności jądra i konfiguracji.
Sprawdź piaskownicę za pomocą testów odrzuconych skutków ubocznych
Spróbuj odczytać dane spoza dozwolonych ścieżek, zapisać chronione pliki, wykorzystać ucieczki przez dowiązania symboliczne, doprowadzić do wyczerpania procesów i pamięci, użyć zabronionych wywołań systemowych, uzyskać dostęp do gniazda hosta, zmienić uprawnienia, połączyć się z nieautoryzowanymi miejscami docelowymi, odczytać dane uwierzytelniające, zachować stan po zamknięciu oraz modyfikować dzienniki. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja podejmie dalsze działania.
Użyj bezpiecznego wykonywania narzędzi, aby dopasować testy do zadeklarowanych możliwości agenta. Sprawdź, czy dozwolone działania nadal funkcjonują, odrzucone wywołania tworzą jawne wpisy oraz czy zatwierdzenie dotyczy dokładnych miejsc docelowych, a nie wielokrotnego, ogólnego zezwolenia. Tę granicę należy mierzyć osobno w realistycznych warunkach działania.
Udostępnij piaskownicę dopiero wtedy, gdy każdy zabroniony skutek nie powiedzie się w warunkach złośliwego łańcucha działań i po ponownym uruchomieniu. Domyślnie trzymaj produkcyjne dane uwierzytelniające i nieodwracalne narzędzia poza piaskownicą, a następnie dodaj najmniejsze uprawnienie przypisane do konkretnego zadania, które znajduje uzasadnienie w konkretnym przepływie pracy.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak tajny broker przekazuje agentowi AI dane uwierzytelniające bez ujawniania ich w promptach?
Śledź tożsamość obciążenia, zasady, wydawanie tokenów, wstrzykiwanie żądań, redakcję, wygasanie i unieważnianie w ramach bezsekretnej architektury domowego agenta AI.

Jak dekodowanie z ograniczeniami generuje JSON zgodny ze schematem?
Zrozum kompilację schematu, maskowanie tokenów, stan parsera, obsługiwane podzbiory, opóźnienia, obcinanie oraz to, dlaczego poprawność strukturalna nie gwarantuje prawidłowych wartości.

Jak router AI decyduje, czy wybrać mały model lokalny, czy większy model?
Śledź routing modeli od funkcji żądania i bramek zasad przez szacowanie możliwości, rozwiązania awaryjne, informacje zwrotne i ocenę na współdzielonym domowym serwerze AI.

