En verktygssandlåda begränsar AI-agenters bieffekter genom att upprätthålla resurs- och kapabilitetsgränser utanför modellen, även när dess föreslagna åtgärd är osäker.
En hemagent kan generera kod för att byta namn på foton, granska dokument eller anropa en nätverkstjänst. I stället för att köras med ägarens fullständiga konto får sandlådan en begränsad vy av filsystemet, begränsat nätverk, ett begränsat antal processer, avgränsad CPU- och minnesanvändning samt uppgiftsbegränsade autentiseringsuppgifter. Åtgärder kan fortfarande misslyckas eller vara skadliga, men deras möjliga skadeomfattning är mindre.
Isolering skapar en mindre körmiljö
Containrar, virtuella maskiner, mikro-VM:er, begränsade användare, namnrymder och syscall-filter separerar verktygsprocessen från värdsystemet. Skrivskyddade basavbildningar och uttryckliga monteringar avgör vilka filer som är synliga och vilka ändringar som kan bestå. Denna skillnad förblir synlig under senare tester i hemmet.
En översikt av en isoleringsgräns för agenter definierar gränsen genom begränsad åtkomst till filsystemet, utgående nätverkstrafik och interaktion med värdsystemet. Den centrala mekanismen är upprätthållande som är oberoende av språkmodellens resonemang eller vilja att följa instruktioner. Mellanresultatet måste förbli granskningsbart innan automatiseringen fortsätter.
Isoleringens styrka beror på gränsen och konfigurationen. En container som delar kraftfulla värdsockets eller omfattande monteringar kan vara mindre innesluten än en enkel process som körs under ett noggrant begränsat konto. Den gränsen bör mätas separat under realistiska driftsförhållanden.
Kapabilitetsgrindar begränsar vilka bieffekter som kan ta sig ut
Sandlådan fångar upp filskrivningar, processkapande, enhetsåtkomst, utgående anslutningar och verktygsanrop och tillämpar sedan tillåtelselistor, sökvägspolicyer, destinationer, metoder, kvoter och godkännanderegler. Nekade åtgärder stoppas innan de når det aktiva systemet. Den praktiska konsekvensen blir tydlig när flera källor konkurrerar om ett begränsat kontextfönster.
Forskning om verktygsisolering med minsta möjliga behörighet rekommenderar minsta möjliga behörighet, isolerad körning, uttrycklig auktorisering, granskningsloggning och begränsningar för felhantering. Dessa lager hanterar olika vägar genom vilka en manipulerad agent kan omvandla instruktioner till externa effekter. Detta beroende bör förbli tydligt i det slutliga gränssnittet.
En skrivskyddad kapabilitet är säkrare än ett allmänt skal med en uppmaning att inte skriva. Tekniskt nekande förblir effektivt när modellen missförstår, utsätts för injektion eller helt enkelt genererar fel kommando. Resultatet måste därför kontrolleras mot det ursprungliga underlaget.
Flyktigt tillstånd och granskning begränsar beständighet och återställning
Flyktiga arbetsytor kan förstöras efter en körning, medan utvalda resultat passerar gränsen först efter validering. Resursbegränsningar stoppar fork-bomber eller lagringsutmattning, och fullständiga händelseloggar stöder utredning utan att ge agenten kontroll över loggarna.
En analys av upprätthållande av bieffekter under körning placerar upprätthållandelagret mellan inferens och bieffekter, så att anrop kan tillåtas, blockeras och loggas. Den placeringen separerar modellens avsikt från körmiljöns behörighet. Denna skillnad förblir synlig under senare tester i hemmet.
Felgränsen utgörs av en sandlåda med omfattande autentiseringsuppgifter, skrivbara monteringar från produktionsmiljön, obegränsad utgående trafik eller en privilegierad flyktväg. Inneslutning minskar påverkan; den gör inte genererad kod korrekt och eliminerar inte sårbarheter i kärnan eller konfigurationen.
Testa sandlådan med tester av nekade bieffekter
Försök läsa utanför tillåtna sökvägar, skriva till skyddade filer, ta dig ut via symboliska länkar, utmatta processer och minne, använda förbjudna systemanrop, få åtkomst till värdsockets, ändra behörigheter, nå obehöriga destinationer, läsa autentiseringsuppgifter, bevara data efter nedmontering och manipulera loggar. Mellanresultatet måste förbli granskningsbart innan automatiseringen fortsätter.
Använd säker verktygskörning för att anpassa testerna till agentens deklarerade kapabiliteter. Kontrollera att tillåtna uppgifter fortfarande fungerar, att nekade anrop skapar tydliga poster och att godkännandet gäller exakta mål i stället för ett återanvändbart generellt tillstånd. Den gränsen bör mätas separat under realistiska driftsförhållanden.
Släpp bara igenom sandlådan när varje förbjuden effekt misslyckas vid motståndskraftig kedjning och omstart. Håll produktionsautentiseringsuppgifter och oåterkalleliga verktyg utanför som standard och lägg sedan till den minsta uppgiftsspecifika kapabilitet som stöds av ett konkret arbetsflöde.
Teknik- och AI-hubb
Mer att läsa

Hur påverkar nedsampling av tidsserier avvikelsedetektering i smarta hem?
Se hur hinkbredd, aggregering, kantutjämning, saknade data, händelselängd och bevarande i flera skalor påverkar återkallningen av avvikelser i smarta hem.

Hur kombinerar en beläggningskarta svaga signaler från smarta hem?
Lär dig hur rumsliga celler, sensormodeller, log-odds-uppdateringar, avklingning, korrelerade bevis och tröskelvärden omvandlar svaga hemsignaler till uppskattningar av närvaro.

Hur påverkar fotometrisk normalisering klustring av privata ansikten?
Se hur belysningskorrigering förändrar ansiktsbeskärningar, embeddingar, klusteravstånd, tröskelvärden, övernormalisering och utvärdering av privat fotosökning.

