Zatwierdzanie przez człowieka działa, gdy polityka tworzy trwały punkt decyzyjny powiązany z dokładnie jedną proponowaną czynnością, uwierzytelnionym recenzentem, terminem wygaśnięcia i gałęzią wznowienia.
Wieloetapowa automatyzacja domowa może zbierać dowody, przygotowywać wiadomość, przenosić pliki, a następnie zmieniać ustawienia urządzenia lub kontaktować się z kimś spoza domu. Wstrzymane powinno zostać wyłącznie miejsce o istotnych konsekwencjach. Środowisko uruchomieniowe musi zachować cały wcześniejszy stan, pokazać recenzentowi, co się wydarzy, czekać bez zajmowania zasobów obliczeniowych i kontynuować działanie wyłącznie na podstawie decyzji zgodnej z nadal aktualnym żądaniem.
Polityka ryzyka decyduje, gdzie potrzebne jest zatwierdzenie
Silnik polityk klasyfikuje działania według skutku, celu, wrażliwości danych, odwracalności, kwoty i zakresu użytkownika. Odczyty niskiego ryzyka mogą być wykonywane automatycznie, natomiast komunikacja zewnętrzna, usuwanie danych, zakupy, zmiany zabezpieczeń lub niejednoznaczne cele powodują utworzenie węzłów zatwierdzania przed wykonaniem.
Praktyczny mechanizm kontroli procesu zatwierdzania definiuje procesy zatwierdzania jako mechanizmy środowiska uruchomieniowego, które przerywają działanie agenta przed wywołaniem skutków w świecie rzeczywistym. Wyjaśnia to, że zatwierdzenie jest stanem egzekwowania zasad, a nie uprzejmą prośbą, którą model może pominąć.
Zbyt wiele punktów kontroli powoduje zmęczenie recenzentów i bezrefleksyjne zatwierdzanie; zbyt mało pozostawia niebezpieczny krok bez weryfikacji. Punkt kontroli należy umieścić po ustaleniu celu i parametrów, ale przed udostępnieniem poświadczeń lub rozpoczęciem działania ubocznego.
Żądanie zatwierdzenia musi być konkretne i odporne na manipulacje
Żądanie zawiera identyfikator procesu, typ działania, ustalony cel, parametry, dowody, oczekiwany skutek, uzasadnienie ryzyka, zleceniodawcę, politykę zatwierdzania, termin wygaśnięcia oraz skrót kryptograficzny. Recenzent może zatwierdzić, odrzucić, edytować w ramach polityki lub zażądać ponownego zaplanowania. To rozróżnienie pozostaje widoczne podczas późniejszych testów domowych.
Szczegółowy wzorzec trwałej decyzji recenzenta pokazuje agenta proponującego działanie, oczekującego na weryfikację i wznawiającego pracę po zatwierdzeniu, edycji, odrzuceniu lub zmianie planu. Najważniejszym wyzwaniem inżynieryjnym jest zapewnienie trwałości tej decyzji. Wynik pośredni musi pozostać możliwy do skontrolowania, zanim automatyzacja podejmie dalsze działania.
Uwierzytelnienie potwierdza, kto podjął decyzję, natomiast powiązanie z żądaniem potwierdza, czego ta decyzja dotyczyła. Każda istotna zmiana parametrów po zatwierdzeniu tworzy nowy skrót i wymaga nowej decyzji; zatwierdzenie „przenieś zdjęcia” nie może upoważniać później do użycia innego miejsca docelowego ani szerszego zestawu plików.
Trwałe oczekiwanie i rozgałęzianie zachowują decyzję
Silnik orkiestracji tworzy punkt kontrolny procesu, rejestruje identyfikator korelacji, zwalnia proces roboczy i oczekuje na uwierzytelniony sygnał. Sygnał wybiera gałąź i jest wykorzystywany tylko raz, nawet jeśli kanał ponownie próbuje dostarczyć wiadomość lub serwer domowy uruchomi się ponownie.
Samouczek dotyczący trwałych sygnałów zatwierdzania pokazuje zapytania do inspekcji oraz sygnały służące do zatwierdzania lub edycji, podczas gdy stan procesu przetrwa awarie. Wyjaśnia, dlaczego samo powiadomienie na czacie nie jest systemem zatwierdzania. Ten punkt należy mierzyć oddzielnie w realistycznych warunkach działania.
Granica awarii pojawia się przy nieaktualnym zatwierdzeniu. Jeśli podczas oczekiwania zmienił się stan celu, uprawnienia, cena, wersja pliku lub proponowana treść, środowisko uruchomieniowe musi unieważnić decyzję i ponownie wygenerować podgląd. Limity czasu domyślnie kończą się odmową lub eskalacją, nigdy cichym wykonaniem.
Testuj zatwierdzanie, odrzucanie, edycję, wygaśnięcie i ponowne uruchomienie
Utwórz jeden proces obejmujący nieszkodliwy odczyt, odwracalny zapis i nieodwracalne działanie. Przetestuj zatwierdzenie, odrzucenie, dozwoloną edycję, niedozwoloną edycję, zduplikowaną odpowiedź, niewłaściwego recenzenta, wygasłe żądanie, zmieniony cel, awarię powiadomień oraz ponowne uruchomienie serwera podczas oczekiwania.
Porównaj ten punkt kontroli z jawnymi uprawnieniami narzędzi, które wyjaśniają, dlaczego jawne uprawnienia muszą pozostawać poza zakresem uznania modelu. Sprawdź, czy każda decyzja odwołuje się do dokładnego skrótu działania, zachowuje dowody, wybiera jedną gałąź i pojawia się w rejestrze audytowym.
Test można uznać za zaliczony dopiero wtedy, gdy żadne narzędzie wywołujące istotne skutki nie otrzymuje poświadczeń przed prawidłowym zatwierdzeniem i gdy żadna nieaktualna decyzja nie może upoważnić do wykonania działania ze zmienionymi parametrami. Obciążenie recenzentów należy mierzyć oddzielnie, aby polityka mogła ograniczać zbędne punkty kontroli bez osłabiania zabezpieczeń wysokiego ryzyka. Praktyczne konsekwencje są widoczne, gdy kilka źródeł konkuruje o ograniczony kontekst.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie komponenty umożliwiają wyszukiwanie hybrydowe w plikach NAS?
Dowiedz się, jak dokładne identyfikatory i znaczenie semantyczne prowadzą do jednego najlepiej sklasyfikowanego wyniku wyszukiwania NAS bez omijania uprawnień ani ukrywania słabych dowodów.

Jakie funkcje umożliwiają niezawodny wybór wersji dokumentu w systemach RAG?
Zobacz, jak RAG wybiera właściwą wersję zamiast najbardziej podobnej, nieaktualnej kopii, oraz jak testować aktualizacje jawne, niejawne i nakładające się.

Jakie czynniki powodują rozbieżność planów agenta z dostępnymi uprawnieniami narzędzi?
Dowiedz się, jak rozpoznawanie, delegowanie, informacje zwrotne dotyczące zasad i ponowne planowanie pomagają dostosować proponowane kroki agenta AI do rzeczywistych możliwości jego narzędzi.

