Tak, domowy agent AI może zweryfikować wiele wyników działania narzędzi przed podjęciem działania, ale wiarygodne kontrole muszą być niezależne od pierwotnego założenia modelu.
Załóżmy, że agent przeszukuje lokalny kalendarz, odczytuje wiadomość e-mail dotyczącą wysyłki i przygotowuje się do odwołania spotkania. Płynna odpowiedź narzędzia może zawierać błędną datę, nieaktualny rekord lub nieprawidłowo sformatowane pola, które mimo to wyglądają wiarygodnie dla modelu. Weryfikacja oznacza sprawdzenie struktury, tożsamości, aktualności, uprawnień i dowodów przed granicą wykonania działania — a nie tylko zapytanie tego samego modelu, czy jego własna interpretacja wydaje się poprawna.
Weryfikacja zaczyna się od kontroli deterministycznych
Najtańsze kontrole nie wymagają użycia kolejnego modelu. Należy zweryfikować nazwę narzędzia, schemat argumentów, schemat odpowiedzi, identyfikatory rekordów, znaczniki czasu, jednostki i dozwolone zakresy wartości. Wyszukiwanie w kalendarzu powinno zwrócić identyfikator wydarzenia istniejący na oczekiwanym koncie; operacja na pliku powinna wskazywać lokalizację wewnątrz zatwierdzonego katalogu; suma zakupu powinna zostać uzgodniona na podstawie pozycji przed przesłaniem jakiejkolwiek transakcji.
Agents SDK firmy OpenAI obsługuje mechanizmy ochronne danych wejściowych i wyjściowych, które mogą odrzucać lub przerywać przebieg, gdy kontrole się nie powiodą. Są one przydatne, ponieważ działają poza zwykłym generowaniem odpowiedzi. Walidator typów nie może udowodnić, że data jest faktycznie poprawna, ale może uniemożliwić agentowi potraktowanie brakujących, niejednoznacznych lub nieoczekiwanych danych jako pozwolenia na kontynuowanie.
Walidacja deterministyczna zamienia ukrytą niejednoznaczność w widoczny stan: powodzenie, niepowodzenie lub niewystarczające dowody. Stan ten powinien być przekazywany razem z wynikiem działania narzędzia. Agent może ponowić tylko do odczytu po przejściowym błędzie, ale nie powinien wymyślać brakującego identyfikatora ani przekształcać nieprawidłowej odpowiedzi do oczekiwanego formatu wyłącznie po to, by plan mógł być kontynuowany.
Niezależne dowody zapobiegają zapętlonej samoweryfikacji
Weryfikacja semantyczna sprawdza, czy wynik uzasadnia zaplanowane działanie. Najsilniejszy schemat polega na porównaniu niezależnych obserwacji: potwierdzeniu informacji o dostarczeniu przesyłki zarówno w danych przewoźnika, jak i na podstawie identyfikatora zamówienia albo potwierdzeniu wolnego miejsca na dysku za pomocą zapytania do systemu plików, zamiast polegania na podsumowaniu tekstowym wygenerowanym przez pierwsze narzędzie. Zgodność ma znaczenie tylko wtedy, gdy kontrole nie korzystają z tego samego źródła błędu.
Struktura ReAct przeplata rozumowanie z działaniami, dzięki czemu obserwacje mogą aktualizować plan, zamiast być dopisywane po zakończeniu ustalonego łańcucha. Poprawia to możliwość śledzenia przebiegu, ale obserwacja nadal jest danymi, a nie prawdą. Weryfikator powinien porównać otrzymane dowody z jawnymi predykatami, takimi jak zgodność tożsamości, aktualny znacznik czasu, wystarczające saldo czy odwracalny cel.
Poproszenie tego samego modelu o skrytykowanie tego samego zapisu rozmowy może ujawnić sprzeczności, ale nie jest niezależną weryfikacją. Krytyk ma te same uprzedzenia wynikające z procesu uczenia i może zaakceptować przekonujący, fałszywy wynik. Weryfikacji opartej na modelu używaj do nieprecyzyjnych ocen, a rozstrzygające twierdzenia opieraj na drugim narzędziu, sumie kontrolnej, ograniczeniu bazy danych lub człowieku. Większa autorefleksja nie tworzy automatycznie nowego źródła prawdy.
Ryzyko działania określa, ile dowodów wystarczy
Rekomendacja tylko do odczytu może tolerować niepewność, której nie można dopuścić w przypadku działania destrukcyjnego. Zasady weryfikacji powinny klasyfikować działania według odwracalności, skutków finansowych, narażenia prywatności, odbiorców i zakresu oddziaływania. Zmiana nazwy pliku tymczasowego może wymagać jednego sprawdzenia schematu; usunięcie archiwum zdjęć, wysłanie wiadomości zewnętrznej, zmiana zapory sieciowej lub wydanie pieniędzy powinny wymagać silniejszych dowodów, a często także wyraźnej zgody.
Wytyczne dotyczące bezpieczeństwa agentów OpenAI uznają weryfikację przez człowieka za podstawowy mechanizm kontroli, szczególnie gdy przebieg przekracza wrażliwą granicę. Serwer domowy może wstrzymać proces, wyświetlić dokładny cel i dowody oraz lokalnie zachować stan oczekujący. Zgoda powinna być powiązana z dokładnymi argumentami, aby późniejsza tura modelu nie mogła podmienić odbiorcy, ścieżki ani kwoty.
Twierdzenie o samoweryfikacji zawodzi, gdy każdy kontroler korzysta z tego samego skażonego źródła, środowisko zmienia się między kontrolą a działaniem albo działania nie można cofnąć. Zawodzi również wtedy, gdy wynik narzędzia zawiera instrukcje nadpisujące zasady. Traktuj wyniki jako niezaufane dane, skracaj odstęp między weryfikacją a wykonaniem oraz wymagaj, aby adapter narzędzia — a nie model — egzekwował niepodlegające negocjacji uprawnienia.
Używaj koperty dowodów przed wykonaniem działania
Przed wykonaniem wymagaj jednej uporządkowanej koperty zawierającej proponowane działanie, znormalizowane argumenty, obserwacje źródłowe, wyniki walidacji, okno aktualności, klasę ryzyka i stan zatwierdzenia. Utwórz skrót koperty lub nadaj jej unikalny identyfikator, a następnie przekaż ten identyfikator do narzędzia wykonującego działanie. Jeśli którykolwiek argument się zmieni, unieważnij kopertę i przeprowadź ponowną weryfikację zamiast ponownie używać wcześniejszej zgody.
Lokalny moduł wykonawczy agenta jest naturalnym miejscem dla tej kontroli, ponieważ zarządza sesjami, narzędziami i uprawnieniami. Omówienie wtyczek modułu wykonawczego agentów firmy ZimaSpace pokazuje, jak możliwości rozszerzają się wokół modelu; ta sama warstwa powinna ograniczać możliwości za pomocą bramek opartych na dowodach. Dostępność narzędzia i autoryzacja narzędzia to dwa odrębne stany.
Przetestuj kopertę w czterech przypadkach: poprawny wynik, nieprawidłowo sformatowane dane, nieaktualny, lecz wiarygodny wynik oraz sprzeczne, niezależne źródła. Kontynuuj tylko wtedy, gdy poprawne działania o niskim ryzyku są wykonywane, praca obarczona niepewnością zostaje wstrzymana, a odrzuconego działania nie można odblokować perswazją zawartą w poleceniu. Celem nie jest to, by agent brzmiał ostrożnie; chodzi o to, aby niezweryfikowany stan był technicznie niezdolny do uruchomienia chronionego działania.
| Ryzyko działania | Minimalna weryfikacja | Zasada wykonania |
|---|---|---|
| Tylko do odczytu | Schemat i aktualność | Bezpiecznie ponów próbę |
| Odwracalna zmiana lokalna | Tożsamość oraz sprawdzenie stanu | Zapisz w dzienniku i zezwól na wycofanie |
| Komunikacja zewnętrzna | Odbiorca, treść, grupa odbiorców | Wyświetl podgląd lub poproś o zatwierdzenie |
| Działanie destrukcyjne lub finansowe | Niezależne dowody | Wyraźna zgoda powiązana z argumentami |
Najczęściej zadawane pytania
Czy drugi LLM może pełnić rolę weryfikatora?
Może zwiększyć różnorodność, jeśli korzysta z osobnego polecenia lub modelu, ale nadal pozostaje probabilistyczny. Używaj go do przeglądu semantycznego, a nie jako jedynej bramki dla faktów, które mogą zostać zweryfikowane przez narzędzia deterministyczne lub ludzi.
Czy każde wywołanie narzędzia powinno być weryfikowane dwukrotnie?
Nie. Zakres weryfikacji powinien odpowiadać ryzyku i niepewności. Nadmiarowe kontrole zwiększają opóźnienia i mogą tworzyć nowe punkty awarii, podczas gdy działania chronione zasługują na silniejsze, niezależne dowody.
Czy dzienniki mogą udowodnić, że agent najpierw przeprowadził kontrolę?
Dzienniki mogą pokazać zarejestrowaną kolejność, jeśli są kompletne i odporne na manipulacje. Nie dowodzą jednak, że dane źródłowe były poprawne, dlatego wraz z działaniem przechowuj identyfikatory dowodów i wyniki walidacji.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak mierzyć jakość lokalnego wyszukiwania RAG oraz interpretować kompletność przywołań, precyzję i pokrycie cytowaniami
Zbuduj lokalny zestaw testowy RAG, oblicz podstawowe metryki wyszukiwania, zinterpretuj kompromisy między nimi i sprawdź, czy twierdzenia zawarte w odpowiedziach są poparte przytoczonymi dowodami.

Dlaczego obliczenia funkcji inteligentnego domu stają się ważniejsze wraz ze wzrostem liczby czujników przy tej samej częstotliwości próbkowania?
Śledź obliczenia dla poszczególnych czujników i między czujnikami wraz ze wzrostem liczby urządzeń, identyfikuj nieliniowe koszty fuzji danych i porównaj wydajność potoku cech, zanim...

Dlaczego koszt oceny RAG rośnie przy tej samej liczbie zapytań wraz z rozbudową biblioteki dokumentów?
Zrozum, dlaczego rozrost korpusu zwiększa nakład pracy na ocenę RAG bez zwiększania liczby zapytań użytkowników oraz jak testy warstwowe utrzymują koszty proporcjonalne do ryzyka.

