Czy domowy agent AI może zweryfikować wyniki własnych narzędzi przed podjęciem działania?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Tak, domowy agent AI może zweryfikować wiele wyników działania narzędzi przed podjęciem działania, ale wiarygodne kontrole muszą być niezależne od pierwotnego założenia modelu.

Załóżmy, że agent przeszukuje lokalny kalendarz, odczytuje wiadomość e-mail dotyczącą wysyłki i przygotowuje się do odwołania spotkania. Płynna odpowiedź narzędzia może zawierać błędną datę, nieaktualny rekord lub nieprawidłowo sformatowane pola, które mimo to wyglądają wiarygodnie dla modelu. Weryfikacja oznacza sprawdzenie struktury, tożsamości, aktualności, uprawnień i dowodów przed granicą wykonania działania — a nie tylko zapytanie tego samego modelu, czy jego własna interpretacja wydaje się poprawna.

Weryfikacja zaczyna się od kontroli deterministycznych

Najtańsze kontrole nie wymagają użycia kolejnego modelu. Należy zweryfikować nazwę narzędzia, schemat argumentów, schemat odpowiedzi, identyfikatory rekordów, znaczniki czasu, jednostki i dozwolone zakresy wartości. Wyszukiwanie w kalendarzu powinno zwrócić identyfikator wydarzenia istniejący na oczekiwanym koncie; operacja na pliku powinna wskazywać lokalizację wewnątrz zatwierdzonego katalogu; suma zakupu powinna zostać uzgodniona na podstawie pozycji przed przesłaniem jakiejkolwiek transakcji.

Agents SDK firmy OpenAI obsługuje mechanizmy ochronne danych wejściowych i wyjściowych, które mogą odrzucać lub przerywać przebieg, gdy kontrole się nie powiodą. Są one przydatne, ponieważ działają poza zwykłym generowaniem odpowiedzi. Walidator typów nie może udowodnić, że data jest faktycznie poprawna, ale może uniemożliwić agentowi potraktowanie brakujących, niejednoznacznych lub nieoczekiwanych danych jako pozwolenia na kontynuowanie.

Walidacja deterministyczna zamienia ukrytą niejednoznaczność w widoczny stan: powodzenie, niepowodzenie lub niewystarczające dowody. Stan ten powinien być przekazywany razem z wynikiem działania narzędzia. Agent może ponowić tylko do odczytu po przejściowym błędzie, ale nie powinien wymyślać brakującego identyfikatora ani przekształcać nieprawidłowej odpowiedzi do oczekiwanego formatu wyłącznie po to, by plan mógł być kontynuowany.

Niezależne dowody zapobiegają zapętlonej samoweryfikacji

Weryfikacja semantyczna sprawdza, czy wynik uzasadnia zaplanowane działanie. Najsilniejszy schemat polega na porównaniu niezależnych obserwacji: potwierdzeniu informacji o dostarczeniu przesyłki zarówno w danych przewoźnika, jak i na podstawie identyfikatora zamówienia albo potwierdzeniu wolnego miejsca na dysku za pomocą zapytania do systemu plików, zamiast polegania na podsumowaniu tekstowym wygenerowanym przez pierwsze narzędzie. Zgodność ma znaczenie tylko wtedy, gdy kontrole nie korzystają z tego samego źródła błędu.

Struktura ReAct przeplata rozumowanie z działaniami, dzięki czemu obserwacje mogą aktualizować plan, zamiast być dopisywane po zakończeniu ustalonego łańcucha. Poprawia to możliwość śledzenia przebiegu, ale obserwacja nadal jest danymi, a nie prawdą. Weryfikator powinien porównać otrzymane dowody z jawnymi predykatami, takimi jak zgodność tożsamości, aktualny znacznik czasu, wystarczające saldo czy odwracalny cel.

Poproszenie tego samego modelu o skrytykowanie tego samego zapisu rozmowy może ujawnić sprzeczności, ale nie jest niezależną weryfikacją. Krytyk ma te same uprzedzenia wynikające z procesu uczenia i może zaakceptować przekonujący, fałszywy wynik. Weryfikacji opartej na modelu używaj do nieprecyzyjnych ocen, a rozstrzygające twierdzenia opieraj na drugim narzędziu, sumie kontrolnej, ograniczeniu bazy danych lub człowieku. Większa autorefleksja nie tworzy automatycznie nowego źródła prawdy.

Ryzyko działania określa, ile dowodów wystarczy

Rekomendacja tylko do odczytu może tolerować niepewność, której nie można dopuścić w przypadku działania destrukcyjnego. Zasady weryfikacji powinny klasyfikować działania według odwracalności, skutków finansowych, narażenia prywatności, odbiorców i zakresu oddziaływania. Zmiana nazwy pliku tymczasowego może wymagać jednego sprawdzenia schematu; usunięcie archiwum zdjęć, wysłanie wiadomości zewnętrznej, zmiana zapory sieciowej lub wydanie pieniędzy powinny wymagać silniejszych dowodów, a często także wyraźnej zgody.

Wytyczne dotyczące bezpieczeństwa agentów OpenAI uznają weryfikację przez człowieka za podstawowy mechanizm kontroli, szczególnie gdy przebieg przekracza wrażliwą granicę. Serwer domowy może wstrzymać proces, wyświetlić dokładny cel i dowody oraz lokalnie zachować stan oczekujący. Zgoda powinna być powiązana z dokładnymi argumentami, aby późniejsza tura modelu nie mogła podmienić odbiorcy, ścieżki ani kwoty.

Twierdzenie o samoweryfikacji zawodzi, gdy każdy kontroler korzysta z tego samego skażonego źródła, środowisko zmienia się między kontrolą a działaniem albo działania nie można cofnąć. Zawodzi również wtedy, gdy wynik narzędzia zawiera instrukcje nadpisujące zasady. Traktuj wyniki jako niezaufane dane, skracaj odstęp między weryfikacją a wykonaniem oraz wymagaj, aby adapter narzędzia — a nie model — egzekwował niepodlegające negocjacji uprawnienia.

Używaj koperty dowodów przed wykonaniem działania

Przed wykonaniem wymagaj jednej uporządkowanej koperty zawierającej proponowane działanie, znormalizowane argumenty, obserwacje źródłowe, wyniki walidacji, okno aktualności, klasę ryzyka i stan zatwierdzenia. Utwórz skrót koperty lub nadaj jej unikalny identyfikator, a następnie przekaż ten identyfikator do narzędzia wykonującego działanie. Jeśli którykolwiek argument się zmieni, unieważnij kopertę i przeprowadź ponowną weryfikację zamiast ponownie używać wcześniejszej zgody.

Lokalny moduł wykonawczy agenta jest naturalnym miejscem dla tej kontroli, ponieważ zarządza sesjami, narzędziami i uprawnieniami. Omówienie wtyczek modułu wykonawczego agentów firmy ZimaSpace pokazuje, jak możliwości rozszerzają się wokół modelu; ta sama warstwa powinna ograniczać możliwości za pomocą bramek opartych na dowodach. Dostępność narzędzia i autoryzacja narzędzia to dwa odrębne stany.

Przetestuj kopertę w czterech przypadkach: poprawny wynik, nieprawidłowo sformatowane dane, nieaktualny, lecz wiarygodny wynik oraz sprzeczne, niezależne źródła. Kontynuuj tylko wtedy, gdy poprawne działania o niskim ryzyku są wykonywane, praca obarczona niepewnością zostaje wstrzymana, a odrzuconego działania nie można odblokować perswazją zawartą w poleceniu. Celem nie jest to, by agent brzmiał ostrożnie; chodzi o to, aby niezweryfikowany stan był technicznie niezdolny do uruchomienia chronionego działania.

Ryzyko działania Minimalna weryfikacja Zasada wykonania
Tylko do odczytu Schemat i aktualność Bezpiecznie ponów próbę
Odwracalna zmiana lokalna Tożsamość oraz sprawdzenie stanu Zapisz w dzienniku i zezwól na wycofanie
Komunikacja zewnętrzna Odbiorca, treść, grupa odbiorców Wyświetl podgląd lub poproś o zatwierdzenie
Działanie destrukcyjne lub finansowe Niezależne dowody Wyraźna zgoda powiązana z argumentami

Najczęściej zadawane pytania

Czy drugi LLM może pełnić rolę weryfikatora?

Może zwiększyć różnorodność, jeśli korzysta z osobnego polecenia lub modelu, ale nadal pozostaje probabilistyczny. Używaj go do przeglądu semantycznego, a nie jako jedynej bramki dla faktów, które mogą zostać zweryfikowane przez narzędzia deterministyczne lub ludzi.

Czy każde wywołanie narzędzia powinno być weryfikowane dwukrotnie?

Nie. Zakres weryfikacji powinien odpowiadać ryzyku i niepewności. Nadmiarowe kontrole zwiększają opóźnienia i mogą tworzyć nowe punkty awarii, podczas gdy działania chronione zasługują na silniejsze, niezależne dowody.

Czy dzienniki mogą udowodnić, że agent najpierw przeprowadził kontrolę?

Dzienniki mogą pokazać zarejestrowaną kolejność, jeśli są kompletne i odporne na manipulacje. Nie dowodzą jednak, że dane źródłowe były poprawne, dlatego wraz z działaniem przechowuj identyfikatory dowodów i wyniki walidacji.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.