Przykłady zastosowań Jev: 7 rzeczy, które ludzie już budują za pomocą modelu decyzyjnego TypeSafe

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Jev staje się łatwiejszy do zrozumienia, gdy przestajesz pytać, co może powiedzieć, a zaczynasz pytać, o czym oprogramowanie może pozwolić mu decydować. Deweloperzy już korzystają z modelu decyzyjnego TypeSafe w stosach agentów, automatyzacji przeglądarek, analizie reklam, ocenianiu potencjalnych klientów, grach, ocenie treści i selekcji materiałów badawczych.

Wzorzec jest ważniejszy niż każda pojedyncza demonstracja. Jev nie zastępuje kodu ani najnowocześniejszych LLM-ów. Jest przeznaczony dla nieostrej warstwy pośredniej: decyzji zbyt subiektywnych dla prostej reguły, zbyt powtarzalnych dla ludzi i zbyt małych, by za każdym razem uzasadniać kosztowne generowanie. Informacje o podstawowej architekturze modelu i jego ograniczeniach znajdziesz w naszym wcześniejszym wyjaśnieniu dotyczącym modeli decyzyjnych dla agentów AI.

Co sprawia, że zastosowanie Jev jest dobre?

Najlepsze publiczne wdrożenia Jev mają kilka wspólnych cech: prawidłowe wyniki są znane przed wnioskowaniem, ten sam osąd jest wydawany wielokrotnie, opóźnienie ma znaczenie, tekst swobodny wnosi niewiele wartości, a niepewne przypadki można przekazać gdzie indziej.

Prosty test jest użyteczny: jeśli możesz zdefiniować prawidłową przestrzeń odpowiedzi, zanim model zacznie działać, warto rozważyć model decyzyjny.

Obciążenie Lepsze zastosowanie
Który agent powinien się tym zająć? Model decyzyjny
Który przycisk powinna kliknąć przeglądarka? Model decyzyjny
Napisanie końcowego e-maila do klienta Model generatywny
Wyjaśnianie złożonego artykułu naukowego Model generatywny / rozumujący

To rozróżnienie staje się wyraźniejsze w projektach, które ludzie już tworzą.

1. OpenClaw: dedykowany model decyzyjny w stosie agenta

OpenClaw jest jednym z najsilniejszych sygnałów, że Jev wychodzi poza eksperymentalne demonstracje. Obecna dokumentacja modeli decyzyjnych rozdziela główny model konwersacyjny od dedykowanej roli modelu decyzyjnego.

Dołączona wtyczka TypeSafe pozwala deweloperom niezależnie wybrać Jev, bez względu na główny LLM. Większy model nadal może planować, programować, wyjaśniać i korzystać z narzędzi, podczas gdy Jev zajmuje się węższymi pytaniami, takimi jak to, który agent powinien otrzymać zadanie, czy dowody spełniają warunek lub czy przepływ pracy powinien być kontynuowany.

To ważna zmiana architektoniczna. Zamiast traktować każdy niejednoznaczny krok jako kolejne polecenie dla głównego LLM, agent może przeznaczyć jeden model specjalnie do ograniczonych ocen.

OpenClaw zachowuje również istotne rozdzielenie między podejmowaniem decyzji a działaniem. Wynik Jev może dostarczyć dowodów na to, że działanie wydaje się właściwe, ale nie powinien automatycznie przyznawać uprawnień do publikowania treści, wysyłania wiadomości ani zmieniania trwałego stanu. Takie działania nadal muszą przejść przez osobną granicę zaufania wykonywania narzędzi.

Dzięki temu model decyzyjny przypomina mniej mniejszego chatbota, a bardziej kolejny komponent infrastruktury działający obok głównego modelu agenta.

2. Agenci przeglądarkowi: wybieranie następnego kliknięcia zamiast opisywania strony

Automatyzacja przeglądarki z natury opiera się w dużej mierze na decyzjach. Na wielu etapach agent wie już, jakie elementy są dostępne, i musi tylko wybrać następne działanie.

Gregor Zunic opublikował eksperyment Browser Use, w którym przeglądarka udostępnia stan DOM, Jev wybiera następne działanie, a mniejszy model generatywny obsługuje przypadki rzeczywiście wymagające tekstu. W publicznej demonstracji wyszukiwania lotów autor podał około 7 sekund i 0,0039 USD łącznego kosztu. Są to wartości podane przez twórcę, a nie wyniki niezależnego testu porównawczego. Zobacz przykład Browser Use + Jev.

Praca w przeglądarce Najlepsza rola
Wybierz następny klikalny element Jev
Oceń, czy cel został osiągnięty Jev
Napisz otwartą odpowiedź w formularzu Model generatywny

To rozróżnienie ma znaczenie, ponieważ znaczna część pętli przeglądarki nie polega na proszeniu modelu o tworzenie języka. Polega na wielokrotnym pytaniu, które działanie najlepiej przybliża do bieżącego celu.

Sugeruje to wydajniejszy projekt agenta przeglądarkowego: używaj generowania, gdy przeglądarka rzeczywiście potrzebuje nowego tekstu, a ograniczonych decyzji, gdy kolejny krok wynika już ze znanego zestawu działań.

3. Analiza reklam: oceń cały zbiór danych zamiast pobierać z niego próbkę

Matthew Berman poinformował, że użył Jev do sklasyfikowania 724 aktywnych reklam 37 marek według takich wymiarów jak hak, format, oferta, CTA, etap świadomości i niezgodność strony docelowej. Według raportu cały przebieg zajął około 40 sekund i kosztował około 0,09 USD. Podane wartości pochodzą z raportu autora i zostały zebrane w publicznym przykładzie analizy reklam.

Ciekawszą konsekwencją jest to, co dzieje się, gdy oceny w pierwszym przebiegu stają się wystarczająco tanie.

Kosztowna analiza Tania warstwa decyzyjna
Zbierz 1000 reklam Zbierz 1000 reklam
Pobierz próbkę 50 Oceń wszystkie 1000
Wnioskuj o wzorcach na podstawie próbki Filtruj według ustrukturyzowanych sygnałów
Szeroko wykorzystuj czas ekspertów Przeanalizuj nietypowe lub wartościowe klastry

Analitycy często korzystają z próbkowania, ponieważ ocena każdego rekordu jest zbyt kosztowna. Jeśli model decyzyjny potrafi tanio ocenić każdą reklamę pod kątem tych samych kryteriów, zmienia się cały przepływ pracy. Zamiast używać AI wyłącznie do analizy niewielkiej próbki, można najpierw sklasyfikować cały zbiór danych, zanim człowiek przyjrzy się najbardziej interesującym klastrom.

To większa zmiana niż samo obniżenie kosztów analizy reklam: niektóre problemy z próbkowaniem można przekształcić w problemy z kompleksową oceną.

4. Ocena leadów: umieść tanią decyzję przed kosztownym generowaniem

Podobny schemat pojawia się przy ocenie potencjalnych klientów. Romàn poinformował o przetworzeniu 700 leadów w około 40 sekund za około 0,09 USD, oceniając dopasowanie, pewność i niedopasowanie, a następnie decydując, które rekordy zasługiwały na dokładniejszą analizę. Zobacz opublikowany eksperyment dotyczący oceny leadów.

Warstwa Zadanie
Jev Filtruj, oceniaj, klasyfikuj
Reguła pewności Zdecyduj, co wymaga eskalacji
Duży LLM Generuj spersonalizowane treści o wysokiej wartości

Praktyczna wartość wynika ze zmiany miejsca, w którym odbywa się kosztowne generowanie. Zamiast prosić wydajny LLM o dogłębną analizę i napisanie spersonalizowanej wiadomości do każdego rekordu, system może najpierw wskazać niewielki podzbiór rekordów, które wydają się wartościowe lub niepewne.

To jeden z powodów, dla których hybrydowa strategia kosztów AI coraz częściej opiera się na routingu. Optymalizacja kosztów nie polega wyłącznie na znalezieniu tańszego modelu. Chodzi również o ustalenie, które żądania w ogóle wymagają drogiego modelu.

W takiej architekturze Jev najlepiej sprawdza się jako filtr wstępny, a nie jako końcowa warstwa inteligencji.

5. Gry czasu rzeczywistego: częstotliwość podejmowania decyzji zmienia ekonomię

Gry czasu rzeczywistego mogą wyglądać jak efektowne demonstracje, ale pokazują, dlaczego opóźnienia mają znaczenie.

Max Blade opublikował eksperyment z Subway Surfers, w którym Jev działał jednocześnie w 50 grach, a autor podał, że łączny koszt wnioskowania wyniósł mniej niż jeden cent. Dane te pochodzą z deklaracji autora zawartych w publicznej wersji demonstracyjnej gry.

Przestrzeń działań jest niewielka: przesuń w lewo, przesuń w prawo, skacz, kucaj albo kontynuuj. Szczegółowe opisanie językiem naturalnym każdej klatki przed wyborem jednego z tych działań przynosi niewielką korzyść.

Wprowadza to użyteczny sposób oceny modeli decyzyjnych: częstotliwość podejmowania decyzji.

Oszczędzenie kilkuset milisekund przy jednym osądzie dziennie ma niewielką praktyczną wartość. Oszczędzenie tego opóźnienia przy wielu decyzjach na sekundę, pomnożone przez dziesiątki równoległych środowisk, zmienia zarówno czas odpowiedzi, jak i koszt wnioskowania.

Dlatego szybkie modele decyzyjne stają się ciekawsze, gdy ta sama ograniczona ocena jest powtarzana coraz częściej.

6. Ocena treści: zadawaj wiele pytań dotyczących tej samej wersji roboczej

SuperX pokazuje inny wymiar tego problemu. Zamiast bardzo często podejmować tę samą decyzję, system zadaje wiele różnych pytań dotyczących tego samego wejścia.

Publiczny eksperyment ocenia post w mediach społecznościowych na podstawie 61 odrębnych pytań. Autor podaje około jednej sekundy i 0,0004 USD na wersję roboczą, wykorzystując historyczne posty do pomocy w identyfikowaniu sygnałów powiązanych z lepszymi wynikami. Wyniki te są deklaracjami twórcy produktu, a nie niezależnymi benchmarkami. Projekt jest widoczny w katalogu przykładów zastosowań związanych z treścią i wzrostem.

Zamiast zadawać ogólne pytanie, takie jak „Czy to dobry post?”, aplikacja może rozłożyć wersję roboczą na bardziej konkretne osądy:

  • Czy hak jest konkretny?
  • Czy pozostaje luka ciekawości?
  • Czy twierdzenie jest konkretne?
  • Czy tekst brzmi zbyt promocyjnie?
  • Czy CTA jest zbyt agresywne?

Rezultatem nie jest jedna nieprzejrzysta ocena AI. Jest nim uporządkowany profil, którego oprogramowanie może użyć do określenia, który wymiar wymaga przeredagowania, porównania dwóch wersji roboczych lub zdecydowania, czy potrzebna jest weryfikacja człowieka.

To sprawia, że wymiarowość decyzji staje się kolejną ważną zmienną. Model może być użyteczny nie tylko dlatego, że ten sam osąd pojawia się często, lecz także dlatego, że dziesiątki ograniczonych osądów można tanio zastosować do tego samego stanu.

7. Klasyfikacja badań: najpierw przeprowadź wstępną selekcję wszystkiego, a potem czytaj to, co ma znaczenie

Publiczny projekt o nazwie 1kpapers wykorzystał Jev do sklasyfikowania 1018 artykułów naukowych dotyczących AI. Opublikowane dane wskazują na około 0,08 USD łącznego kosztu i około 256 ms mediany opóźnienia od początku do końca na artykuł. Projekt jest wymieniony w katalogu witryn Made with Jev.

To może być jeden z bardziej praktycznych przykładów, ponieważ wiele rzeczywistych przepływów pracy zaczyna się od zbyt dużej liczby rekordów: artykułów, e-maili, zgłoszeń do pomocy technicznej, recenzji, dokumentów, dzienników lub zapytań wyszukiwania.

Najbardziej kosztowne często nie jest zrozumienie jednego elementu, lecz zdecydowanie, które elementy zasługują na dokładniejszą uwagę.

Pierwsza faza Druga faza
Klasyfikacja tematu Dogłębne czytanie wybranych dokumentów
Ocena trafności Przekazywanie wartościowych rekordów większemu modelowi
Wykrywanie oczywistych niezgodności Człowiek analizuje niejednoznaczne przypadki
Szacowanie pewności Eskalowanie niepewnych rekordów

Jest to szczególnie przydatne, gdy dane źródłowe są prywatne. prywatny asystent AI może przechowywać lokalnie mechanizm wyszukiwania i bibliotekę surowych dokumentów, a tylko wybrane lub przetworzone dowody przesyłać w razie potrzeby do zewnętrznej usługi.

Model nie musi zastępować dogłębnej lektury. Jego rolą jest wybór materiałów, które wymagają dokładnego przeczytania.

Rzeczywisty schemat: gęstość decyzji

Siedem przykładów wydaje się niezwiązanych, ale pod względem struktury są bardzo podobne. Każdy zaczyna się od nieuporządkowanego stanu, a następnie wielokrotnie zadaje pytania, na które zakres odpowiedzi jest już ograniczony.

Można to trafnie opisać pojęciem gęstości decyzji: liczbą ograniczonych ocen, które system musi wydać w ramach określonego obciążenia.

Najważniejsze są dwa czynniki:

  • częstotliwość: jak często aplikacja potrzebuje oceny;
  • wymiarowość: ile ocen system musi wydać dla każdego stanu.
Obciążenie Gęstość decyzji Dopasowanie do Jev
Jedno sprawdzenie tak/nie dziennie Niska Niewielka przewaga
Klasyfikacja 1000 wiadomości e-mail Wysoka częstotliwość Dobre
61 pytań na wersję roboczą Wysoka wymiarowość Dobre
Działanie w przeglądarce na każdym kroku Wysoka częstotliwość Dobre
Wiele równoległych gier Bardzo wysoka częstotliwość Bardzo dobre dopasowanie strukturalne
Napisz szczegółowy raport Zdominowane przez generowanie Słabe dopasowanie

Pojedyncza decyzja binarna raczej nie uzasadnia przeprojektowania stosu AI. Tysiące niejednoznacznych decyzji lub dziesiątki ocen dla każdego wejścia to zupełnie inny problem.

Im większa gęstość decyzji, tym bardziej atrakcyjna staje się wyspecjalizowana warstwa decyzyjna.

Najlepsza architektura może zaczynać się od Jev, a kończyć na większym modelu

Modele decyzyjne również nie muszą rozwiązywać każdego przypadku. Pewność może określać moment, w którym bardziej zaawansowany model powinien przejąć zadanie.

Publiczny eksperyment wykrywania oszustw ilustruje ten schemat. Twórca najpierw użył Jev do 100 wiadomości e-mail, a następnie przekazał przewidywania poniżej progu pewności wynoszącego 95% większemu modelowi Kimi K3. Autor poinformował o 31 eskalacjach, końcowej dokładności 96/100 oraz łącznym koszcie wynoszącym około 0,07 USD. Dane te nadal mają charakter eksperymentalny i pochodzą z samooceny autora; przypadek znajduje się w katalogu inżynierii Jev.

Etap Cel
Tani model decyzyjny Obsługa oczywistych przypadków
Próg pewności Wykrywanie niepewności
Duży model rozumujący Obsługuj trudne przypadki
Warstwa zasad / człowieka Zachowaj uprawnienia decyzyjne tam, gdzie błędy mają znaczenie

Ta architektura jest ciekawsza niż próba maksymalizacji samodzielnej dokładności Jev. Tańszy model może obsłużyć łatwą większość, podczas gdy droższy model otrzyma tylko niejednoznaczne przypadki.

Nawet wtedy pewność nie powinna automatycznie stawać się uprawnieniem do podejmowania decyzji. narzędzia agenta tylko do odczytu i ograniczone uprawnienia nadal mają znaczenie, gdy klasyfikacja może ostatecznie wywołać rzeczywiste działanie.

Tanie decyzje nie sprawiają, że złe sygnały stają się dobre

Wczesne dyskusje na temat Jev rozszerzyły się już na takie obszary jak automatyczne etykietowanie i handel. Oba pasują do interfejsu modelu decyzyjnego, ale nie sprawia to, że wszystkie związane z nimi twierdzenia są równie wiarygodne.

W przypadku etykietowania danych najsilniejszy projekt w najbliższym czasie niekoniecznie polega na zastąpieniu ludzkich adnotatorów. Przypadki o wysokim poziomie pewności można etykietować automatycznie, przykłady o średnim poziomie pewności mogą zostać poddane ocenie drugiego modelu, a niejednoznaczne rekordy nadal mogą trafiać do człowieka.

To zmienia przykłady, na których ludzie poświęcają czas, zamiast zakładać, że ludzie znikną z procesu.

Handel ma jeszcze wyraźniejsze ograniczenie. Wytworzenie kup, sprzedaj, lub trzymaj szybko łatwo przedstawić jako decyzję o określonych granicach. Trudniejszym problemem jest to, czy dane wejściowe zawierają rzeczywistą przewagę predykcyjną.

Jev może sprawić, że decyzja rynkowa będzie tania. Nie może sprawić, że słabe sygnały staną się predykcyjne.

To samo rozróżnienie dotyczy większości powyższych przykładów. Niskie opóźnienia i niski koszt wnioskowania pokazują, że warstwa decyzyjna jest wydajna. Same w sobie nie dowodzą jednak, że leżąca u podstaw ocena generuje wartość biznesową.

Gdzie Jev pasuje do lokalnego agenta AI

Sam Jev jest obecnie usługą hostowaną, a nie publicznie dostępnym punktem kontrolnym do samodzielnego hostowania. Tworzy to istotną granicę dla lokalnej AI.

Lokalny agent może przechowywać pliki, pamięć, funkcje wyszukiwania i narzędzia na domowym serwerze, ale jeśli treść dokumentu zostanie wysłana do Jev w celu klasyfikacji, te dane dowodowe przekroczą granicę sieci.

Pozostaw lokalnie Potencjalne dane wejściowe dla decyzji hostowanej
Pełna prywatna biblioteka dokumentów Wybrane lub wyprowadzone dowody
Surowe pliki źródłowe Minimalny stan zadania
Pamięć osobista Niewrażliwy kontekst klasyfikacji
Dane uwierzytelniające i sekrety Nie powinno być wymagane w przypadku zwykłej klasyfikacji

Ta sama zasada ma zastosowanie podczas korzystania z narzędzi chmurowych z lokalnymi plikami: lokalne środowisko uruchomieniowe nie gwarantuje automatycznie lokalnego przepływu danych.

Lepszy projekt hybrydowy utrzymuje prywatne pobieranie danych, wstępne przetwarzanie, anonimizację i rutynowe operacje lokalne blisko danych, a następnie wysyła do hostowanego modelu decyzyjnego lub rozumującego tylko niezbędne minimum danych.

Co właściwie pokazują pierwsze wdrożenia Jev

Pierwsza fala eksperymentów z Jev nie pokazuje, że mały model decyzyjny może zastąpić przełomową sztuczną inteligencję.

Pokazuje to coś bardziej użytecznego: wiele aplikacji AI zużywa moc obliczeniową modeli generatywnych na zadania, które nie wymagają generowania.

W przeglądarkach, reklamach, potencjalnych klientach, grach, treściach, badaniach i orkiestracji agentów wciąż pojawia się ta sama struktura. Dane wejściowe są nieuporządkowane, ale możliwe wyniki są ograniczone. Ocena jest powtarzana, a niepewne przypadki można eskalować.

Warstwa Najlepsze zastosowanie
Reguły / kod Deterministyczne decyzje
Model decyzyjny Nieostre, ograniczone oceny
Model rozumujący Trudne, niejednoznaczne problemy
Model generatywny Twórz język, kod lub multimedia
Warstwa zasad Określ, co faktycznie można wykonać

Dlatego najbardziej użyteczne demonstracje Jev nie próbują udowodnić, że Jev potrafi zrobić wszystko.

To właśnie one pokazują, gdzie nie trzeba w ogóle angażować LLM ogólnego przeznaczenia.

Jev jest najbardziej przydatny tam, gdzie oprogramowanie musi podejmować tysiące nieostrych, ale ograniczonych decyzji - i prawie nie używać słów.

Najczęściej zadawane pytania dotyczące zastosowań Jev

Czy Jev może współpracować z OpenClaw?

Tak. OpenClaw obsługuje dedykowaną rolę modelu decyzyjnego oraz wtyczkę TypeSafe, która może używać Jev niezależnie od głównego modelu konwersacyjnego.

Czy Jev może sterować agentem przeglądarkowym?

Tak. Publiczne eksperymenty Browser Use wykorzystywały Jev do wybierania kolejnej czynności z ograniczonego zbioru działań DOM, podczas gdy modele generatywne obsługiwały w razie potrzeby otwarty tekst.

Czy Jev może analizować reklamy, posty lub duże zbiory danych?

Tak. Publiczne wdrożenia wykorzystywały Jev do klasyfikacji reklam, oceny treści, sortowania wiadomości e-mail, klasyfikacji artykułów naukowych i innych masowych, ustrukturyzowanych ocen. Większość opublikowanych danych dotyczących szybkości i kosztów pochodzi obecnie od twórców, a nie z niezależnych testów porównawczych.

Czy Jev może zastąpić ręczne etykietowanie danych?

Potencjalnie może automatyzować pewne ograniczone etykiety wymagające wysokiej pewności, ale obecne dane nie uzasadniają precyzyjnych twierdzeń o zastąpieniu określonego odsetka osób zajmujących się adnotacją. Bardziej realistycznym projektem jest eskalacja na podstawie poziomu pewności.

Czy Jev może działać lokalnie?

TypeSafe nie opublikował publicznych wag Jev do samodzielnego hostowania. Obecne integracje Jev korzystają z wnioskowania hostowanego, dlatego projekty prywatnych agentów powinny dokładnie kontrolować, jakie dowody są wysyłane poza lokalne środowisko.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.