Jev staje się łatwiejszy do zrozumienia, gdy przestajesz pytać, co może powiedzieć, a zaczynasz pytać, o czym oprogramowanie może pozwolić mu decydować. Deweloperzy już korzystają z modelu decyzyjnego TypeSafe w stosach agentów, automatyzacji przeglądarek, analizie reklam, ocenianiu potencjalnych klientów, grach, ocenie treści i selekcji materiałów badawczych.
Wzorzec jest ważniejszy niż każda pojedyncza demonstracja. Jev nie zastępuje kodu ani najnowocześniejszych LLM-ów. Jest przeznaczony dla nieostrej warstwy pośredniej: decyzji zbyt subiektywnych dla prostej reguły, zbyt powtarzalnych dla ludzi i zbyt małych, by za każdym razem uzasadniać kosztowne generowanie. Informacje o podstawowej architekturze modelu i jego ograniczeniach znajdziesz w naszym wcześniejszym wyjaśnieniu dotyczącym modeli decyzyjnych dla agentów AI.
Co sprawia, że zastosowanie Jev jest dobre?
Najlepsze publiczne wdrożenia Jev mają kilka wspólnych cech: prawidłowe wyniki są znane przed wnioskowaniem, ten sam osąd jest wydawany wielokrotnie, opóźnienie ma znaczenie, tekst swobodny wnosi niewiele wartości, a niepewne przypadki można przekazać gdzie indziej.
Prosty test jest użyteczny: jeśli możesz zdefiniować prawidłową przestrzeń odpowiedzi, zanim model zacznie działać, warto rozważyć model decyzyjny.
| Obciążenie | Lepsze zastosowanie |
|---|---|
| Który agent powinien się tym zająć? | Model decyzyjny |
| Który przycisk powinna kliknąć przeglądarka? | Model decyzyjny |
| Napisanie końcowego e-maila do klienta | Model generatywny |
| Wyjaśnianie złożonego artykułu naukowego | Model generatywny / rozumujący |
To rozróżnienie staje się wyraźniejsze w projektach, które ludzie już tworzą.
1. OpenClaw: dedykowany model decyzyjny w stosie agenta
OpenClaw jest jednym z najsilniejszych sygnałów, że Jev wychodzi poza eksperymentalne demonstracje. Obecna dokumentacja modeli decyzyjnych rozdziela główny model konwersacyjny od dedykowanej roli modelu decyzyjnego.
Dołączona wtyczka TypeSafe pozwala deweloperom niezależnie wybrać Jev, bez względu na główny LLM. Większy model nadal może planować, programować, wyjaśniać i korzystać z narzędzi, podczas gdy Jev zajmuje się węższymi pytaniami, takimi jak to, który agent powinien otrzymać zadanie, czy dowody spełniają warunek lub czy przepływ pracy powinien być kontynuowany.
To ważna zmiana architektoniczna. Zamiast traktować każdy niejednoznaczny krok jako kolejne polecenie dla głównego LLM, agent może przeznaczyć jeden model specjalnie do ograniczonych ocen.
OpenClaw zachowuje również istotne rozdzielenie między podejmowaniem decyzji a działaniem. Wynik Jev może dostarczyć dowodów na to, że działanie wydaje się właściwe, ale nie powinien automatycznie przyznawać uprawnień do publikowania treści, wysyłania wiadomości ani zmieniania trwałego stanu. Takie działania nadal muszą przejść przez osobną granicę zaufania wykonywania narzędzi.
Dzięki temu model decyzyjny przypomina mniej mniejszego chatbota, a bardziej kolejny komponent infrastruktury działający obok głównego modelu agenta.
2. Agenci przeglądarkowi: wybieranie następnego kliknięcia zamiast opisywania strony
Automatyzacja przeglądarki z natury opiera się w dużej mierze na decyzjach. Na wielu etapach agent wie już, jakie elementy są dostępne, i musi tylko wybrać następne działanie.
Gregor Zunic opublikował eksperyment Browser Use, w którym przeglądarka udostępnia stan DOM, Jev wybiera następne działanie, a mniejszy model generatywny obsługuje przypadki rzeczywiście wymagające tekstu. W publicznej demonstracji wyszukiwania lotów autor podał około 7 sekund i 0,0039 USD łącznego kosztu. Są to wartości podane przez twórcę, a nie wyniki niezależnego testu porównawczego. Zobacz przykład Browser Use + Jev.
| Praca w przeglądarce | Najlepsza rola |
|---|---|
| Wybierz następny klikalny element | Jev |
| Oceń, czy cel został osiągnięty | Jev |
| Napisz otwartą odpowiedź w formularzu | Model generatywny |
To rozróżnienie ma znaczenie, ponieważ znaczna część pętli przeglądarki nie polega na proszeniu modelu o tworzenie języka. Polega na wielokrotnym pytaniu, które działanie najlepiej przybliża do bieżącego celu.
Sugeruje to wydajniejszy projekt agenta przeglądarkowego: używaj generowania, gdy przeglądarka rzeczywiście potrzebuje nowego tekstu, a ograniczonych decyzji, gdy kolejny krok wynika już ze znanego zestawu działań.
3. Analiza reklam: oceń cały zbiór danych zamiast pobierać z niego próbkę
Matthew Berman poinformował, że użył Jev do sklasyfikowania 724 aktywnych reklam 37 marek według takich wymiarów jak hak, format, oferta, CTA, etap świadomości i niezgodność strony docelowej. Według raportu cały przebieg zajął około 40 sekund i kosztował około 0,09 USD. Podane wartości pochodzą z raportu autora i zostały zebrane w publicznym przykładzie analizy reklam.
Ciekawszą konsekwencją jest to, co dzieje się, gdy oceny w pierwszym przebiegu stają się wystarczająco tanie.
| Kosztowna analiza | Tania warstwa decyzyjna |
|---|---|
| Zbierz 1000 reklam | Zbierz 1000 reklam |
| Pobierz próbkę 50 | Oceń wszystkie 1000 |
| Wnioskuj o wzorcach na podstawie próbki | Filtruj według ustrukturyzowanych sygnałów |
| Szeroko wykorzystuj czas ekspertów | Przeanalizuj nietypowe lub wartościowe klastry |
Analitycy często korzystają z próbkowania, ponieważ ocena każdego rekordu jest zbyt kosztowna. Jeśli model decyzyjny potrafi tanio ocenić każdą reklamę pod kątem tych samych kryteriów, zmienia się cały przepływ pracy. Zamiast używać AI wyłącznie do analizy niewielkiej próbki, można najpierw sklasyfikować cały zbiór danych, zanim człowiek przyjrzy się najbardziej interesującym klastrom.
To większa zmiana niż samo obniżenie kosztów analizy reklam: niektóre problemy z próbkowaniem można przekształcić w problemy z kompleksową oceną.
4. Ocena leadów: umieść tanią decyzję przed kosztownym generowaniem
Podobny schemat pojawia się przy ocenie potencjalnych klientów. Romàn poinformował o przetworzeniu 700 leadów w około 40 sekund za około 0,09 USD, oceniając dopasowanie, pewność i niedopasowanie, a następnie decydując, które rekordy zasługiwały na dokładniejszą analizę. Zobacz opublikowany eksperyment dotyczący oceny leadów.
| Warstwa | Zadanie |
|---|---|
| Jev | Filtruj, oceniaj, klasyfikuj |
| Reguła pewności | Zdecyduj, co wymaga eskalacji |
| Duży LLM | Generuj spersonalizowane treści o wysokiej wartości |
Praktyczna wartość wynika ze zmiany miejsca, w którym odbywa się kosztowne generowanie. Zamiast prosić wydajny LLM o dogłębną analizę i napisanie spersonalizowanej wiadomości do każdego rekordu, system może najpierw wskazać niewielki podzbiór rekordów, które wydają się wartościowe lub niepewne.
To jeden z powodów, dla których hybrydowa strategia kosztów AI coraz częściej opiera się na routingu. Optymalizacja kosztów nie polega wyłącznie na znalezieniu tańszego modelu. Chodzi również o ustalenie, które żądania w ogóle wymagają drogiego modelu.
W takiej architekturze Jev najlepiej sprawdza się jako filtr wstępny, a nie jako końcowa warstwa inteligencji.
5. Gry czasu rzeczywistego: częstotliwość podejmowania decyzji zmienia ekonomię
Gry czasu rzeczywistego mogą wyglądać jak efektowne demonstracje, ale pokazują, dlaczego opóźnienia mają znaczenie.
Max Blade opublikował eksperyment z Subway Surfers, w którym Jev działał jednocześnie w 50 grach, a autor podał, że łączny koszt wnioskowania wyniósł mniej niż jeden cent. Dane te pochodzą z deklaracji autora zawartych w publicznej wersji demonstracyjnej gry.
Przestrzeń działań jest niewielka: przesuń w lewo, przesuń w prawo, skacz, kucaj albo kontynuuj. Szczegółowe opisanie językiem naturalnym każdej klatki przed wyborem jednego z tych działań przynosi niewielką korzyść.
Wprowadza to użyteczny sposób oceny modeli decyzyjnych: częstotliwość podejmowania decyzji.
Oszczędzenie kilkuset milisekund przy jednym osądzie dziennie ma niewielką praktyczną wartość. Oszczędzenie tego opóźnienia przy wielu decyzjach na sekundę, pomnożone przez dziesiątki równoległych środowisk, zmienia zarówno czas odpowiedzi, jak i koszt wnioskowania.
Dlatego szybkie modele decyzyjne stają się ciekawsze, gdy ta sama ograniczona ocena jest powtarzana coraz częściej.
6. Ocena treści: zadawaj wiele pytań dotyczących tej samej wersji roboczej
SuperX pokazuje inny wymiar tego problemu. Zamiast bardzo często podejmować tę samą decyzję, system zadaje wiele różnych pytań dotyczących tego samego wejścia.
Publiczny eksperyment ocenia post w mediach społecznościowych na podstawie 61 odrębnych pytań. Autor podaje około jednej sekundy i 0,0004 USD na wersję roboczą, wykorzystując historyczne posty do pomocy w identyfikowaniu sygnałów powiązanych z lepszymi wynikami. Wyniki te są deklaracjami twórcy produktu, a nie niezależnymi benchmarkami. Projekt jest widoczny w katalogu przykładów zastosowań związanych z treścią i wzrostem.
Zamiast zadawać ogólne pytanie, takie jak „Czy to dobry post?”, aplikacja może rozłożyć wersję roboczą na bardziej konkretne osądy:
- Czy hak jest konkretny?
- Czy pozostaje luka ciekawości?
- Czy twierdzenie jest konkretne?
- Czy tekst brzmi zbyt promocyjnie?
- Czy CTA jest zbyt agresywne?
Rezultatem nie jest jedna nieprzejrzysta ocena AI. Jest nim uporządkowany profil, którego oprogramowanie może użyć do określenia, który wymiar wymaga przeredagowania, porównania dwóch wersji roboczych lub zdecydowania, czy potrzebna jest weryfikacja człowieka.
To sprawia, że wymiarowość decyzji staje się kolejną ważną zmienną. Model może być użyteczny nie tylko dlatego, że ten sam osąd pojawia się często, lecz także dlatego, że dziesiątki ograniczonych osądów można tanio zastosować do tego samego stanu.
7. Klasyfikacja badań: najpierw przeprowadź wstępną selekcję wszystkiego, a potem czytaj to, co ma znaczenie
Publiczny projekt o nazwie 1kpapers wykorzystał Jev do sklasyfikowania 1018 artykułów naukowych dotyczących AI. Opublikowane dane wskazują na około 0,08 USD łącznego kosztu i około 256 ms mediany opóźnienia od początku do końca na artykuł. Projekt jest wymieniony w katalogu witryn Made with Jev.
To może być jeden z bardziej praktycznych przykładów, ponieważ wiele rzeczywistych przepływów pracy zaczyna się od zbyt dużej liczby rekordów: artykułów, e-maili, zgłoszeń do pomocy technicznej, recenzji, dokumentów, dzienników lub zapytań wyszukiwania.
Najbardziej kosztowne często nie jest zrozumienie jednego elementu, lecz zdecydowanie, które elementy zasługują na dokładniejszą uwagę.
| Pierwsza faza | Druga faza |
|---|---|
| Klasyfikacja tematu | Dogłębne czytanie wybranych dokumentów |
| Ocena trafności | Przekazywanie wartościowych rekordów większemu modelowi |
| Wykrywanie oczywistych niezgodności | Człowiek analizuje niejednoznaczne przypadki |
| Szacowanie pewności | Eskalowanie niepewnych rekordów |
Jest to szczególnie przydatne, gdy dane źródłowe są prywatne. prywatny asystent AI może przechowywać lokalnie mechanizm wyszukiwania i bibliotekę surowych dokumentów, a tylko wybrane lub przetworzone dowody przesyłać w razie potrzeby do zewnętrznej usługi.
Model nie musi zastępować dogłębnej lektury. Jego rolą jest wybór materiałów, które wymagają dokładnego przeczytania.
Rzeczywisty schemat: gęstość decyzji
Siedem przykładów wydaje się niezwiązanych, ale pod względem struktury są bardzo podobne. Każdy zaczyna się od nieuporządkowanego stanu, a następnie wielokrotnie zadaje pytania, na które zakres odpowiedzi jest już ograniczony.
Można to trafnie opisać pojęciem gęstości decyzji: liczbą ograniczonych ocen, które system musi wydać w ramach określonego obciążenia.
Najważniejsze są dwa czynniki:
- częstotliwość: jak często aplikacja potrzebuje oceny;
- wymiarowość: ile ocen system musi wydać dla każdego stanu.
| Obciążenie | Gęstość decyzji | Dopasowanie do Jev |
|---|---|---|
| Jedno sprawdzenie tak/nie dziennie | Niska | Niewielka przewaga |
| Klasyfikacja 1000 wiadomości e-mail | Wysoka częstotliwość | Dobre |
| 61 pytań na wersję roboczą | Wysoka wymiarowość | Dobre |
| Działanie w przeglądarce na każdym kroku | Wysoka częstotliwość | Dobre |
| Wiele równoległych gier | Bardzo wysoka częstotliwość | Bardzo dobre dopasowanie strukturalne |
| Napisz szczegółowy raport | Zdominowane przez generowanie | Słabe dopasowanie |
Pojedyncza decyzja binarna raczej nie uzasadnia przeprojektowania stosu AI. Tysiące niejednoznacznych decyzji lub dziesiątki ocen dla każdego wejścia to zupełnie inny problem.
Im większa gęstość decyzji, tym bardziej atrakcyjna staje się wyspecjalizowana warstwa decyzyjna.
Najlepsza architektura może zaczynać się od Jev, a kończyć na większym modelu
Modele decyzyjne również nie muszą rozwiązywać każdego przypadku. Pewność może określać moment, w którym bardziej zaawansowany model powinien przejąć zadanie.
Publiczny eksperyment wykrywania oszustw ilustruje ten schemat. Twórca najpierw użył Jev do 100 wiadomości e-mail, a następnie przekazał przewidywania poniżej progu pewności wynoszącego 95% większemu modelowi Kimi K3. Autor poinformował o 31 eskalacjach, końcowej dokładności 96/100 oraz łącznym koszcie wynoszącym około 0,07 USD. Dane te nadal mają charakter eksperymentalny i pochodzą z samooceny autora; przypadek znajduje się w katalogu inżynierii Jev.
| Etap | Cel |
|---|---|
| Tani model decyzyjny | Obsługa oczywistych przypadków |
| Próg pewności | Wykrywanie niepewności |
| Duży model rozumujący | Obsługuj trudne przypadki |
| Warstwa zasad / człowieka | Zachowaj uprawnienia decyzyjne tam, gdzie błędy mają znaczenie |
Ta architektura jest ciekawsza niż próba maksymalizacji samodzielnej dokładności Jev. Tańszy model może obsłużyć łatwą większość, podczas gdy droższy model otrzyma tylko niejednoznaczne przypadki.
Nawet wtedy pewność nie powinna automatycznie stawać się uprawnieniem do podejmowania decyzji. narzędzia agenta tylko do odczytu i ograniczone uprawnienia nadal mają znaczenie, gdy klasyfikacja może ostatecznie wywołać rzeczywiste działanie.
Tanie decyzje nie sprawiają, że złe sygnały stają się dobre
Wczesne dyskusje na temat Jev rozszerzyły się już na takie obszary jak automatyczne etykietowanie i handel. Oba pasują do interfejsu modelu decyzyjnego, ale nie sprawia to, że wszystkie związane z nimi twierdzenia są równie wiarygodne.
W przypadku etykietowania danych najsilniejszy projekt w najbliższym czasie niekoniecznie polega na zastąpieniu ludzkich adnotatorów. Przypadki o wysokim poziomie pewności można etykietować automatycznie, przykłady o średnim poziomie pewności mogą zostać poddane ocenie drugiego modelu, a niejednoznaczne rekordy nadal mogą trafiać do człowieka.
To zmienia przykłady, na których ludzie poświęcają czas, zamiast zakładać, że ludzie znikną z procesu.
Handel ma jeszcze wyraźniejsze ograniczenie. Wytworzenie kup, sprzedaj, lub trzymaj szybko łatwo przedstawić jako decyzję o określonych granicach. Trudniejszym problemem jest to, czy dane wejściowe zawierają rzeczywistą przewagę predykcyjną.
Jev może sprawić, że decyzja rynkowa będzie tania. Nie może sprawić, że słabe sygnały staną się predykcyjne.
To samo rozróżnienie dotyczy większości powyższych przykładów. Niskie opóźnienia i niski koszt wnioskowania pokazują, że warstwa decyzyjna jest wydajna. Same w sobie nie dowodzą jednak, że leżąca u podstaw ocena generuje wartość biznesową.
Gdzie Jev pasuje do lokalnego agenta AI
Sam Jev jest obecnie usługą hostowaną, a nie publicznie dostępnym punktem kontrolnym do samodzielnego hostowania. Tworzy to istotną granicę dla lokalnej AI.
Lokalny agent może przechowywać pliki, pamięć, funkcje wyszukiwania i narzędzia na domowym serwerze, ale jeśli treść dokumentu zostanie wysłana do Jev w celu klasyfikacji, te dane dowodowe przekroczą granicę sieci.
| Pozostaw lokalnie | Potencjalne dane wejściowe dla decyzji hostowanej |
|---|---|
| Pełna prywatna biblioteka dokumentów | Wybrane lub wyprowadzone dowody |
| Surowe pliki źródłowe | Minimalny stan zadania |
| Pamięć osobista | Niewrażliwy kontekst klasyfikacji |
| Dane uwierzytelniające i sekrety | Nie powinno być wymagane w przypadku zwykłej klasyfikacji |
Ta sama zasada ma zastosowanie podczas korzystania z narzędzi chmurowych z lokalnymi plikami: lokalne środowisko uruchomieniowe nie gwarantuje automatycznie lokalnego przepływu danych.
Lepszy projekt hybrydowy utrzymuje prywatne pobieranie danych, wstępne przetwarzanie, anonimizację i rutynowe operacje lokalne blisko danych, a następnie wysyła do hostowanego modelu decyzyjnego lub rozumującego tylko niezbędne minimum danych.
Co właściwie pokazują pierwsze wdrożenia Jev
Pierwsza fala eksperymentów z Jev nie pokazuje, że mały model decyzyjny może zastąpić przełomową sztuczną inteligencję.
Pokazuje to coś bardziej użytecznego: wiele aplikacji AI zużywa moc obliczeniową modeli generatywnych na zadania, które nie wymagają generowania.
W przeglądarkach, reklamach, potencjalnych klientach, grach, treściach, badaniach i orkiestracji agentów wciąż pojawia się ta sama struktura. Dane wejściowe są nieuporządkowane, ale możliwe wyniki są ograniczone. Ocena jest powtarzana, a niepewne przypadki można eskalować.
| Warstwa | Najlepsze zastosowanie |
|---|---|
| Reguły / kod | Deterministyczne decyzje |
| Model decyzyjny | Nieostre, ograniczone oceny |
| Model rozumujący | Trudne, niejednoznaczne problemy |
| Model generatywny | Twórz język, kod lub multimedia |
| Warstwa zasad | Określ, co faktycznie można wykonać |
Dlatego najbardziej użyteczne demonstracje Jev nie próbują udowodnić, że Jev potrafi zrobić wszystko.
To właśnie one pokazują, gdzie nie trzeba w ogóle angażować LLM ogólnego przeznaczenia.
Jev jest najbardziej przydatny tam, gdzie oprogramowanie musi podejmować tysiące nieostrych, ale ograniczonych decyzji - i prawie nie używać słów.
Najczęściej zadawane pytania dotyczące zastosowań Jev
Czy Jev może współpracować z OpenClaw?
Tak. OpenClaw obsługuje dedykowaną rolę modelu decyzyjnego oraz wtyczkę TypeSafe, która może używać Jev niezależnie od głównego modelu konwersacyjnego.
Czy Jev może sterować agentem przeglądarkowym?
Tak. Publiczne eksperymenty Browser Use wykorzystywały Jev do wybierania kolejnej czynności z ograniczonego zbioru działań DOM, podczas gdy modele generatywne obsługiwały w razie potrzeby otwarty tekst.
Czy Jev może analizować reklamy, posty lub duże zbiory danych?
Tak. Publiczne wdrożenia wykorzystywały Jev do klasyfikacji reklam, oceny treści, sortowania wiadomości e-mail, klasyfikacji artykułów naukowych i innych masowych, ustrukturyzowanych ocen. Większość opublikowanych danych dotyczących szybkości i kosztów pochodzi obecnie od twórców, a nie z niezależnych testów porównawczych.
Czy Jev może zastąpić ręczne etykietowanie danych?
Potencjalnie może automatyzować pewne ograniczone etykiety wymagające wysokiej pewności, ale obecne dane nie uzasadniają precyzyjnych twierdzeń o zastąpieniu określonego odsetka osób zajmujących się adnotacją. Bardziej realistycznym projektem jest eskalacja na podstawie poziomu pewności.
Czy Jev może działać lokalnie?
TypeSafe nie opublikował publicznych wag Jev do samodzielnego hostowania. Obecne integracje Jev korzystają z wnioskowania hostowanego, dlatego projekty prywatnych agentów powinny dokładnie kontrolować, jakie dowody są wysyłane poza lokalne środowisko.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

10 najlepszych asystentów programowania AI typu open source w 2026 roku
Porównaj 10 asystentów programowania AI typu open source do IDE, terminali, modeli lokalnych, samodzielnego hostingu, przepływów pracy Git i autonomicznego tworzenia oprogramowania.

Wyjaśnienie modelu Laya: otwartoźródłowy model decyzyjny, który możesz uruchomić lokalnie
Laya to otwarty model decyzyjny o 421 mln parametrów, przeznaczony do szybkiego lokalnego wyznaczania tras i oceniania, oferujący samodzielnie hostowaną alternatywę dla chmurowych interfejsów...

Dlaczego domowe systemy NVR z AI przechodzą w 2026 roku od wykrywania klatek do rozumienia zdarzeń?
Dowiedz się, jak ścieżki stają się zdarzeniami, dlaczego kontekst czasowy ogranicza powtarzające się alerty oraz w jakich sytuacjach sztuczna inteligencja analizująca obraz z uwzględnieniem...

