Exempel på användningsområden för Jev: 7 saker som människor redan bygger med TypeSafes beslutsmodell

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

Jev blir lättare att förstå när du slutar fråga vad den kan säga och börjar fråga vad programvara kan låta den besluta. Utvecklare använder redan TypeSafes beslutsmodell i agentstackar, webbläsarautomation, annonsanalys, lead scoring, spel, innehållsutvärdering och forskningssortering.

Mönstret är viktigare än varje enskild demonstration. Jev ersätter inte kod eller avancerade LLM-modeller. Tekniken riktar in sig på det luddiga mellanlagret: beslut som är för subjektiva för en enkel regel, för repetitiva för människor och för små för att motivera dyr generering varje gång. Se vår tidigare förklaring av beslutsmodeller för AI-agenter för den underliggande modellarkitekturen och dess begränsningar.

Vad kännetecknar ett bra användningsfall för Jev?

De starkaste offentliga Jev-byggena delar flera egenskaper: de giltiga utdata är kända före inferensen, samma bedömning görs upprepade gånger, svarstid spelar roll, fri text tillför föga värde och osäkra fall kan eskaleras någon annanstans.

Ett användbart test är enkelt: om du kan definiera det giltiga svarsutrymmet innan modellen körs kan en beslutsmodell vara värd att utvärdera.

Arbetsbelastning Bättre lämpad
Vilken agent ska hantera detta? Beslutsmodell
Vilken knapp ska webbläsaren klicka på? Beslutsmodell
Skriv det slutliga kundmejlet Generativ modell
Förklara en komplex forskningsartikel Generativ/reasoning-modell

Denna åtskillnad blir tydligare i de projekt som människor redan bygger.

1. OpenClaw: En dedikerad beslutsmodell i agentstacken

OpenClaw är en av de tydligaste signalerna på att Jev rör sig bortom experimentella demonstrationer. Den aktuella dokumentationen om beslutsmodellen skiljer den primära konversationsmodellen från en särskild roll för beslutsmodellen.

Det medföljande TypeSafe-pluginet låter utvecklare välja Jev separat från den huvudsakliga LLM-modellen. En större modell kan fortfarande planera, skriva kod, förklara och använda verktyg, medan Jev hanterar snävare frågor som vilken agent som ska ta emot en uppgift, huruvida bevis uppfyller ett villkor eller om ett arbetsflöde ska fortsätta.

Detta är ett viktigt arkitektoniskt skifte. I stället för att behandla varje tvetydigt steg som ännu en fråga till den huvudsakliga LLM-modellen kan en agent reservera en modell specifikt för avgränsade bedömningar.

OpenClaw bevarar också en viktig åtskillnad mellan att fatta beslut och att agera. Ett Jev-resultat kan ge belägg för att en åtgärd verkar lämplig, men bör inte automatiskt ge tillstånd att publicera innehåll, skicka ett meddelande eller ändra bestående tillstånd. Dessa åtgärder måste fortfarande passera en separat förtroendegräns för verktygskörning.

Det gör beslutsmodellen mindre lik en mindre chattbot och mer lik en annan infrastrukturkomponent bredvid den primära agentmodellen.

2. Webbläsaragenter: Välj nästa klick i stället för att beskriva sidan

Webbläsarautomatisering är naturligt beslutsintensiv. I många steg vet agenten redan vilka element som är tillgängliga och behöver bara välja nästa åtgärd.

Gregor Zunic publicerade ett Browser Use-experiment där webbläsaren tillhandahåller DOM-tillståndet, Jev väljer nästa åtgärd och en mindre generativ modell hanterar de fall som faktiskt kräver text. I den offentliga demon för flygsökning uppgav författaren en total tid på cirka 7 sekunder och en totalkostnad på 0,0039 USD. Detta är siffror som rapporterats av utvecklaren och inte ett oberoende riktmärke. Se exemplet Browser Use + Jev.

Webbläsararbete Bästa roll
Välj nästa klickbara element Jev
Bedöm om målet är uppnått Jev
Skriv ett öppet formulärsvar Generativ modell

Skillnaden är viktig eftersom en stor del av en webbläsarloop inte handlar om att be modellen skapa språk. I stället frågar man upprepade gånger vilken åtgärd som bäst för målet framåt.

Det tyder på en effektivare utformning av webbläsaragenter: använd generering när webbläsaren faktiskt behöver ny text, och använd avgränsade beslut när nästa steg redan kommer från en känd uppsättning åtgärder.

3. Annonsanalys: Poängsätt hela datamängden i stället för att ta ett urval

Matthew Berman uppgav att han använde Jev för att klassificera 724 aktiva annonser från 37 varumärken utifrån bland annat hook, format, erbjudande, CTA, medvetenhetsfas och avvikelse mellan annons och landningssida. Den rapporterade körningen tog cirka 40 sekunder och kostade ungefär 0,09 USD. Siffrorna är rapporterade av författaren och samlades in från det offentliga fallet med annonsanalys.

Den mer intressanta följden är vad som händer när förstahandsbedömningar blir tillräckligt billiga.

Kostsam analys Billigt beslutslager
Samla in 1 000 annonser Samla in 1 000 annonser
Ta ett urval på 50 Poängsätt alla 1 000
Härled mönster från urvalet Filtrera efter strukturerade signaler
Lägg experttid på bred front Granska ovanliga kluster eller kluster med högt värde

Analytiker tar ofta stickprov eftersom det är för dyrt att utvärdera varje post. Om en beslutsmodell billigt kan poängsätta varje annons utifrån samma dimensioner förändras arbetsflödet. I stället för att använda AI endast för att granska ett litet stickprov kan hela datamängden få en första klassificering innan en människa tittar på de mest intressanta klustren.

Det är en större förändring än att bara göra annonsanalys billigare: vissa samplingsproblem kan bli problem med uttömmande poängsättning.

4. Leadpoängsättning: Placera det billiga beslutet före den dyra genereringen

Ett liknande mönster syns vid leadpoängsättning. Romàn rapporterade att 700 leads bearbetades på ungefär 40 sekunder till en kostnad av cirka $0.09, där passform, konfidens och avvikelser poängsattes innan man avgjorde vilka poster som förtjänade djupare uppmärksamhet. Se det publicerade experimentet med leadpoängsättning.

Lager Jobb
Jev Filtrera, poängsätt, klassificera
Konfidensregel Avgör vad som behöver eskaleras
Stor LLM Generera personligt innehåll med högt värde

Det praktiska värdet kommer av att förändra var dyr generering sker. I stället för att be en kapabel LLM analysera och skriva personliga kontakter för varje post på djupet kan systemet först identifiera den lilla delmängd som verkar värdefull eller osäker.

Detta är en anledning till att en hybrid AI-kostnadsstrategi i allt högre grad bygger på routning. Kostnadsoptimering handlar inte bara om att hitta en billigare modell. Det handlar också om att avgöra vilka förfrågningar som över huvud taget behöver en dyr modell.

I den arkitekturen är Jev mest användbart som ett förfilter snarare än som det slutliga intelligenslagret.

5. Spel i realtid: Beslutsfrekvensen förändrar ekonomin

Spel i realtid kan verka som kuriosademon, men de visar varför latens spelar roll.

Max Blade publicerade ett Subway Surfers-experiment där Jev kördes i 50 spel samtidigt, och upphovspersonen rapporterade en total inferenskostnad på mindre än en cent. Siffrorna är självrapporterade i den offentliga speldemon.

Handlingsutrymmet är litet: flytta åt vänster, flytta åt höger, hoppa, huka dig eller fortsätt. Det finns liten nytta med att producera en detaljerad beskrivning på naturligt språk av varje bildruta innan man väljer en av dessa handlingar.

Detta introducerar ett användbart sätt att utvärdera beslutsmodeller: beslutsfrekvens.

Att spara några hundra millisekunder på en enda bedömning per dag har liten praktisk betydelse. Att spara in den latensen över många beslut per sekund, multiplicerat med dussintals parallella miljöer, förändrar både svarstiden och inferenskostnaden.

Det är därför snabba beslutsmodeller blir mer intressanta när samma avgränsade bedömning upprepas allt oftare.

6. Innehållspoängsättning: Ställ många frågor om samma utkast

SuperX visar en annan dimension av problemet. I stället för att fatta samma beslut mycket ofta ställer systemet många olika frågor om samma indata.

Det offentliga experimentet utvärderar ett inlägg i sociala medier utifrån 61 separata frågor. Författaren uppger cirka en sekund och 0,0004 dollar per utkast, med historiska inlägg som hjälp för att identifiera signaler som förknippas med bättre resultat. Dessa resultat är produktpåståenden från leverantören och inte oberoende riktmärken. Projektet finns i katalogen över användningsfall inom innehåll och tillväxt.

I stället för att ställa en vag fråga som ”Är detta ett bra inlägg?” kan applikationen bryta ner utkastet i mer uttryckliga bedömningar:

  • Är kroken specifik?
  • Finns det en nyfikenhetslucka?
  • Är påståendet konkret?
  • Låter texten överdrivet säljande?
  • Är CTA:n för påstridig?

Resultatet är inte ett enda ogenomskinligt AI-betyg. Det är en strukturerad profil som programvara kan använda för att identifiera vilken dimension som behöver skrivas om, jämföra två utkast eller avgöra om mänsklig granskning behövs.

Detta gör beslutsdimension till ytterligare en viktig variabel. En modell kan bli användbar inte bara eftersom samma bedömning görs ofta, utan också eftersom dussintals avgränsade bedömningar kan tillämpas billigt på samma tillstånd.

7. Forskningsklassificering: Gör en första gallring av allt och läs sedan det som är viktigt

Ett offentligt projekt kallat 1kpapers använde Jev för att klassificera 1 018 AI-forskningsartiklar. Publicerade siffror anger en total kostnad på cirka 0,08 dollar och en ungefärlig medianlatens på 256 ms från början till slut per artikel. Projektet finns listat i Made with Jevs webbplatskatalog.

Detta kan vara ett av de mer praktiska exemplen, eftersom många verkliga arbetsflöden börjar med för många poster: artiklar, e-postmeddelanden, supportärenden, recensioner, dokument, loggar eller sökfrågor.

Det dyra är ofta inte att förstå ett enskilt objekt. Det är att avgöra vilka objekt som förtjänar mer djupgående uppmärksamhet.

Första genomgången Andra genomgången
Klassificera ämne Läs utvalda dokument på djupet
Bedöm relevans Skicka värdefulla poster till en större modell
Upptäck uppenbar avvikelse En människa granskar tvetydiga fall
Uppskatta konfidens Eskalera osäkra poster

Detta blir särskilt användbart när källdata är privat. En privat AI-assistent kan hålla hämtning och det råa dokumentbiblioteket lokalt, medan endast utvalda eller härledda belägg skickas till en extern tjänst vid behov.

Modellen behöver inte ersätta djup läsning. Dess roll är att göra den djupa läsningen selektiv.

Det verkliga mönstret: beslutstäthet

De sju exemplen verkar orelaterade, men strukturellt liknar de varandra mycket. Alla börjar med ett rörigt tillstånd och ställer upprepade gånger frågor vars svar redan är begränsade.

Ett användbart sätt att beskriva detta är beslutstäthet: hur många avgränsade bedömningar ett system behöver göra för en given arbetsbelastning.

Två faktorer är viktigast:

  • frekvens: hur ofta applikationen behöver göra en bedömning;
  • dimensionalitet: hur många bedömningar den behöver göra av varje tillstånd.
Arbetsbelastning Beslutstäthet Jev-passform
En ja/nej-kontroll per dag Låg Svag fördel
Klassificera 1 000 e-postmeddelanden Hög frekvens Stark
61 frågor per utkast Hög dimensionalitet Stark
Webbläsaråtgärd i varje steg Hög frekvens Stark
Många parallella spel Mycket hög frekvens Mycket stark strukturell passform
Skriv en detaljerad rapport Genereringsintensivt Dålig passform

Ett enda binärt beslut motiverar sannolikt inte en omdesign av en AI-stack. Tusentals diffusa beslut, eller dussintals bedömningar av varje indata, är ett annat problem.

Ju högre beslutstäthet, desto mer attraktiv blir ett specialiserat beslutslager.

Den starkaste arkitekturen kan vara Jev först, större modell sedan

Beslutsmodeller behöver inte heller lösa varje fall. Konfidensnivån kan avgöra när en mer kapabel modell ska ta över.

Ett offentligt experiment med bedrägeridetektering illustrerar detta mönster. Skaparen använde först Jev på 100 e-postmeddelanden och skickade sedan förutsägelser under en konfidensgräns på 95 % till den större modellen Kimi K3. Författaren rapporterade 31 eskaleringar, en slutlig träffsäkerhet på 96/100 och en total kostnad på ungefär 0,07 dollar. Dessa siffror är fortfarande experimentella och självrapporterade; fallet finns med i Jevs teknikkatalog.

Steg Syfte
Billig beslutsmodell Hantera uppenbara fall
Konfidensgräns Upptäck osäkerhet
Stor resonemangsmodell Hantera svåra fall
Policy- / människolager Behåll auktoriteten där fel spelar roll

Den här arkitekturen är mer intressant än att försöka maximera Jevs fristående träffsäkerhet. En billigare modell kan hantera den enkla majoriteten medan en dyrare modell bara får ta emot den tvetydiga återstoden.

Även då bör säkerhet inte automatiskt bli auktoritet. skrivskyddade agentverktyg och avgränsade behörigheter är fortfarande viktiga när en klassificering så småningom kan utlösa en handling i verkligheten.

Billiga beslut gör inte dåliga signaler bra

De tidiga diskussionerna om Jev har redan utvidgats till områden som automatisk märkning och handel. Båda passar gränssnittet för beslutsmodeller, men det gör inte alla påståenden kring dem lika trovärdiga.

För datamärkning är den starkaste utformningen på kort sikt inte nödvändigtvis att ersätta mänskliga annoterare. Fall med hög säkerhet kan märkas automatiskt, exempel med medelhög säkerhet kan granskas av en andra modell och tvetydiga poster kan fortfarande gå till en människa.

Det ändrar vilka exempel människor lägger tid på, snarare än att man antar att människor försvinner ur arbetsflödet.

Handel har en ännu tydligare begränsning. Att producera köp, sälj, eller behåll Att snabbt göra detta är lätt att formulera som ett avgränsat beslut. Det svåra problemet är om indata innehåller en verklig prediktiv fördel.

Jev kan göra ett marknadsbeslut billigt. Det kan inte göra svaga signaler prediktiva.

Samma åtskillnad gäller för de flesta av exemplen ovan. Låg latens och låg inferenskostnad visar att ett besluts­lager är effektivt. De bevisar däremot inte i sig att den underliggande bedömningen skapar affärsvärde.

Var Jev passar in i en lokal AI-agent

Jev är för närvarande en värdbaserad tjänst snarare än en offentlig, självhostad kontrollpunkt. Det skapar en viktig gräns för lokal AI.

En lokal agent kan behålla filer, minne, sökning och verktyg på en hemmaserver, men om dokumentinnehåll skickas till Jev för klassificering har dessa belägg passerat nätverksgränsen.

Behåll lokalt Möjlig indata för värdbaserade beslut
Fullständigt privat dokumentbibliotek Utvalda eller härledda belägg
Råa källfiler Minimalt uppgiftstillstånd
Personligt minne Icke-känslig klassificeringskontext
Inloggningsuppgifter och hemligheter Bör inte krävas för vanlig klassificering

Samma princip gäller när man använder molnverktyg med lokala filer: en lokal körmiljö garanterar inte automatiskt en lokal datasökväg.

En starkare hybriddesign håller privat hämtning, förbearbetning, maskning och rutinmässiga lokala åtgärder nära datan och skickar sedan endast den minsta nödvändiga evidensen till den värdbaserade besluts- eller resonemangsmodellen.

Vad de första Jev-byggena faktiskt visar

Den första vågen av Jev-experiment visar inte att en liten beslutsmodell kan ersätta ledande AI.

Det visar något mer användbart: många AI-applikationer använder beräkningskraft från generativa modeller för uppgifter som inte kräver generering.

I webbläsare, annonser, leads, spel, innehåll, forskning och agentorkestrering återkommer samma struktur. Indatan är rörig, men de möjliga utfallen är begränsade. Bedömningen görs upprepade gånger, och osäkra fall kan eskaleras.

Lager Bästa uppgift
Regler / kod Deterministiska beslut
Beslutsmodell Vaga, avgränsade bedömningar
Resonemangsmodell Svåra tvetydiga problem
Generativ modell Skapa språk, kod eller media
Policy-lager Avgör vad som faktiskt får köras

De mest användbara Jev-demonstrationerna är därför inte de som försöker bevisa att Jev kan göra allt.

Det är de som visar var en allmän LLM inte behöver vara involverad alls.

Jev blir mest användbart där programvara behöver fatta tusentals vaga men avgränsade beslut - och nästan inga ord.

Vanliga frågor om användningsområden för Jev

Kan Jev fungera med OpenClaw?

Ja. OpenClaw stöder en dedikerad roll för beslutsmodellen och ett TypeSafe-plugin som kan använda Jev separat från den primära konversationsmodellen.

Kan Jev styra en webbläsaragent?

Ja. Offentliga Browser Use-experiment har använt Jev för att välja nästa åtgärd från ett avgränsat DOM-åtgärdsutrymme, medan generativa modeller hanterar öppna texter vid behov.

Kan Jev analysera annonser, inlägg eller stora dataset?

Ja. Offentliga byggen har använt Jev för annonsklassificering, innehållspoängsättning, e-posttriage, klassificering av forskningsartiklar och andra storskaliga strukturerade bedömningar. De flesta publicerade siffror för hastighet och kostnad kommer för närvarande från utvecklarna själva snarare än från oberoende benchmarktester.

Kan Jev ersätta mänsklig datamärkning?

Det kan potentiellt automatisera säkra, avgränsade etiketter, men nuvarande evidens stödjer inte precisa påståenden om att ersätta en viss andel mänskliga annotatörer. En design med eskalering baserad på konfidens är mer realistisk.

Kan Jev köras lokalt?

TypeSafe har inte släppt offentliga Jev-vikter för självvärdskap. Nuvarande Jev-integrationer använder värdbaserad inferens, så privata agentdesigner bör ha exakt kontroll över vilken evidens som skickas utanför den lokala miljön.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.