Jev devient plus facile à comprendre lorsqu’on cesse de demander ce qu’il peut dire et qu’on commence à se demander ce que les logiciels peuvent lui laisser décider. Les développeurs utilisent déjà le modèle de décision de TypeSafe dans des piles d’agents, l’automatisation de navigateurs, l’analyse publicitaire, l’évaluation de prospects, les jeux, l’évaluation de contenu et le triage de recherches.
Le schéma compte davantage que toute démonstration particulière. Jev ne remplace ni le code ni les LLM de pointe. Il cible la couche intermédiaire floue : des décisions trop subjectives pour une règle simple, trop répétitives pour être prises par des humains et trop limitées pour justifier une génération coûteuse à chaque fois. Pour en savoir plus sur l’architecture et les limites du modèle sous-jacent, consultez notre explication précédente sur les modèles de décision pour les agents d’IA.
Qu’est-ce qui fait un bon cas d’utilisation de Jev ?
Les implémentations publiques de Jev les plus convaincantes partagent plusieurs caractéristiques : les sorties valides sont connues avant l’inférence, le même jugement est répété, la latence est importante, le texte libre apporte peu de valeur et les cas incertains peuvent être transmis ailleurs.
Un test simple peut être utile : si vous pouvez définir l’espace des réponses valides avant l’exécution du modèle, il peut être pertinent d’évaluer un modèle de décision.
| Charge de travail | Meilleure adéquation |
|---|---|
| Quel agent doit s’en charger ? | Modèle décisionnel |
| Quel bouton le navigateur doit-il cliquer ? | Modèle décisionnel |
| Rédiger l’e-mail final destiné au client | Modèle génératif |
| Expliquer un article de recherche complexe | Modèle génératif / de raisonnement |
Cette distinction apparaît plus clairement dans les projets que les utilisateurs construisent déjà.
1. OpenClaw : un modèle de décision dédié au sein de la pile d’agents
OpenClaw est l’un des signes les plus nets que Jev dépasse le stade des démonstrations expérimentales. Sa documentation actuelle sur les modèles de décision distingue le modèle conversationnel principal d’un rôle dédié de modèle de décision.
Le plugin TypeSafe fourni permet aux développeurs de sélectionner Jev indépendamment du LLM principal. Un modèle plus puissant peut toujours planifier, coder, expliquer et utiliser des outils, tandis que Jev traite des questions plus ciblées, comme déterminer quel agent doit recevoir une tâche, vérifier si les éléments probants satisfont une condition ou décider si un flux de travail doit continuer.
Il s’agit d’un changement architectural important. Au lieu de traiter chaque étape ambiguë comme une nouvelle invite adressée au LLM principal, un agent peut réserver un modèle spécifique aux jugements circonscrits.
OpenClaw préserve également une séparation importante entre la décision et l’action. Un résultat de Jev peut fournir des éléments indiquant qu’une action semble appropriée, mais il ne devrait pas automatiquement autoriser la publication de contenu, l’envoi d’un message ou la modification d’un état persistant. Ces actions doivent toujours franchir une limite de confiance distincte pour l’exécution des outils.
Le modèle de décision ressemble ainsi moins à un chatbot plus petit qu’à un autre composant d’infrastructure aux côtés du modèle principal de l’agent.
2. Agents de navigation : choisir le prochain clic plutôt que décrire la page
L’automatisation des navigateurs repose naturellement largement sur la prise de décision. À de nombreuses étapes, l’agent sait déjà quels éléments sont disponibles et doit seulement choisir l’action suivante.
Gregor Zunic a publié une expérience avec Browser Use dans laquelle le navigateur fournit l’état du DOM, Jev sélectionne l’action suivante et un modèle génératif plus petit prend en charge les cas qui nécessitent réellement du texte. Dans la démonstration publique de recherche de vols, l’auteur a indiqué un temps d’exécution d’environ 7 secondes et un coût total de 0,0039 $. Il s’agit de chiffres communiqués par le créateur, et non d’un benchmark indépendant. Voir l’exemple Browser Use + Jev.
| Tâches dans le navigateur | Rôle principal |
|---|---|
| Sélectionner le prochain élément cliquable | Jev |
| Déterminer si l’objectif est atteint | Jev |
| Rédiger une réponse à un formulaire ouvert | Modèle génératif |
Cette distinction est importante, car une grande partie de la boucle de navigation ne consiste pas à demander au modèle de créer du langage. Il s’agit plutôt de lui demander à répétition quelle action fait le mieux progresser l’objectif actuel.
Cela suggère une conception plus efficace des agents de navigation : utiliser la génération lorsque le navigateur a réellement besoin d’un nouveau texte, et utiliser des décisions délimitées lorsque l’étape suivante provient déjà d’un ensemble d’actions connu.
3. Analyse publicitaire : évaluer l’ensemble des données plutôt que de l’échantillonner
Matthew Berman a indiqué avoir utilisé Jev pour classifier 724 publicités diffusées provenant de 37 marques selon plusieurs dimensions, notamment l’accroche, le format, l’offre, l’appel à l’action, le niveau de sensibilisation et l’inadéquation avec la page d’atterrissage. Selon ses déclarations, l’exécution a pris environ 40 secondes et coûté approximativement 0,09 $. Ces chiffres ont été communiqués par l’auteur et recueillis dans le cas public d’analyse publicitaire.
La conséquence la plus intéressante est ce qui se produit lorsque les jugements de première passe deviennent suffisamment peu coûteux.
| Analyse coûteuse | Couche de décision économique |
|---|---|
| Collecter 1 000 publicités | Collecter 1 000 publicités |
| Échantillonner 50 | Évaluer les 1 000 |
| Déduire les tendances à partir de l’échantillon | Filtrer selon des signaux structurés |
| Consacrer largement du temps d’expertise | Examiner les groupes inhabituels ou à forte valeur |
Les analystes utilisent souvent un échantillon parce qu’évaluer chaque enregistrement coûte trop cher. Si un modèle décisionnel peut évaluer à moindre coût chaque publicité selon les mêmes dimensions, le flux de travail change. Au lieu d’utiliser l’IA uniquement pour examiner un petit échantillon, l’ensemble des données peut recevoir une première classification avant qu’un humain n’examine les groupes les plus intéressants.
Il s’agit d’un changement plus important que le simple fait de réduire le coût de l’analyse des publicités : certains problèmes d’échantillonnage peuvent devenir des problèmes d’évaluation exhaustive.
4. Qualification des prospects : prendre la décision peu coûteuse avant la génération coûteuse
Un schéma similaire apparaît dans la qualification des prospects. Romàn a indiqué avoir traité 700 prospects en environ 40 secondes pour près de 0,09 $, en évaluant l’adéquation, le niveau de confiance et les incompatibilités avant de déterminer quels enregistrements méritaient une analyse plus approfondie. Consultez l’expérience publiée de qualification des prospects.
| Couche | Tâche |
|---|---|
| Jev | Filtrer, noter, classer |
| Règle de confiance | Décider ce qui nécessite une escalade |
| LLM de grande taille | Générer un résultat personnalisé à forte valeur |
La valeur pratique vient du fait de déplacer l’endroit où s’effectue la génération coûteuse. Au lieu de demander à un LLM performant d’analyser en profondeur et de rédiger un message de prospection personnalisé pour chaque fiche, le système peut d’abord identifier le petit sous-ensemble qui semble intéressant ou incertain.
C’est l’une des raisons pour lesquelles la stratégie de coût de l’IA hybride dépend de plus en plus du routage. L’optimisation des coûts ne consiste pas seulement à trouver un modèle moins cher. Il s’agit aussi de déterminer quelles requêtes nécessitent réellement un modèle coûteux.
Dans cette architecture, Jev est surtout utile comme préfiltre plutôt que comme couche d’intelligence finale.
5. Jeux en temps réel : la fréquence des décisions modifie l’économie
Les jeux en temps réel ressemblent à des démonstrations originales, mais ils montrent pourquoi la latence est importante.
Max Blade a publié une expérience Subway Surfers exécutant Jev sur 50 parties simultanément, l’auteur indiquant un coût total d’inférence inférieur à un centime. Ces chiffres sont déclarés par l’auteur dans la démo publique du jeu.
L’espace d’action est restreint : aller à gauche, aller à droite, sauter, s’accroupir ou continuer. Il est peu utile de produire une description détaillée en langage naturel de chaque image avant de choisir l’une de ces actions.
Cela introduit une manière utile d’évaluer les modèles de décision : la fréquence des décisions.
Économiser quelques centaines de millisecondes sur un seul jugement par jour a peu de valeur pratique. Réduire cette latence sur de nombreuses décisions par seconde, multipliées sur des dizaines d’environnements parallèles, modifie à la fois le temps de réponse et le coût d’inférence.
C’est pourquoi les modèles de décision rapides deviennent plus intéressants lorsque le même jugement délimité est répété plus fréquemment.
6. Évaluation du contenu : poser de nombreuses questions sur le même brouillon
SuperX illustre une autre dimension du problème. Au lieu de prendre très fréquemment la même décision, le système pose de nombreuses questions différentes sur la même entrée.
L’expérience publique évalue une publication sur les réseaux sociaux à l’aide de 61 questions distinctes. L’auteur indique environ une seconde et 0,0004 $ par brouillon, en utilisant des publications historiques pour aider à identifier les signaux associés à de meilleures performances. Ces résultats sont des affirmations du fabricant du produit et non des benchmarks indépendants. Le projet apparaît dans l’répertoire des cas d’usage liés au contenu et à la croissance.
Au lieu de poser une question vague telle que « Est-ce une bonne publication ? », l’application peut décomposer le brouillon en jugements plus explicites :
- L’accroche est-elle précise ?
- Y a-t-il une lacune qui suscite la curiosité ?
- L’affirmation est-elle concrète ?
- Le texte semble-t-il trop promotionnel ?
- L’appel à l’action est-il trop agressif ?
Le résultat n’est pas un score d’IA opaque. C’est un profil structuré que les logiciels peuvent utiliser pour déterminer quelle dimension doit être réécrite, comparer deux brouillons ou décider si une vérification humaine est nécessaire.
Cela fait de la dimensionnalité des décisions une autre variable importante. Un modèle peut devenir utile non seulement parce que le même jugement est effectué souvent, mais aussi parce que des dizaines de jugements délimités peuvent être appliqués à moindre coût au même état.
7. Classification de la recherche : trier tout, puis lire ce qui compte
Un projet public appelé 1kpapers a utilisé Jev pour classer 1 018 articles de recherche en IA. Les chiffres publiés font état d’un coût total d’environ 0,08 $ et d’une latence médiane de bout en bout d’environ 256 ms par article. Le projet figure dans l’annuaire des sites Made with Jev.
Il peut s’agir de l’un des exemples les plus pratiques, car de nombreux flux de travail réels commencent avec trop de données : articles, e-mails, tickets d’assistance, avis, documents, journaux ou requêtes de recherche.
La partie coûteuse ne consiste souvent pas à comprendre un seul élément. Il s’agit de décider quels éléments méritent une attention plus approfondie.
| Premier passage | Deuxième passage |
|---|---|
| Classer le sujet | Lire les documents sélectionnés en profondeur |
| Évaluer la pertinence | Envoyer les dossiers à forte valeur à un modèle plus grand |
| Détecter les incohérences évidentes | Un humain examine les cas ambigus |
| Estimer le niveau de confiance | Faire remonter les dossiers incertains |
Cela devient particulièrement utile lorsque les données sources sont privées. Un assistant IA privé peut conserver localement la récupération et la bibliothèque de documents bruts, tandis que seules les données sélectionnées ou les informations dérivées sont envoyées à un service externe lorsque cela est nécessaire.
Le modèle n’a pas besoin de remplacer une lecture approfondie. Son rôle est de rendre cette lecture approfondie sélective.
Le véritable schéma : la densité décisionnelle
Les sept exemples semblent sans rapport, mais ils sont très similaires sur le plan structurel. Chacun part d’un état désordonné et pose de manière répétée des questions dont l’espace des réponses est déjà limité.
On peut décrire cela utilement par la densité décisionnelle : le nombre de jugements circonscrits qu’un système doit porter sur une charge de travail donnée.
Deux facteurs sont particulièrement importants :
- fréquence : la fréquence à laquelle l’application doit porter un jugement ;
- dimensionnalité : le nombre de jugements nécessaires sur chaque état.
| Charge de travail | Densité décisionnelle | Adéquation de Jev |
|---|---|---|
| Une vérification oui/non par jour | Faible | Avantage limité |
| Classer 1 000 e-mails | Haute fréquence | Forte |
| 61 questions par brouillon | Grande dimensionnalité | Forte |
| Action dans le navigateur à chaque étape | Haute fréquence | Forte |
| Nombreuses parties en parallèle | Très haute fréquence | Très bonne adéquation structurelle |
| Rédiger un rapport détaillé | Axé sur la génération | Mauvaise adéquation |
Une seule décision binaire justifie rarement de repenser une pile d’IA. Des milliers de décisions nuancées, ou des dizaines de jugements pour chaque entrée, constituent un problème différent.
Plus la densité décisionnelle est élevée, plus une couche de décision spécialisée devient intéressante.
L’architecture la plus performante pourrait être : Jev d’abord, modèle plus grand ensuite
Les modèles de décision n’ont pas non plus besoin de résoudre tous les cas. Le niveau de confiance peut déterminer à quel moment un modèle plus performant doit prendre le relais.
Une expérience publique de détection des fraudes illustre ce schéma. Le concepteur a d’abord utilisé Jev sur 100 e-mails, puis a redirigé les prédictions dont le niveau de confiance était inférieur à 95 % vers le modèle Kimi K3, plus puissant. L’auteur a indiqué 31 escalades, une précision finale de 96/100 et un coût total d’environ 0,07 $. Ces chiffres restent expérimentaux et sont autodéclarés ; le cas figure dans l’annuaire d’ingénierie Jev.
| Étape | Objectif |
|---|---|
| Modèle de décision économique | Traiter les cas évidents |
| Seuil de confiance | Détecter l’incertitude |
| Grand modèle de raisonnement | Traiter les cas difficiles |
| Couche de politique / humaine | Conserver l’autorité là où les erreurs sont importantes |
Cette architecture est plus intéressante que de chercher à maximiser la précision de Jev en autonomie. Un modèle moins coûteux peut traiter la majorité des cas simples, tandis qu’un modèle plus coûteux ne reçoit que les cas ambigus.
Même dans ce cas, la confiance ne devrait pas automatiquement devenir une autorité. Les outils d’agent en lecture seule et les autorisations limitées restent importants lorsqu’une classification peut finalement déclencher une action dans le monde réel.
Des décisions peu coûteuses ne rendent pas bons de mauvais signaux
Les premières discussions autour de Jev se sont déjà étendues à des domaines tels que l’étiquetage automatisé et le trading. Tous deux s’intègrent à l’interface d’un modèle décisionnel, mais cela ne rend pas pour autant toutes les affirmations les concernant également crédibles.
Pour l’étiquetage des données, la meilleure conception à court terme ne consiste pas nécessairement à remplacer les annotateurs humains. Les cas présentant un haut niveau de confiance peuvent être étiquetés automatiquement, les exemples de confiance moyenne peuvent faire l’objet d’un examen par un second modèle, et les enregistrements ambigus peuvent toujours être transmis à un humain.
Cela modifie les exemples auxquels les humains consacrent du temps, plutôt que de supposer que les humains disparaissent du flux de travail.
Le trading présente une limite encore plus claire. Produire acheter, vendre, ou conserver Formuler rapidement comme une décision encadrée est facile. Le problème difficile est de déterminer si les données d’entrée contiennent un véritable avantage prédictif.
Jev peut rendre une décision de marché peu coûteuse. Il ne peut pas rendre prédictifs des signaux faibles.
La même distinction s’applique à la plupart des exemples ci-dessus. Une faible latence et un faible coût d’inférence montrent qu’une couche décisionnelle est efficace. Mais, à eux seuls, ils ne prouvent pas que le jugement sous-jacent crée de la valeur pour l’entreprise.
Où Jev s’intègre dans un agent d’IA local
Jev est actuellement un service hébergé plutôt qu’un point de contrôle public auto-hébergé. Cela crée une frontière importante pour l’IA locale.
Un agent local peut conserver les fichiers, la mémoire, la récupération et les outils sur un serveur domestique, mais si le contenu des documents est envoyé à Jev pour classification, ces éléments probants ont franchi la frontière réseau.
| Conserver en local | Entrée potentielle pour une décision hébergée |
|---|---|
| Bibliothèque complète de documents privés | Éléments probants sélectionnés ou dérivés |
| Fichiers sources bruts | État minimal de la tâche |
| Mémoire personnelle | Contexte de classification non sensible |
| Identifiants et secrets | Ne devrait pas être requis pour une classification ordinaire |
Le même principe s’applique lorsque vous utilisez des outils cloud avec des fichiers locaux : un environnement d’exécution local ne garantit pas automatiquement un chemin de données local.
Une conception hybride plus robuste conserve à proximité des données la récupération privée, le prétraitement, la rédaction et les opérations locales courantes, puis n'envoie au modèle décisionnel ou de raisonnement hébergé que les éléments minimaux nécessaires.
Ce que nous apprennent réellement les premières versions de Jev
La première vague d'expérimentations avec Jev ne montre pas qu'un petit modèle décisionnel puisse remplacer l'IA de pointe.
Cela révèle quelque chose de plus utile : de nombreuses applications d'IA consacrent des ressources de calcul de modèles génératifs à des tâches qui ne nécessitent pas de génération.
Dans les navigateurs, les publicités, les prospects, les jeux, le contenu, la recherche et l'orchestration des agents, la même structure revient constamment. Les données d'entrée sont désordonnées, mais les résultats possibles sont limités. L'évaluation est répétée et les cas incertains peuvent être transmis à un niveau supérieur.
| Couche | Mission principale |
|---|---|
| Règles / code | Décisions déterministes |
| Modèle décisionnel | Évaluations floues et encadrées |
| Modèle de raisonnement | Problèmes ambigus et difficiles |
| Modèle génératif | Créer du texte, du code ou des médias |
| Couche de politique | Déterminer ce qui est réellement autorisé à s'exécuter |
Les démonstrations de Jev les plus utiles ne sont donc pas celles qui cherchent à prouver que Jev peut tout faire.
Ce sont elles qui montrent le mieux qu'un LLM généraliste n'a pas besoin d'intervenir.
Jev devient particulièrement utile lorsque les logiciels doivent prendre des milliers de décisions floues mais encadrées, avec presque aucun texte à produire.
Questions fréquemment posées sur les cas d'utilisation de Jev
Jev peut-il fonctionner avec OpenClaw ?
Oui. OpenClaw prend en charge un rôle dédié de modèle décisionnel ainsi qu'un plug-in TypeSafe capable d'utiliser Jev séparément du modèle conversationnel principal.
Jev peut-il contrôler un agent de navigation ?
Oui. Des expérimentations publiques de Browser Use ont utilisé Jev pour sélectionner l'action suivante dans un espace d'actions DOM limité, tandis que des modèles génératifs prennent en charge le texte ouvert lorsque cela est nécessaire.
Jev peut-il analyser des publicités, des publications ou de grands ensembles de données ?
Oui. Des versions publiques ont utilisé Jev pour la classification des publicités, l'évaluation de contenu, le tri des e-mails, la classification d'articles de recherche et d'autres évaluations structurées à grande échelle. La plupart des chiffres publiés sur la vitesse et les coûts sont actuellement communiqués par les concepteurs plutôt qu'établis par des évaluations indépendantes.
Jev peut-il remplacer l'annotation humaine des données ?
Il pourrait potentiellement automatiser des étiquettes fiables et encadrées, mais les éléments disponibles ne permettent pas actuellement d'affirmer précisément qu'il remplacerait un pourcentage donné d'annotateurs humains. Une escalade fondée sur le niveau de confiance est une conception plus réaliste.
Jev peut-il fonctionner localement ?
TypeSafe n'a pas publié de poids Jev utilisables publiquement pour l'auto-hébergement. Les intégrations Jev actuelles utilisent l'inférence hébergée ; les architectures d'agents privés doivent donc contrôler précisément les éléments envoyés en dehors de l'environnement local.
Centre Tech & IA
Plus à lire

Top 10 des assistants de programmation IA open source en 2026
Comparez 10 assistants de codage IA open source pour les IDE, les terminaux, les modèles locaux, l’auto-hébergement, les workflows Git et le développement autonome.

Modèle Laya expliqué : le modèle décisionnel open source que vous pouvez exécuter localement
Laya est un modèle de décision ouvert de 421 M de paramètres, conçu pour le routage et la notation locaux rapides, offrant une alternative...

Pourquoi l’IA des NVR domestiques passe-t-elle de la détection par image à la compréhension des événements en 2026 ?
Comprenez comment les trajectoires deviennent des événements, pourquoi le contexte temporel réduit les alertes répétitives et où l’IA vidéo sensible aux événements échoue encore.

