Casos de utilização do Jev: 7 coisas que as pessoas já estão a construir com o modelo de decisão da TypeSafe

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

O Jev torna-se mais fácil de compreender quando deixa de perguntar o que ele pode dizer e começa a perguntar o que o software pode deixá-lo decidir. Os programadores já estão a utilizar o modelo de decisão do TypeSafe em pilhas de agentes, automação de navegadores, análise de anúncios, classificação de potenciais clientes, jogos, avaliação de conteúdos e triagem de investigação.

O padrão é mais importante do que qualquer demonstração individual. O Jev não está a substituir o código nem os LLM de fronteira. Está direcionado para a camada intermédia e difusa: decisões demasiado subjetivas para uma regra simples, demasiado repetitivas para os humanos e demasiado pequenas para justificarem uma geração dispendiosa de cada vez. Para consultar a arquitetura e as limitações do modelo subjacente, veja a nossa explicação anterior sobre modelos de decisão para agentes de IA.

O que torna um caso de utilização adequado para o Jev?

As implementações públicas mais fortes do Jev partilham várias características: os resultados válidos são conhecidos antes da inferência, o mesmo julgamento é repetido várias vezes, a latência é importante, o texto livre acrescenta pouco valor e os casos incertos podem ser encaminhados para outro local.

Um teste útil é simples: se conseguir definir o espaço de respostas válidas antes de o modelo ser executado, pode valer a pena avaliar um modelo de decisão.

Carga de trabalho Melhor opção
Que agente deve tratar disto? Modelo de decisão
Em que botão deve o navegador clicar? Modelo de decisão
Escrever o e-mail final para o cliente Modelo generativo
Explicar um artigo de investigação complexo Modelo generativo / de raciocínio

Esta distinção torna-se mais clara nos projetos que as pessoas já estão a desenvolver.

1. OpenClaw: Um modelo de decisão dedicado na pilha do agente

O OpenClaw é um dos sinais mais fortes de que o Jev está a ir além das demonstrações experimentais. A sua atual documentação sobre modelos de decisão separa o modelo conversacional principal da função dedicada de modelo de decisão.

O plugin TypeSafe incluído permite aos programadores selecionar o Jev independentemente do LLM principal. Um modelo maior pode continuar a planear, programar, explicar e utilizar ferramentas, enquanto o Jev trata de questões mais específicas, como decidir que agente deve receber uma tarefa, se as provas satisfazem uma condição ou se um fluxo de trabalho deve continuar.

Esta é uma mudança arquitetural importante. Em vez de tratarem cada passo ambíguo como mais um pedido ao LLM principal, os agentes podem reservar um modelo especificamente para avaliações delimitadas.

O OpenClaw também preserva uma separação importante entre decidir e agir. Um resultado do Jev pode fornecer evidências de que uma ação parece apropriada, mas não deve conceder automaticamente autorização para publicar conteúdo, enviar uma mensagem ou alterar um estado persistente. Essas ações continuam a ter de atravessar um limite de confiança separado na execução de ferramentas.

Isso faz com que o modelo de decisão se pareça menos com um chatbot mais pequeno e mais com outro componente de infraestrutura ao lado do modelo de agente principal.

2. Agentes de navegador: escolher o próximo clique em vez de descrever a página

A automatização de navegadores é naturalmente centrada em decisões. Em muitos passos, o agente já sabe quais os elementos disponíveis e só precisa de escolher a ação seguinte.

Gregor Zunic publicou uma experiência com o Browser Use em que o navegador fornece o estado do DOM, o Jev seleciona a ação seguinte e um modelo generativo mais pequeno trata dos casos que requerem efetivamente texto. Na demonstração pública de pesquisa de voos, o autor indicou um tempo total de cerca de 7 segundos e um custo total de 0,0039 $. Estes valores foram comunicados pelo criador, não constituindo uma avaliação independente. Consulte o exemplo de Browser Use + Jev.

Trabalho no navegador Melhor função
Selecionar o próximo elemento clicável Jev
Avaliar se o objetivo foi atingido Jev
Escrever uma resposta de formulário aberta Modelo generativo

A distinção é importante porque grande parte do ciclo do navegador não consiste em pedir ao modelo que crie linguagem. Consiste em perguntar repetidamente qual a ação que melhor faz avançar o objetivo atual.

Isto sugere um design mais eficiente para agentes de navegador: usar geração quando o navegador precisa realmente de texto novo e usar decisões limitadas quando o passo seguinte já provém de um conjunto conhecido de ações.

3. Análise de anúncios: classificar todo o conjunto de dados em vez de o amostrar

Matthew Berman afirmou ter usado Jev para classificar 724 anúncios ativos de 37 marcas segundo dimensões que incluíam o gancho, o formato, a oferta, o CTA, a fase de consciencialização e a discrepância com a página de destino. Segundo o autor, a execução demorou cerca de 40 segundos e custou aproximadamente 0,09 $. Os valores foram comunicados pelo autor e recolhidos no caso público de análise de anúncios.

A consequência mais interessante é o que acontece quando os juízos iniciais se tornam suficientemente baratos.

Análise dispendiosa Camada de decisão económica
Recolher 1 000 anúncios Recolher 1 000 anúncios
Amostra de 50 Classificar as 1 000
Inferir padrões a partir da amostra Filtrar por sinais estruturados
Dedicar tempo especializado de forma abrangente Inspecionar grupos invulgares ou de elevado valor

Os analistas recorrem frequentemente a amostras porque avaliar cada registo é demasiado dispendioso. Se um modelo de decisão puder pontuar economicamente todos os anúncios segundo as mesmas dimensões, o fluxo de trabalho muda. Em vez de utilizar a IA apenas para inspecionar uma pequena amostra, o conjunto de dados completo pode receber uma classificação inicial antes de uma pessoa analisar os grupos mais interessantes.

Esta é uma mudança maior do que simplesmente tornar a análise de anúncios mais barata: alguns problemas de amostragem podem transformar-se em problemas de pontuação exaustiva.

4. Pontuação de potenciais clientes: coloque a decisão barata antes da geração dispendiosa

Um padrão semelhante surge na pontuação de potenciais clientes. Romàn comunicou o processamento de 700 potenciais clientes em cerca de 40 segundos, por aproximadamente 0,09 $, avaliando a adequação, a confiança e a incompatibilidade antes de decidir quais os registos que mereciam uma análise mais aprofundada. Consulte a experiência publicada de pontuação de potenciais clientes.

Camada Tarefa
Jev Filtrar, pontuar, classificar
Regra de confiança Decidir o que precisa de escalamento
LLM de grandes dimensões Gerar resultados personalizados de elevado valor

O valor prático resulta de alterar o local onde ocorre a geração dispendiosa. Em vez de pedir a um LLM competente que analise profundamente e redija uma abordagem personalizada para cada registo, o sistema pode primeiro identificar o pequeno subconjunto que parece valioso ou incerto.

Esta é uma das razões pelas quais uma estratégia híbrida de custos de IA depende cada vez mais do encaminhamento. A otimização de custos não consiste apenas em encontrar um modelo mais barato. Consiste também em decidir quais pedidos precisam realmente de um modelo dispendioso.

Nessa arquitetura, o Jev é mais útil como pré-filtro do que como camada final de inteligência.

5. Jogos em tempo real: a frequência das decisões altera a economia

Os jogos em tempo real parecem demonstrações de novidade, mas revelam por que razão a latência é importante.

Max Blade publicou uma experiência com o Subway Surfers que executava o Jev em 50 jogos em simultâneo, tendo o autor indicado um custo total de inferência inferior a um cêntimo. Os valores são autodeclarados na demonstração pública do jogo.

O espaço de ações é reduzido: mover para a esquerda, mover para a direita, saltar, baixar-se ou continuar. Há pouco benefício em produzir uma descrição detalhada em linguagem natural de cada fotograma antes de escolher uma dessas ações.

Isto introduz uma forma útil de avaliar modelos de decisão: frequência das decisões.

Poupar algumas centenas de milissegundos numa decisão por dia tem pouco valor prático. Poupar essa latência em muitas decisões por segundo, multiplicada por dezenas de ambientes paralelos, altera tanto o tempo de resposta como o custo de inferência.

É por isso que os modelos de decisão rápida se tornam mais interessantes à medida que o mesmo juízo delimitado se repete com maior frequência.

6. Pontuação de conteúdo: faça muitas perguntas sobre o mesmo rascunho

O SuperX demonstra outra dimensão do problema. Em vez de tomar a mesma decisão com muita frequência, o sistema faz muitas perguntas diferentes sobre o mesmo input.

A experiência pública avalia uma publicação nas redes sociais com base em 61 perguntas distintas. O autor indica aproximadamente um segundo e 0,0004 $ por rascunho, utilizando publicações históricas para ajudar a identificar sinais associados a um desempenho mais forte. Estes resultados são afirmações do autor do produto, não comparativos independentes. O projeto aparece no diretório de casos de conteúdo e crescimento.

Em vez de fazer uma pergunta vaga como “Esta é uma boa publicação?”, a aplicação pode decompor o rascunho em juízos mais explícitos:

  • O gancho é específico?
  • Existe uma lacuna de curiosidade?
  • A afirmação é concreta?
  • O texto parece excessivamente promocional?
  • O CTA é demasiado agressivo?

O resultado não é uma pontuação de IA opaca. É um perfil estruturado que o software pode utilizar para identificar que dimensão precisa de ser reescrita, comparar dois rascunhos ou decidir se é necessária uma revisão humana.

Isto faz da dimensionalidade da decisão outra variável importante. Um modelo pode tornar-se útil não só porque o mesmo juízo ocorre frequentemente, mas também porque dezenas de juízos delimitados podem ser aplicados de forma económica ao mesmo estado.

7. Classificação de investigação: faça a triagem de tudo e leia depois o que importa

Um projeto público chamado 1kpapers utilizou o Jev para classificar 1 018 artigos de investigação em IA. Os valores publicados indicam um custo total de cerca de 0,08 $ e uma latência mediana de ponta a ponta de aproximadamente 256 ms por artigo. O projeto está listado no diretório de sites Made with Jev.

Este pode ser um dos exemplos mais práticos, porque muitos fluxos de trabalho reais começam com demasiados registos: artigos, emails, tickets de suporte, avaliações, documentos, registos ou consultas de pesquisa.

A parte dispendiosa muitas vezes não é compreender um item. É decidir quais os itens que merecem atenção mais aprofundada.

Primeira passagem Segunda passagem
Classificar o tema Ler documentos selecionados em profundidade
Avaliar a relevância Enviar registos de elevado valor para um modelo maior
Detetar incompatibilidades óbvias Uma pessoa analisa os casos ambíguos
Estimar a confiança Escalonar registos incertos

Isto torna-se especialmente útil quando os dados de origem são privados. Um assistente de IA privado pode manter localmente a recuperação e a biblioteca de documentos em bruto, enquanto apenas as evidências selecionadas ou derivadas são enviadas para um serviço externo quando necessário.

O modelo não precisa de substituir a leitura aprofundada. O seu papel é tornar seletiva essa leitura.

O padrão real: densidade de decisões

Os sete exemplos parecem não ter relação entre si, mas são muito semelhantes do ponto de vista estrutural. Cada um começa com um estado confuso e coloca repetidamente perguntas cuja resposta já está limitada.

Uma forma útil de descrever isto é densidade de decisões: quantas avaliações delimitadas um sistema precisa de fazer ao longo de uma determinada carga de trabalho.

Dois fatores são os mais importantes:

  • frequência: com que frequência a aplicação precisa de fazer uma avaliação;
  • dimensionalidade: quantas avaliações precisa de fazer sobre cada estado.
Carga de trabalho Densidade de decisões Adequação do Jev
Uma verificação sim/não por dia Baixa Vantagem reduzida
Classificar 1 000 e-mails Frequência elevada Forte
61 perguntas por rascunho Alta dimensionalidade Forte
Ação no navegador a cada passo Frequência elevada Forte
Muitos jogos em paralelo Frequência muito elevada Adequação estrutural muito forte
Escrever um relatório detalhado Centrada na geração Pouca adequação

É pouco provável que uma única decisão binária justifique a reformulação de uma stack de IA. Milhares de decisões ambíguas, ou dezenas de avaliações para cada entrada, constituem um problema diferente.

Quanto maior for a densidade de decisões, mais atrativa se torna uma camada de decisão especializada.

A arquitetura mais forte pode ser: Jev primeiro, modelo maior depois

Os modelos de decisão também não precisam de resolver todos os casos. A confiança pode determinar quando um modelo mais potente deve assumir o controlo.

Uma experiência pública de deteção de fraude ilustra este padrão. O autor começou por utilizar o Jev em 100 e-mails e, em seguida, encaminhou as previsões abaixo de um limiar de confiança de 95% para o modelo Kimi K3, mais potente. O autor comunicou 31 escalamentos, uma precisão final de 96/100 e um custo total aproximado de 0,07 $. Estes valores continuam a ser experimentais e baseiam-se no autor; o caso está listado no diretório de engenharia Jev.

Fase Objetivo
Modelo de decisão económico Tratar casos óbvios
Limiar de confiança Detetar incerteza
Modelo de raciocínio de grande dimensão Tratar dos casos difíceis
Camada de políticas / humana Manter a autoridade onde os erros são importantes

Esta arquitetura é mais interessante do que tentar maximizar a precisão autónoma do Jev. Um modelo mais barato pode tratar da maioria dos casos fáceis, enquanto um modelo mais dispendioso recebe apenas a parte ambígua.

Mesmo assim, a confiança não deve transformar-se automaticamente em autoridade. As ferramentas de agente só de leitura e as permissões limitadas continuam a ser importantes quando uma classificação pode eventualmente desencadear uma ação no mundo real.

Decisões Baratas Não Tornam Bons os Sinais Fracos

As primeiras discussões sobre o Jev já se expandiram para áreas como a rotulagem automática e a negociação. Ambas se enquadram na interface do modelo de decisão, mas isso não torna igualmente credível todas as afirmações a seu respeito.

Na rotulagem de dados, a melhor abordagem a curto prazo não consiste necessariamente em substituir os anotadores humanos. Os casos de elevada confiança podem ser rotulados automaticamente, os exemplos de confiança média podem ser sujeitos a uma revisão por um segundo modelo e os registos ambíguos podem continuar a ser encaminhados para uma pessoa.

Isso altera os exemplos a que os humanos dedicam tempo, em vez de pressupor que os humanos desaparecem do fluxo de trabalho.

A negociação torna esta limitação ainda mais clara. Produzir comprar, vender, ou manter rapidamente é fácil de enquadrar como uma decisão delimitada. O problema difícil é saber se os dados de entrada contêm uma vantagem preditiva real.

O Jev pode tornar barata uma decisão de mercado. Não pode tornar preditivos sinais fracos.

A mesma distinção aplica-se à maioria dos exemplos acima. A baixa latência e o baixo custo de inferência mostram que uma camada de decisão é eficiente. Por si só, não provam que o juízo subjacente cria valor empresarial.

Onde se Enquadra o Jev num Agente de IA Local

O próprio Jev é atualmente um serviço alojado, e não um ponto de controlo público autoalojado. Isso cria um limite importante para a IA local.

Um agente local pode manter ficheiros, memória, recuperação e ferramentas num servidor doméstico, mas, se o conteúdo dos documentos for enviado para o Jev para classificação, esses dados atravessaram o limite da rede.

Manter localmente Potencial entrada para uma decisão alojada
Biblioteca completa de documentos privados Dados selecionados ou derivados
Ficheiros de origem não tratados Estado mínimo da tarefa
Memória pessoal Contexto de classificação não sensível
Credenciais e segredos Não deve ser necessário para uma classificação comum

O mesmo princípio aplica-se ao utilizar ferramentas na nuvem com ficheiros locais: um ambiente de execução local não garante automaticamente um percurso de dados local.

Um design híbrido mais robusto mantém a obtenção privada de dados, o pré-processamento, a redação e as operações locais de rotina perto dos dados, enviando depois apenas as evidências mínimas necessárias para o modelo de decisão ou de raciocínio alojado.

O que as primeiras compilações da Jev realmente nos dizem

A primeira vaga de experiências com a Jev não mostra que um pequeno modelo de decisão possa substituir a IA de fronteira.

Isto mostra algo mais útil: muitas aplicações de IA estão a gastar capacidade computacional de modelos generativos em tarefas que não requerem geração.

Em navegadores, anúncios, potenciais clientes, jogos, conteúdos, investigação e orquestração de agentes, a mesma estrutura continua a surgir. A entrada é confusa, mas as saídas possíveis são limitadas. A avaliação acontece repetidamente e os casos incertos podem ser encaminhados para escalada.

Camada Melhor tarefa
Regras / código Decisões determinísticas
Modelo de decisão Avaliações imprecisas delimitadas
Modelo de raciocínio Problemas ambíguos difíceis
Modelo generativo Criar linguagem, código ou multimédia
Camada de políticas Decidir o que pode realmente ser executado

Por isso, as demonstrações mais úteis da Jev não são as que tentam provar que a Jev consegue fazer tudo.

São esses casos que mostram onde não é necessário envolver de todo um LLM de uso geral.

A Jev torna-se mais útil quando o software precisa de tomar milhares de decisões imprecisas, mas delimitadas - e de quase nenhumas palavras.

Perguntas frequentes sobre os casos de utilização da Jev

A Jev pode funcionar com o OpenClaw?

Sim. O OpenClaw suporta uma função dedicada de modelo de decisão e um plugin TypeSafe que pode utilizar a Jev separadamente do modelo conversacional principal.

A Jev pode controlar um agente de navegador?

Sim. Experiências públicas do Browser Use utilizaram a Jev para selecionar a ação seguinte a partir de um espaço delimitado de ações no DOM, enquanto os modelos generativos tratam do texto aberto quando necessário.

A Jev pode analisar anúncios, publicações ou grandes conjuntos de dados?

Sim. Compilações públicas utilizaram a Jev para classificação de anúncios, pontuação de conteúdos, triagem de e-mails, classificação de artigos de investigação e outras avaliações estruturadas de grande volume. A maioria dos valores publicados de velocidade e custo são atualmente comunicados pelos próprios criadores, e não obtidos através de avaliações de desempenho independentes.

A Jev pode substituir a rotulagem de dados humana?

Pode potencialmente automatizar classificações delimitadas com elevada confiança, mas as evidências atuais não sustentam afirmações precisas sobre a substituição de uma determinada percentagem de anotadores humanos. Uma escalada baseada na confiança é um design mais realista.

A Jev pode ser executada localmente?

A TypeSafe não lançou pesos públicos da Jev para autoalojamento. As integrações atuais da Jev utilizam inferência alojada, pelo que os designs de agentes privados devem controlar exatamente que evidências são enviadas para fora do ambiente local.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.