Jev 활용 사례: 사람들이 이미 TypeSafe의 의사결정 모델로 구축하고 있는 7가지 항목

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

Jev는 무엇을 말할 수 있는지 묻는 대신, 소프트웨어가 무엇을 결정하도록 맡길 수 있는지 묻기 시작하면 더 쉽게 이해할 수 있습니다. 개발자들은 이미 에이전트 스택, 브라우저 자동화, 광고 분석, 잠재 고객 평가, 게임, 콘텐츠 평가, 연구 트리아지에 TypeSafe의 의사결정 모델을 사용하고 있습니다.

개별 데모보다 중요한 것은 이러한 패턴입니다. Jev는 코드나 최첨단 LLM을 대체하지 않습니다. 단순한 규칙에는 너무 주관적이고, 사람이 처리하기에는 너무 반복적이며, 매번 비용이 많이 드는 생성을 사용하기에는 너무 작은 결정으로 이루어진 모호한 중간 계층을 겨냥합니다. 기본 모델 아키텍처와 한계에 대해서는 이전에 설명한 AI 에이전트를 위한 의사결정 모델을 참조하세요.

Jev에 적합한 사용 사례는 무엇일까요?

공개된 Jev의 가장 뛰어난 구현 사례에는 몇 가지 공통된 특징이 있습니다. 추론 전에 유효한 출력이 정해져 있고, 같은 판단이 반복해서 이루어지며, 지연 시간이 중요하고, 자유 형식 텍스트의 가치가 크지 않으며, 불확실한 경우에는 다른 곳으로 에스컬레이션할 수 있습니다.

유용한 테스트는 간단합니다. 모델이 실행되기 전에 유효한 답변의 범위를 정의할 수 있다면, 의사결정 모델을 평가해 볼 가치가 있을 수 있습니다.

워크로드 더 적합한 모델
어떤 에이전트가 이를 처리해야 할까요? 의사 결정 모델
브라우저에서 어떤 버튼을 클릭해야 할까요? 의사 결정 모델
최종 고객 이메일 작성하기 생성형 모델
복잡한 연구 논문 설명하기 생성 / 추론 모델

이러한 구분은 사람들이 이미 구축하고 있는 프로젝트에서 더욱 분명해집니다.

1. OpenClaw: 에이전트 스택 내부의 전용 의사결정 모델

OpenClaw는 Jev가 실험적 데모를 넘어 발전하고 있음을 보여 주는 가장 강력한 신호 중 하나입니다. 현재 제공되는 의사결정 모델 문서는 기본 대화 모델과 전용 의사결정 모델 역할을 구분합니다.

번들로 제공되는 TypeSafe 플러그인을 사용하면 개발자가 메인 LLM과 독립적으로 Jev를 선택할 수 있습니다. 더 큰 모델은 계속해서 계획 수립, 코딩, 설명, 도구 사용을 담당하고, Jev는 어떤 에이전트가 작업을 받아야 하는지, 증거가 조건을 충족하는지, 워크플로를 계속 진행해야 하는지와 같은 더 좁은 범위의 질문을 처리할 수 있습니다.

이는 중요한 아키텍처 전환입니다. 모호한 단계를 매번 메인 LLM에 보내는 또 다른 프롬프트로 취급하는 대신, 에이전트는 제한된 판단을 전담할 모델 하나를 따로 지정할 수 있습니다.

OpenClaw는 의사 결정과 실행 사이의 중요한 분리도 유지합니다. Jev의 결과는 어떤 작업이 적절해 보인다는 근거를 제공할 수 있지만, 콘텐츠 게시, 메시지 전송 또는 지속적인 상태 변경을 자동으로 허가해서는 안 됩니다. 이러한 작업은 여전히 별도의 도구 실행 신뢰 경계를 통과해야 합니다.

따라서 의사 결정 모델은 더 작은 챗봇이라기보다 주 에이전트 모델 옆에서 작동하는 또 하나의 인프라 구성 요소에 가깝습니다.

2. 브라우저 에이전트: 페이지를 설명하는 대신 다음 클릭 선택하기

브라우저 자동화는 본질적으로 의사 결정이 많은 작업입니다. 많은 단계에서 에이전트는 어떤 요소를 사용할 수 있는지 이미 알고 있으며 다음 작업만 선택하면 됩니다.

Gregor Zunic은 브라우저가 DOM 상태를 제공하고 Jev가 다음 작업을 선택하며, 실제로 텍스트가 필요한 경우에는 더 작은 생성 모델이 처리하는 Browser Use 실험을 공개했습니다. 공개된 항공편 검색 데모에서 작성자는 총 소요 시간이 약 7초, 총비용이 0.0039달러 정도였다고 보고했습니다. 이는 독립적인 벤치마크가 아닌 제작자가 보고한 수치입니다. Browser Use + Jev 예시를 참조하세요.

브라우저 작업 최적의 역할
다음에 클릭할 요소 선택 Jev
목표가 달성되었는지 판단 Jev
자유 형식의 양식 응답 작성 생성형 모델

이 구분이 중요한 이유는 브라우저 루프의 상당 부분이 모델에게 언어를 생성하라고 요청하는 일이 아니기 때문입니다. 현재 목표를 가장 잘 진전시키는 작업이 무엇인지 반복해서 묻는 과정에 가깝습니다.

이는 더 효율적인 브라우저 에이전트 설계를 시사합니다. 브라우저에 실제로 새로운 텍스트가 필요할 때는 생성을 사용하고, 다음 단계가 이미 정해진 작업 집합에서 나오는 경우에는 제한된 의사 결정을 사용하는 것입니다.

3. 광고 분석: 샘플링하는 대신 전체 데이터 세트에 점수 매기기

Matthew Berman은 Jev를 사용해 37개 브랜드의 실제 광고 724개를 훅, 형식, 오퍼, CTA, 인지도 단계, 랜딩 페이지 불일치 등의 차원으로 분류했다고 보고했습니다. 보고된 실행 시간은 약 40초였고 비용은 약 0.09달러였습니다. 이 수치는 작성자가 보고한 것으로, 공개 광고 분석 사례에서 수집되었습니다.

첫 단계 판단이 충분히 저렴해졌을 때 어떤 일이 일어나는지가 더 흥미로운 결과입니다.

고비용 분석 저렴한 의사 결정 계층
광고 1,000개 수집 광고 1,000개 수집
50개 샘플링 1,000개 모두 점수 매기기
샘플에서 패턴 추론 구조화된 신호로 필터링
전문가의 시간을 폭넓게 투입 특이하거나 가치가 높은 클러스터 검토

분석가들은 모든 레코드를 평가하는 데 비용이 너무 많이 들기 때문에 샘플링을 자주 사용합니다. 의사 결정 모델이 동일한 기준으로 모든 광고를 저렴하게 점수화할 수 있다면 워크플로가 달라집니다. AI를 사용해 소수의 샘플만 검토하는 대신, 사람이 가장 흥미로운 클러스터를 살펴보기 전에 전체 데이터셋에 1차 분류를 적용할 수 있습니다.

이는 단순히 광고 분석 비용을 낮추는 것보다 더 큰 변화입니다. 일부 샘플링 문제는 전체 점수화 문제로 바뀔 수 있습니다.

4. 리드 스코어링: 비용이 많이 드는 생성 전에 저렴한 의사 결정을 배치하기

리드 스코어링에서도 비슷한 패턴이 나타납니다. Romàn은 약 40초 동안 약 0.09달러의 비용으로 700개의 리드를 처리하고, 적합성, 신뢰도, 불일치 여부를 점수화한 뒤 어떤 레코드에 더 깊은 검토가 필요한지 결정했다고 보고했습니다. 자세한 내용은 공개된 리드 스코어링 실험을 참조하세요.

계층 작업
Jev 필터링, 점수화, 분류
신뢰도 규칙 에스컬레이션이 필요한 항목 결정
대규모 LLM 가치가 높은 개인화된 결과 생성

실질적인 가치는 비용이 많이 드는 생성이 이루어지는 지점을 바꾸는 데서 나옵니다. 유능한 LLM에 모든 레코드를 심층 분석하고 개인화된 아웃리치를 작성하도록 요청하는 대신, 시스템이 먼저 가치가 있거나 불확실해 보이는 소수의 항목을 식별할 수 있습니다.

이는 하이브리드 AI 비용 전략이 점점 더 라우팅에 의존하는 이유 중 하나입니다. 비용 최적화는 단순히 더 저렴한 모델을 찾는 것만이 아닙니다. 어떤 요청에 애초에 고가 모델이 필요한지 결정하는 것도 중요합니다.

이 아키텍처에서 Jev는 최종 지능 계층이라기보다 사전 필터로 사용할 때 가장 유용합니다.

5. 실시간 게임: 의사 결정 빈도가 경제성을 바꾼다

실시간 게임은 단순한 신기술 데모처럼 보이지만, 지연 시간이 중요한 이유를 보여 줍니다.

Max Blade는 Jev를 사용해 50개의 게임을 동시에 실행한 Subway Surfers 실험을 공개했으며, 작성자는 총 추론 비용이 1센트 미만이라고 보고했습니다. 수치는 공개 게임 데모에 자체적으로 보고된 것입니다.

행동 공간은 작습니다. 왼쪽 이동, 오른쪽 이동, 점프, 숙이기 또는 계속하기뿐입니다. 이러한 행동 중 하나를 선택하기 전에 모든 프레임을 자세한 자연어로 설명하는 것은 큰 이점이 없습니다.

이로 인해 의사결정 모델을 평가하는 데 유용한 방식인 의사결정 빈도가 도입됩니다.

하루에 한 번 판단하는 데 걸리는 시간을 수백 밀리초 줄이는 것은 실용적 가치가 거의 없습니다. 하지만 초당 여러 결정에 걸쳐, 수십 개의 병렬 환경에서 이를 반복하면 응답 시간과 추론 비용이 모두 달라집니다.

이 때문에 동일한 제한적 범위의 판단이 더 자주 반복될수록 빠른 의사결정 모델이 더욱 흥미로워집니다.

6. 콘텐츠 점수화: 동일한 초안에 대해 여러 질문하기

SuperX는 이 문제의 또 다른 측면을 보여줍니다. 같은 결정을 매우 자주 내리는 대신, 시스템이 동일한 입력에 대해 여러 가지 질문을 합니다.

이 공개 실험은 소셜 게시물을 61개의 개별 질문에 따라 평가합니다. 작성자는 더 나은 성과와 관련된 신호를 식별하는 데 과거 게시물을 활용했으며, 초안당 약 1초와 0.0004달러가 소요된다고 보고합니다. 이러한 결과는 독립적인 벤치마크가 아니라 제품 제작자의 주장입니다. 이 프로젝트는 콘텐츠 및 성장 활용 사례 디렉터리에 소개되어 있습니다.

애플리케이션은 “이 게시물이 좋은가?”와 같은 모호한 질문을 하는 대신 초안을 더 명확한 판단 항목으로 나눌 수 있습니다.

  • 후크가 구체적인가?
  • 호기심을 유발할 여지가 있는가?
  • 주장이 구체적인가?
  • 문구가 지나치게 홍보성으로 들리는가?
  • CTA가 너무 공격적인가?

그 결과는 불투명한 AI 점수 하나가 아닙니다. 소프트웨어가 어떤 차원을 다시 작성해야 하는지 식별하고, 두 초안을 비교하거나, 사람의 검토가 필요한지 결정하는 데 사용할 수 있는 구조화된 프로필입니다.

이로 인해 의사결정 차원 수도 또 하나의 중요한 변수가 됩니다. 같은 판단이 자주 이루어지기 때문만이 아니라, 제한된 범위의 수십 가지 판단을 동일한 상태에 저렴하게 적용할 수 있기 때문에 모델이 유용해질 수 있습니다.

7. 연구 분류: 모든 항목을 먼저 선별한 다음 중요한 것 읽기

1kpapers라는 공개 프로젝트는 Jev를 사용해 1,018편의 AI 연구 논문을 분류했습니다. 공개된 수치에 따르면 총비용은 약 0.08달러, 논문당 엔드투엔드 지연 시간 중앙값은 약 256ms입니다. 이 프로젝트는 Made with Jev 사이트 디렉터리에 등록되어 있습니다.

이는 실제 워크플로의 상당수가 논문, 이메일, 지원 티켓, 리뷰, 문서, 로그 또는 검색어처럼 기록이 너무 많은 상태에서 시작하기 때문에 특히 실용적인 예시일 수 있습니다.

비용이 많이 드는 부분은 대개 항목 하나를 이해하는 일이 아닙니다. 더 깊은 주의를 기울일 가치가 있는 항목을 결정하는 일입니다.

첫 번째 단계 두 번째 단계
주제 분류 선별된 문서를 깊이 있게 읽기
관련성 점수 산정 가치가 높은 레코드를 더 큰 모델로 전송
명백한 불일치 감지 모호한 사례는 사람이 검토
신뢰도 추정 불확실한 레코드 에스컬레이션

이는 원본 데이터가 비공개일 때 특히 유용합니다. 비공개 AI 어시스턴트는 검색과 원본 문서 라이브러리를 로컬에 유지하면서, 필요할 때만 선택된 증거나 그로부터 도출된 정보만 외부 서비스로 전송할 수 있습니다.

모델은 심층적인 독해를 대체할 필요가 없습니다. 역할은 심층 독해가 필요한 대상을 선별하는 것입니다.

실제 패턴: 의사결정 밀도

7가지 예시는 서로 관련 없어 보이지만 구조적으로는 매우 유사합니다. 각각 복잡한 상태에서 시작해, 답의 범위가 이미 제한된 질문을 반복해서 던집니다.

이를 설명하는 유용한 방법이 의사결정 밀도입니다. 주어진 워크로드에서 시스템이 내려야 하는 제한된 판단의 수를 의미합니다.

가장 중요한 요소는 두 가지입니다.

  • 빈도: 애플리케이션이 판단을 내려야 하는 빈도;
  • 차원 수: 각 상태에 대해 필요한 판단의 수.
워크로드 의사결정 밀도 Jev 적합성
하루에 예/아니요 확인 1회 낮음 이점이 적음
분류할 이메일 1,000개 빈도 높음 높음
초안당 61개 질문 차원 수가 높음 높음
매 단계마다 브라우저 동작 빈도 높음 높음
여러 게임을 병렬로 진행 빈도가 매우 높음 구조적 적합성이 매우 높음
상세한 보고서 작성 생성 중심 부적합

단일 이진 의사결정만으로는 AI 스택을 재설계할 이유가 되기 어렵습니다. 모호한 의사결정이 수천 건 발생하거나, 모든 입력에 대해 수십 가지 판단을 내려야 한다면 문제는 달라집니다.

의사결정 밀도가 높을수록 특화된 의사결정 계층의 매력은 커집니다.

가장 강력한 아키텍처는 Jev를 먼저 사용하고, 더 큰 모델을 나중에 사용하는 방식일 수 있습니다

의사결정 모델이 모든 사례를 해결할 필요도 없습니다. 더 강력한 모델이 언제 이어받아야 하는지 신뢰도로 판단할 수 있습니다.

공개 사기 탐지 실험은 이러한 패턴을 보여 줍니다. 제작자는 먼저 100개의 이메일에 Jev를 사용한 다음, 신뢰도 임계값 95% 미만의 예측을 더 큰 Kimi K3 모델로 전달했습니다. 작성자는 31건의 에스컬레이션, 최종 정확도 96/100, 총비용 약 $0.07를 보고했습니다. 이 수치는 여전히 실험적이며 자체 보고된 것입니다. 이 사례는 Jev 엔지니어링 디렉터리에 등재되어 있습니다.

단계 목적
저비용 의사결정 모델 명확한 사례 처리
신뢰도 임계값 불확실성 감지
대규모 추론 모델 어려운 사례 처리
정책 / 인간 계층 오류가 중요한 경우 권한을 유지

이 아키텍처는 Jev의 단독 정확도를 극대화하려는 것보다 더 흥미롭습니다. 더 저렴한 모델이 쉬운 다수를 처리하고, 더 비싼 모델은 모호한 일부만 맡을 수 있습니다.

그렇다 하더라도 신뢰도가 자동으로 권한이 되어서는 안 됩니다. 읽기 전용 에이전트 도구와 범위가 제한된 권한은 분류가 결국 실제 행동을 촉발할 수 있을 때에도 여전히 중요합니다.

저렴한 의사 결정이 나쁜 신호를 좋은 신호로 바꾸지는 않습니다

초기 Jev 논의는 이미 자동화된 라벨링과 트레이딩 같은 영역으로 확장되었습니다. 둘 다 의사 결정 모델 인터페이스에 부합하지만, 그렇다고 관련된 모든 주장이 똑같이 신뢰할 만한 것은 아닙니다.

데이터 라벨링의 경우, 단기적으로 가장 효과적인 설계가 반드시 인간 어노테이터를 대체하는 것은 아닙니다. 신뢰도가 높은 사례는 자동으로 라벨링하고, 신뢰도가 중간인 예시는 두 번째 모델의 검토를 거치게 하며, 모호한 레코드는 여전히 사람에게 맡길 수 있습니다.

이는 인간이 워크플로에서 사라진다고 가정하기보다, 인간이 시간을 투자하는 사례를 바꿉니다.

트레이딩에는 더욱 분명한 한계가 있습니다. 생성하는 것 매수, 매도또는 보유 빠르게 처리하는 것은 제한된 범위의 의사 결정으로 쉽게 구성할 수 있습니다. 어려운 문제는 입력 데이터에 실제 예측 우위가 포함되어 있는지 여부입니다.

Jev는 시장 의사 결정을 저렴하게 만들 수 있습니다. 하지만 약한 신호를 예측 가능하게 만들 수는 없습니다.

위에서 설명한 대부분의 예에도 같은 구분이 적용됩니다. 낮은 지연 시간과 낮은 추론 비용은 의사 결정 계층이 효율적이라는 점을 보여줍니다. 하지만 그것만으로 기반 판단이 비즈니스 가치를 창출한다는 사실이 입증되지는 않습니다.

로컬 AI 에이전트에서 Jev의 역할

Jev 자체는 현재 공개적으로 자체 호스팅할 수 있는 체크포인트가 아니라 호스팅 서비스입니다. 이는 로컬 AI에 중요한 경계를 만듭니다.

로컬 에이전트는 홈 서버에 파일, 메모리, 검색 기능 및 도구를 유지할 수 있지만, 문서 콘텐츠가 분류를 위해 Jev로 전송되면 해당 증거는 네트워크 경계를 넘어갑니다.

로컬에 유지 호스팅 의사 결정 입력 가능성
전체 비공개 문서 라이브러리 선택되었거나 파생된 증거
원본 소스 파일 최소한의 작업 상태
개인 메모리 민감하지 않은 분류 컨텍스트
자격 증명 및 비밀 정보 일반적인 분류에는 필요하지 않아야 함

로컬 파일을 사용하는 클라우드 도구를 사용할 때도 같은 원칙이 적용됩니다. 로컬 런타임이라고 해서 데이터 경로까지 자동으로 로컬이 보장되는 것은 아닙니다.

더 강력한 하이브리드 설계에서는 비공개 검색, 전처리, 마스킹 및 일상적인 로컬 작업을 데이터 가까이에 유지한 다음, 호스팅된 의사 결정 모델이나 추론 모델에 필요한 최소한의 증거만 전송합니다.

첫 번째 Jev 빌드가 실제로 알려 주는 것

첫 번째 Jev 실험은 소규모 의사 결정 모델이 최첨단 AI를 대체할 수 있다는 것을 보여 주지 않습니다.

이는 더 유용한 사실을 보여 줍니다. 많은 AI 애플리케이션이 생성이 필요하지 않은 작업에 생성형 모델의 연산을 사용하고 있다는 것입니다.

브라우저, 광고, 잠재 고객, 게임, 콘텐츠, 연구 및 에이전트 오케스트레이션 전반에서 같은 구조가 계속 나타납니다. 입력은 복잡하지만 가능한 출력은 제한되어 있습니다. 판단은 반복적으로 이루어지며, 불확실한 사례는 에스컬레이션할 수 있습니다.

계층 최적 역할
규칙 / 코드 결정론적 의사 결정
의사 결정 모델 모호하지만 제한된 판단
추론 모델 어렵고 모호한 문제
생성형 모델 언어, 코드 또는 미디어 생성
정책 계층 실제로 실행이 허용되는 작업 결정

따라서 가장 유용한 Jev 데모는 Jev가 무엇이든 할 수 있다는 것을 증명하려는 데모가 아닙니다.

범용 LLM이 전혀 관여할 필요가 없다는 점을 보여 주는 사례들입니다.

Jev는 소프트웨어에 수천 건의 모호하지만 제한된 판단이 필요하고 말은 거의 필요하지 않을 때 가장 유용합니다.

Jev 사용 사례에 대한 자주 묻는 질문

Jev가 OpenClaw와 함께 작동할 수 있나요?

예. OpenClaw는 전용 의사 결정 모델 역할과, 기본 대화형 모델과 별도로 Jev를 사용할 수 있는 TypeSafe 플러그인을 지원합니다.

Jev가 브라우저 에이전트를 제어할 수 있나요?

예. 공개된 Browser Use 실험에서는 제한된 DOM 작업 공간에서 다음 작업을 선택하는 데 Jev를 사용했으며, 필요할 때는 생성형 모델이 자유 형식 텍스트를 처리했습니다.

Jev가 광고, 게시물 또는 대규모 데이터셋을 분석할 수 있나요?

예. 공개 빌드에서는 광고 분류, 콘텐츠 점수화, 이메일 분류, 연구 논문 분류 및 기타 대규모 구조화된 판단에 Jev를 사용해 왔습니다. 현재 공개된 속도와 비용 수치 대부분은 독립적으로 벤치마크된 결과가 아니라 빌더가 보고한 수치입니다.

Jev가 인간의 데이터 라벨링을 대체할 수 있나요?

확신도가 높은 제한적 라벨링을 자동화할 가능성은 있지만, 현재 증거만으로는 인간 어노테이터의 특정 비율을 대체할 수 있다는 정확한 주장을 뒷받침하기 어렵습니다. 확신도에 따른 에스컬레이션이 더 현실적인 설계입니다.

Jev를 로컬에서 실행할 수 있나요?

TypeSafe는 셀프 호스팅용 공개 Jev 가중치를 출시하지 않았습니다. 현재 Jev 통합은 호스팅된 추론을 사용하므로, 비공개 에이전트 설계에서는 어떤 증거가 로컬 환경 밖으로 전송되는지 정확히 제어해야 합니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.