Laya 모델 설명: 로컬에서 실행할 수 있는 오픈 소스 의사 결정 모델

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

Laya는 더 저렴한 ChatGPT가 되려는 또 하나의 소형 언어 모델이 아닙니다. 토큰 단위로 단락을 생성하지도 않습니다. 대신 이메일, 지원 티켓, 에이전트 추적 정보 또는 JSON 객체와 같은 상태를 입력으로 받아 확률과 함께 구조화된 결정을 반환합니다.

따라서 Laya는 TypeSafe의 Jev와 함께 새롭게 부상하는 같은 범주의 모델에 속하지만, 한 가지 큰 차이가 있습니다. Laya의 가중치는 Apache 2.0 라이선스에 따라 공개되어 있으며 모델을 로컬 하드웨어에서 완전히 실행할 수 있습니다. 로컬 AI의 관점에서 보면 Laya는 또 하나의 빠른 분류기보다 더 흥미롭습니다. 이는 반복적인 AI 의사 결정을 과연 프런티어 모델에 보내야 하는가라는 더 큰 질문을 제기합니다.

Laya란 무엇인가요?

Laya는 Convai Innovations가 개발한 오픈 웨이트 비자기회귀 결정 모델입니다.

주요 영어 체크포인트는 ModernBERT-large를 백본으로 사용하며 약 4억 2,100만 개의 매개변수를 포함합니다. 임의의 언어를 생성하는 대신, 애플리케이션이 상태와 하나 이상의 유형이 지정된 질문을 제공합니다.

결정 유형 Laya가 반환하는 값 예시
선택 사전 정의된 옵션에 대한 확률 결제 / 지원 / 영업
점수 순서가 있는 척도에서의 예상값 0–4 범위의 긴급도
noul P(true) 이 이메일은 피싱인가요?

이 인터페이스가 익숙하게 느껴진다면, Jev도 유사한 형식화된 결정 모델을 사용하기 때문입니다. AI 에이전트를 위한 결정 모델에 관한 이전 가이드에서는 이 모델 범주가 처음 등장하는 이유를 설명합니다.

Laya는 학습된 의사 결정 엔진으로 이해하는 편이 더 적절합니다

생성 모델에는 다음과 같은 입력이 주어질 수 있습니다.

“이 지원 티켓을 읽고 고객이 원하는 것을 설명하세요.”

Laya는 더 좁은 범위의 질문을 위해 설계되었습니다.

  • 어느 부서로 전달해야 할까요?
  • 긴급한가요?
  • 피싱처럼 보이나요?
  • 다른 모델이 이를 검토해야 할까요?
생성 모델 Laya
임의의 응답 생성 사전 정의된 결과 중에서 선택
토큰을 순차적으로 생성 옵션을 직접 점수화
작성 및 추론에 유용 라우팅 및 분류에 유용
출력 길이는 지연 시간에 영향을 줍니다 긴 출력 시퀀스 없음

중요한 구분은 “스마트한 모델과 단순한 모델”이 아닙니다. 애플리케이션에 실제로 언어 생성이 필요한지 여부입니다.

소프트웨어가 결제, 기술 또는 영업 중 하나만 알면 되는 경우, 단락을 생성한 뒤 다시 열거형으로 파싱하는 것은 불필요한 작업입니다.

Laya는 텍스트를 생성하지 않고 어떻게 의사 결정을 내릴까요?

공식 아키텍처 문서에 따르면, Laya는 약 3억 9,500만 개의 매개변수를 가진 ModernBERT-large 인코더에 2층 결정 헤드, 옵션 마커 점수화, act/escalate 구성 요소를 결합합니다.

ModernBERT는 양방향이므로 Laya는 한 번에 한 토큰씩 출력을 예측하는 대신 상태, 질문, 사용 가능한 선택지를 함께 고려할 수 있습니다.

이러한 아키텍처 차이 때문에 다음과 같은 워크로드에는 소형 의사 결정 모델이 매력적일 수 있습니다.

  • 에이전트 라우팅;
  • 이메일 분류;
  • 검토;
  • 문서 관련성;
  • 의도 감지;
  • 안전 게이트;
  • 워크플로 에스컬레이션.

이는 바로 하이브리드 AI 라우팅이 유용해지는 일상적인 워크로드입니다. 반복적인 작업은 더 저렴한 로컬 계층에서 처리하고, 어려운 경우에는 더 큰 모델을 사용하도록 남겨 둘 수 있습니다.

Laya에는 정말 “환각이 없을까요”?

프로젝트 문서에 따르면 Laya는 텍스트를 생성하지 않으므로 파싱 오류와 환각을 제거합니다.

이 주장에는 중요한 단서가 하나 필요합니다.

Laya는 다음과 같은 오류를 제거할 수 있습니다.

  • 잘못된 형식의 JSON;
  • 임의로 만들어 낸 열거형 값;
  • 구조화된 응답을 둘러싼 추가 설명;
  • 자유 형식으로 생성된 주장.

하지만 여전히 잘못된 결정을 내릴 수 있습니다.

모델은 다음과 같이 반환할 수 있습니다.

청구: 0.92

티켓이 기술 지원으로 전달되었어야 하는 경우에도

유형이 지정된 출력은 유효하지 않은 답변을 방지합니다. 하지만 올바른 판단을 보장하지는 않습니다.

출력이 에이전트, 보안 워크플로, 금융 프로세스 또는 자동화된 작업을 제어한다면 이러한 구분은 매우 중요합니다.

신뢰도 수치보다 보정이 중요한 이유

Laya는 RLCD, 즉 보정된 결정을 위한 강화 학습(Reinforcement Learning for Calibrated Decisions)을 사용해 학습됩니다. 목표는 단순히 올바른 답을 선택하는 데 그치지 않고, 보고된 확률을 유용하게 만드는 것입니다.

그러면 운영 시스템은 다음과 같이 신뢰도를 사용해 에스컬레이션을 제어할 수 있습니다.

신뢰도 가능한 조치
매우 높음 위험도가 낮은 결정을 자동으로 처리
중간 더 큰 모델에 요청
낮음 사람의 검토 요청

하지만 Laya의 자체 문서는 이러한 확률을 무조건 신뢰해서는 안 되는 이유를 보여줍니다. 이 프로젝트는 온도 피팅 후 보정 성능이 크게 향상되었다고 보고하며, 배포 도메인에 맞춰 모델을 보정할 것을 권장합니다.

다시 말해, 보정된 결정을 내리도록 설계된 모델이라도 실제 워크로드에 맞춘 보정이 필요합니다.

가장 중요한 Laya의 결과는 속도가 아닙니다

Laya가 공개한 지연 시간 수치는 인상적입니다. 이 프로젝트는 Tesla T4에서 수십 밀리초 내에 단기 결정을 내린다고 보고하며, 독립적인 Laya-MLX 포트는 M3 Max에서 영어 모델의 경우 약 13.4ms, 다국어 체크포인트의 경우 7.4ms를 보고합니다.

이 측정 결과는 Laya가 수십억 개의 파라미터를 가진 생성형 모델과는 매우 다른 배포 범주에 속한다는 점을 확인해 줍니다.

하지만 더 중요한 결과는 성능이 특화에 얼마나 크게 좌우되는가입니다.

프로젝트의 Typed-Decision 평가에서 기본 Laya 모델은 제로샷 사용 시 무작위 기준선보다 약간 높은 성능만 보입니다. 작업별 파인튜닝을 거치면 특화된 체크포인트의 성능이 크게 향상됩니다.

Typed-Decision 평가 보고된 정확도
무작위 기준선 ~0.318
기본 Laya, 제로샷 ~0.36
파인튜닝된 Laya Typed-Decisions ~0.766

이는 Laya를 이해하는 방식을 바꿉니다.

Laya가 모든 새로운 의사 결정 문제를 마법처럼 이해하는 421M 범용 추론 모델이라는 뜻은 아닙니다.

Laya의 더 강력한 장점은 소형 모델을 안정적인 의사 결정 영역에 맞게 특화하고 보정한 뒤, 대규모 요청을 매우 저렴하게 처리할 수 있다는 점입니다.

기본 모델보다 더 중요할 수 있는 파인튜닝

이 프로젝트는 체크포인트와 함께 학습 및 파인튜닝 도구도 공개합니다. 이는 많은 프로덕션 의사 결정이 고도로 도메인 특화되어 있기 때문에 중요합니다.

다음을 고려해 보세요:

  • 이 문제를 담당하는 내부 지원팀은 어디인가?
  • 이 문서가 우리의 비공개 분류 체계와 일치하는가?
  • 이 홈 자동화를 실행해야 하는가?
  • 이 작업은 어떤 에이전트가 받아야 하는가?
  • 이 로컬 파일에 더 심층적인 AI 분석이 필요한가?

범용 모델도 이러한 질문에 답할 수 있지만, 거의 변하지 않는 의사 결정 경계를 재구성하는 데 대규모 모델의 연산을 반복적으로 사용할 수 있습니다.

대신 특화된 Laya 체크포인트는 그 경계를 직접 학습할 수 있습니다.

이는 오픈 모델과 프런티어 AI를 둘러싼 더 큰 흐름과도 맞닿아 있습니다. 가장 강력한 모델이 반복적이고 명확하게 정의된 작업에 항상 가장 효율적인 모델인 것은 아닙니다.

Laya가 여전히 약한 부분

공개된 결과에서도 명확한 한계가 드러납니다.

레이블 공간이 크면 어렵습니다. Laya 문서에서는 선택형 질문의 선택지를 대략 20개 미만으로 유지할 것을 권장합니다. 사용 가능한 선택지들이 고정된 토큰 예산을 공유하므로, 매우 큰 평면형 분류 체계에서는 성능이 저하될 수 있습니다.

계층적 라우팅이 더 적합한 경우가 많습니다:

단계 예시
첫 번째 결정 결제 / 제품 / 보안 / 계정
두 번째 결정 여러 하위 범주 중 하나 선택

서열형 점수 부여도 또 다른 약점입니다. 모델에 범주를 선택하게 하는 일은 대체로 쉽지만, 1부터 5까지의 좌절감 점수처럼 밀접하게 관련된 수준을 안정적으로 구분하는 일은 더 어렵습니다.

컨텍스트도 최신 LLM에 비해 제한적입니다. 영어 체크포인트는 512토큰의 입력 예산을 사용하며, 다른 Laya 변형 모델은 이를 1,024토큰까지 확장합니다.

이는 Laya가 긴 문서 전체를 모델에 넣는 것보다 선별된 근거를 처리하는 데 훨씬 더 적합하다는 뜻입니다.

Laya와 Jev: 오픈 로컬 모델인가, 관리형 의사 결정 API인가?

Laya는 오픈 소스 Jev 대안으로 자주 설명되지만, 비교를 벤치마크 점수로만 축소하면 더 중요한 아키텍처 차이를 놓치게 됩니다.

Laya Jev
주요 역할 유형화된 의사 결정 유형화된 의사 결정
공개 가중치 현재 공개 가중치 없음
셀프 호스팅 호스팅 서비스
미세 조정 사용 가능 공개적으로 동등한 로컬 워크플로 없음
로컬 데이터 경로 가능 요청이 호스팅 서비스로 전송됨
운영 부담 사용자가 모델과 보정을 관리 공급자가 추론을 관리

특화된 Laya 체크포인트는 공개된 유형화된 의사 결정 벤치마크 한 곳에서 Jev보다 높은 정확도를 보였지만, Jev는 동일한 비교의 일부 항목에서 더 나은 보정 성능을 보였습니다. 이는 어느 한 모델이 보편적으로 더 우수하다고 선언하기에는 충분한 근거가 아닙니다.

더 큰 차이는 제어권입니다.

Jev는 개발자에게 관리형 의사 결정 서비스를 제공합니다. Laya는 비공개 데이터 옆에서 미세 조정, 벤치마크, 버전 고정 및 배포가 가능한 모델 가중치를 제공합니다.

Laya를 완전히 로컬에서 실행할 수 있나요?

예. 이것이 Laya의 가장 중요한 실용적 장점입니다.

공식 모델은 PyTorch와 Transformers를 통해 실행됩니다. 커뮤니티 프로젝트는 이미 다른 런타임으로의 배포를 확장했습니다:

주요 421M 체크포인트는 게시된 가중치 표현 기준으로 1GB 미만이므로, 대부분의 유용한 생성형 LLM보다 메모리 등급이 훨씬 낮습니다.

이는 메모리 사용량에 따른 모델 라우팅이라는 실용적인 문제와 Laya가 관련되는 이유입니다. 시스템은 유입되는 모든 요청을 분류하기 위해 대규모 생성 모델을 계속 활성화해 둘 필요가 없습니다.

의사 결정 레이어를 로컬에서 실행하는 것이 중요한 이유

로컬 추론은 API 비용을 피하는 것만을 의미하지 않습니다.

의사 결정 모델에 입력되는 정보는 민감한 경우가 많습니다:

  • 이메일;
  • 지원 티켓;
  • 비공개 문서;
  • 고객 기록;
  • 소스 데이터;
  • 에이전트 추적 정보;
  • 로컬 검색 결과.

호스팅된 의사 결정 API는 비용이 저렴할 수 있지만, 애플리케이션은 분류를 위해 여전히 상태 정보를 어딘가로 전송해야 합니다.

Laya는 또 다른 아키텍처를 가능하게 합니다:

로컬 레이어 에스컬레이션 레이어
비공개 파일 검색 어려운 추론
로컬에서 분류 및 점수 산정 프런티어 모델
민감한 콘텐츠 감지 복잡한 종합
일상적인 작업 라우팅 모호한 예외 사례

이는 저장된 데이터 가까이에서 수행하는 로컬 AI 처리가 중요한 동일한 이유입니다. 데이터 옆에서 첫 번째 판단을 수행하면 네트워크 노출과 불필요한 클라우드 추론을 모두 줄일 수 있습니다.

Laya는 대규모 모델을 위한 필터가 될 수 있습니다

가장 강력한 아키텍처는 LLM 대신 Laya일 수 있습니다.

다음과 같을 수 있습니다:

레이어 작업
규칙 결정론적 사례 처리
로컬 Laya 반복적이고 모호한 의사결정 처리
대형 모델 어려운 추론 또는 생성 처리
정책 / 사람 영향이 큰 작업 승인

로컬 레코드가 10,000개 있는 프라이빗 문서 시스템을 생각해 보세요. 최첨단 모델이 10,000개를 모두 깊이 있게 읽을 필요는 없습니다.

소형 로컬 모델이 먼저 다음과 같이 질문할 수 있습니다.

  • 이것은 관련이 있나요?
  • 어느 카테고리에 속하나요?
  • 민감한 정보가 포함되어 있나요?
  • 상위 단계로 넘길 만큼 신뢰도가 낮은가요?

비용이 많이 드는 추론이 필요한 것은 어려운 일부 작업뿐입니다.

NAS의 프라이빗 AI 어시스턴트는 이러한 패턴에 적합한 환경입니다. 저장소, 검색, 분류, 개인 데이터는 로컬에 유지하면서 더 어려운 요청만 선택적으로 상위 단계로 넘길 수 있기 때문입니다.

Laya가 실제로 바꾸는 것

지난 몇 년 동안 AI 아키텍처는 점점 더 범용적인 모델을 향해 발전해 왔습니다. 하나의 모델이 추론하고, 코딩하고, 글을 쓰고, 분류하고, 검색하고, 도구를 호출하는 방식입니다.

Laya는 그와 반대되는 아이디어를 나타냅니다.

일부 작업은 모델이 더 일반화되는 것이 아니라 더 전문화될수록 개선될 수 있습니다.

시스템에 다음과 같은 수백만 건의 판단이 필요하다고 가정해 보겠습니다.

관련이 있나요, 아니면 관련이 없나요?

안전한가요, 아니면 안전하지 않은가요?

A, B 또는 C로 라우팅할까요?

계속 진행할까요, 아니면 상위 단계로 넘길까요?

그렇다면 로컬 421M 의사결정 모델은 최첨단 LLM과는 전혀 다른 경제적·개인정보 보호 계층을 차지할 수 있습니다.

따라서 중요한 질문은 Laya가 모든 면에서 Jev, Claude, Gemini 또는 GPT를 능가할 수 있는지가 아닙니다.

할 수 없습니다.

더 유용한 질문은 다음과 같습니다.

AI 워크플로에서 애초에 생성형 모델이 필요하지 않았던 의사결정은 얼마나 많을까요?

만약 그 답이 “많다”라면, 소형 로컬 의사결정 모델은 실용적인 AI 인프라에서 빠져 있던 계층 중 하나가 될 수 있습니다.

Laya에 관해 자주 묻는 질문

Laya 모델이란 무엇인가요?

Laya는 Convai Innovations가 개발한 오픈 웨이트 비자기회귀 의사결정 모델입니다. 상태와 유형이 지정된 질문을 입력하면 자유 형식 텍스트를 생성하는 대신 선택지, 점수 또는 불리언 확률을 반환합니다.

Laya는 오픈 소스인가요?

모델 웨이트는 Apache 2.0 라이선스로 공개되어 있으며, 프로젝트에서 공개 추론, 평가, 미세 조정 리소스를 제공합니다.

Laya를 로컬에서 실행할 수 있나요?

예. 공식 구현은 PyTorch에서 실행되며, 커뮤니티 런타임은 Node.js의 ONNX와 Apple Silicon의 MLX를 지원합니다. 모델을 다운로드한 후에는 호스팅 추론 API가 필요하지 않습니다.

Laya가 Jev보다 더 나은가요?

항상 그런 것은 아닙니다. Laya는 오픈 웨이트, 셀프 호스팅, 미세 조정을 제공하는 반면, Jev는 관리형 호스팅 의사결정 서비스입니다. 공개된 벤치마크에 따르면 작업 유형과 보정 방식에 따라 서로 다른 강점을 보입니다.

Laya는 어떤 용도로 가장 적합한가요?

Laya는 라우팅, 중재, 관련성 점수 산정, 의도 감지, 이메일 분류, 안전성 검사, 그리고 더 큰 모델이나 사람이 대신 처리해야 할 시점을 결정하는 등 반복적인 제한형 의사결정에 가장 적합합니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.