2026년에 홈 AI 추론은 왜 프리픽스 인식형 스케줄링을 도입하고 있을까요?

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

홈 AI 추론에서는 반복되는 시스템 프롬프트와 도구 스키마의 비용이 큰 프리필 계산을 재사용할 수 있기 때문에 접두사 인식 스케줄링을 도입하고 있습니다.

홈 어시스턴트는 고유한 질문을 처리하기 전에 시스템 지침, 도구 스키마, 안전 규칙, 가정 내 컨텍스트를 위해 수천 개의 동일한 토큰을 앞에 추가할 수 있습니다. 이러한 토큰을 다시 계산하면 첫 토큰 지연 시간이 늘어납니다. 접두사 인식 스케줄링은 반복되는 가정 내 워크플로를 여러 사용자가 동시에 실행하는 상황에서, 하나의 워밍된 접두사가 대기열을 독점하지 않도록 하면서 일치하는 요청을 재사용 가능한 캐시 상태로 보내려 합니다.

반복되는 접두사는 프롬프트 기록을 재사용 가능한 계산으로 바꿉니다

홈 어시스턴트는 고유한 사용자 텍스트를 처리하기 전에 동일한 시스템 프롬프트, 도구 스키마, 가정 내 정책, RAG 지침을 반복해서 전송합니다. 프리필은 이러한 토큰의 어텐션 상태를 계산합니다. 동일한 접두사가 다시 나타나면 캐시된 KV 블록을 사용해 해당 작업의 상당 부분을 건너뛸 수 있습니다.

SGLang의 접두사 공유 설계는 래딕스 트리를 사용해 요청 간 공통 접두사를 공유합니다. 이 설계는 프롬프트 중복을 스케줄링 및 메모리 리소스로 취급합니다.

캐싱은 일치하는 상태가 여전히 존재하는 곳으로 이후 요청이 전달될 때만 도움이 됩니다. 접두사 지역성을 무시하는 스케줄러는 관련 없는 컨텍스트를 수용하는 동안 작업을 콜드 프로세스로 보내거나 재사용 가능한 블록을 축출할 수 있습니다.

이제 스케줄링은 대기 시간과 캐시 지역성의 균형을 맞춥니다

접두사 인식 스케줄러는 요청이 얼마나 오래 대기했는지와 각 워커에서 재사용할 수 있는 프롬프트 토큰이 몇 개인지를 함께 고려합니다. 재사용하면 첫 토큰 시간과 프리필 계산량이 줄어들지만, 모든 요청을 하나의 워밍된 워커로 보내면 불공정한 대기열이 생길 수 있습니다.

한 오픈 추론 스택은 배포 패턴으로 접두사 캐시 라우팅과 계층형 접두사 캐시를 명시적으로 제시합니다. 이러한 항목이 포함된 것은 캐시 지역성이 서비스 제공의 핵심 신호가 되고 있음을 보여줍니다.

단일 홈 GPU에서는 같은 원칙에 따라 요청 수용 순서를 정하거나 세션 간 블록을 유지합니다. 이점은 안정적인 템플릿과 반복되는 대규모 도구 정의를 사용하는 에이전트에서 가장 크며, 서로 관련 없는 일회성 프롬프트에서는 크지 않습니다.

접두사 인식이 도움이 되지 않는 경우

프롬프트 앞부분의 토큰 하나만 바뀌어도 그 이후의 재사용이 무효화될 수 있습니다. 동적 타임스탬프, 재정렬된 도구 스키마, 사용자별 비밀 정보, 일관되지 않은 직렬화는 공통 접두사를 줄입니다. 그러면 캐시 조회와 유지에 메모리를 사용하면서도 계산량은 거의 절약하지 못합니다.

정확한 접두사 일치에 대한 설명에 따르면 재사용에는 의미가 비슷한 것만으로는 부족하고, 동일한 토큰 접두사가 필요합니다. 토큰화와 프롬프트 구성은 안정적으로 유지되어야 합니다.

이 추세는 짧은 프롬프트에서 디코드 시간이 지배적일 때나 가끔씩 단 하나의 요청만 실행될 때에도 효과가 없습니다. 캐시 보존량을 늘리면 활성 KV 상태를 위한 공간이 줄어들어 오히려 성능이 저하될 수 있습니다. 접두사 인식은 최적화일 뿐 품질 향상은 아닙니다.

대기열 고갈을 일으키지 않고 접두사 재사용을 측정하는 방법

토큰화된 접두사 해시, 일치한 토큰 수, 캐시 적중률, 프리필 시간, 대기열 시간, 첫 토큰 지연 시간, 축출 횟수를 기록합니다. 안정적인 시스템 프롬프트와 의도적으로 변경한 시스템 프롬프트를 사용하는 가정 내 요청을 한 세션과 여러 동시 세션에서 재생합니다.

디스크 또는 모델 콜드 스타트가 접두사 절감 효과를 가릴 수 있으므로 로컬 AI 콜드 스타트와 비교합니다. 스케줄링 효과를 측정하기 전에 동일한 가중치를 워밍업합니다.

반복되는 접두사 요청에서 프리필이 의미 있게 줄어들고 가장 오래 기다린 요청의 지연 시간이 목표치를 넘지 않을 때 접두사 인식 순서를 도입합니다. 도구 순서를 표준화하고, 타임스탬프를 안정적인 콘텐츠 뒤로 옮기며, 사용자별로 민감한 접두사를 분리하고, 캐시 메모리 용량을 제한합니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.