추측 디코딩 수용률은 대상 모델의 검증 과정에서 제안된 초안 토큰이 얼마나 자주 유지되는지를 측정하며, 검증 한 번마다 얻는 유용한 작업량을 직접 좌우합니다.
더 작은 초안 모델은 향후 여러 토큰을 제안하고, 더 큰 로컬 모델은 이를 병렬로 검증할 수 있습니다. 대부분의 제안이 유지되면 비용이 큰 대상 모델 패스 한 번으로 응답이 여러 위치만큼 진행되지만, 초기에 거부되면 초안 작업의 상당 부분이 폐기됩니다. 따라서 이 수용률은 독립적인 정확도 점수나 엔드투엔드 속도 향상을 보장하는 지표가 아니라, 워크로드에 따라 달라지는 효율성 신호입니다.
수용 개수는 검증된 초안 진행량을 나타냅니다
표준 추측 샘플링에서는 초안 분포가 토큰 블록을 제안하고 대상 모델이 해당 위치들을 함께 평가합니다. 토큰은 첫 번째 거부가 발생할 때까지 순서대로 수용되며, 이후 알고리즘은 보정 토큰을 샘플링하고 새로운 추측 라운드를 시작합니다.
추측 디코딩에 관한 최초의 논문은 대상 모델의 출력 분포를 유지하면서 초안 분포와 대상 분포의 관계로부터 수용 확률을 정의합니다. 모델 답변 간의 시각적 유사성이 아니라, 수용된 진행량이 핵심적인 수량입니다.
구현에 따라 제안된 토큰 수 대비 수용된 토큰 수, 평균 수용 길이 또는 수용 확률을 보고할 수 있습니다. 이러한 지표는 서로 관련되어 있지만 동일하지 않으므로, 비교할 때는 동일한 정의와 초안 길이를 사용해야 합니다. 이러한 차이는 이후의 실제 가정용 테스트에서도 확인할 수 있습니다.
초안 품질과 샘플링 정책이 수용률을 바꿉니다
현재 언어, 도메인 및 프롬프트에서 대상 모델과 더 가까운 초안 모델일수록 수용 가능한 연속 토큰을 더 많이 제안하는 경향이 있습니다. 온도, top-p, 토크나이저 정렬, 초안 길이 및 대상 모델의 확신도 역시 블록이 유지되는 빈도를 바꿉니다.
Online Speculative Decoding은 대상 모델의 피드백을 바탕으로 초안 모델을 조정하며, 토큰 수용률을 높이면 변화하는 요청 분포 전반에서 지연 시간을 줄일 수 있다고 보고합니다. 이는 수용률이 고정된 모델 조합의 특성이 아니라 워크로드에 따라 변할 수 있음을 보여줍니다.
더 큰 초안 모델은 수용률을 높일 수 있지만 실행 비용이 더 많이 들고, 더 작은 초안 모델은 저렴하지만 자주 거부될 수 있습니다. 유용한 선택은 수용된 진행량과 초안 생성 및 검증에 걸리는 시간을 균형 있게 맞추는 것입니다. 자동화가 이어지기 전에 중간 결과를 계속 확인할 수 있어야 합니다.
높은 수용률은 속도 향상에 필요하지만 충분하지는 않습니다
엔드투엔드 성능 향상은 대상 모델이 블록을 효율적으로 검증할 수 있는지, 초안 생성 지연 시간, 메모리 트래픽, 동기화, 배치 크기 및 거부된 작업의 비용에도 좌우됩니다. 짧은 블록에서 높은 비율을 기록하더라도, 적절한 크기의 블록에서 중간 정도의 비율을 기록하는 경우보다 직렬 처리 단계를 적게 줄일 수 있습니다.
Medusa는 별도의 초안 모델 대신 여러 디코딩 헤드를 사용해 대상 모델의 표현에서 여러 연속 토큰을 제안합니다. 이 설계는 제안 아키텍처와 검증이 동일한 처리량 절충에 영향을 준다는 점을 보여줍니다. 이러한 경계는 현실적인 운영 조건에서 별도로 측정해야 합니다.
실패 경계는 초안 생성과 검증에 드는 비용이 일반 디코딩과 같아지는 워크로드입니다. 코드, 다국어 텍스트, 창의적 샘플링 또는 도메인 변화로 인해 수용 길이가 충분히 줄어들면, 추측 디코딩은 지연 시간을 줄이지 못한 채 추가 메모리만 사용할 수 있습니다.
밀리초당 수용된 진행량을 측정하세요
각 프롬프트 유형에 대해 제안된 토큰 수, 수용된 토큰 수, 수용된 접두사 길이, 초안 생성 시간, 대상 모델 검증 시간, 거부 위치, 총 지연 시간, 초당 토큰 수, 메모리 및 출력 동일성 검사를 기록하세요. 여러 소스가 제한된 컨텍스트를 두고 경쟁할 때 실질적인 효과가 나타납니다.
워크로드를 샘플링 정책과 연관 지어 분석하세요. 대상 모델과 요청된 분포를 고정한 채 초안 길이와 샘플링 설정을 변경하고, 일반적인 자기회귀 디코딩과 비교하세요. 이 의존성은 최종 인터페이스에 명시적으로 남아 있어야 합니다.
총 밀리초당 수용된 진행량이 향상되는 경우에만 추측 디코딩을 활성화하세요. 수용률이 높아 보이지만 지연 시간이 줄어들지 않는다면, 이 비율을 최종 성능 지표로 간주하지 말고 제안 및 검증 오버헤드를 최적화하세요. 따라서 결과는 원본 근거와 대조해 확인해야 합니다.
기술 및 AI 허브
더 읽어보기

임베딩 드리프트란 무엇이며, 프라이빗 검색 인덱스를 언제 다시 구축해야 할까요?
모델, 전처리, 코퍼스 및 쿼리 드리프트를 해석하고, 모니터링과 비호환성을 구분하며, 프라이빗 인덱스를 언제 재구축해야 하는지 판단하세요.

토크나이저 호환성이란 무엇이며, 모델 전환을 중단시킬 수 있는 이유는 무엇인가요?
로컬 모델 전환을 위한 어휘 식별자, 특수 토큰 의미, 채팅 템플릿, 캐시된 토큰, 어댑터 및 호환성 검사를 해독합니다.

모델 상주성이란 무엇이며, 로컬 AI 서비스는 언제 가중치를 로드된 상태로 유지해야 할까요?
가중치 상주, 캐시 수준, 콜드 스타트, 축출, 멀티플렉싱, 메모리 압박, 그리고 홈 AI 서비스를 웜 상태로 유지해야 하는 시점을 설명합니다.

