디코딩 설정은 다음 토큰으로 선택할 수 있는 후보를 재구성하고 각 선택에서 확률 차이가 영향을 미치는 정도를 조절하여 로컬 LLM의 동작을 바꿉니다.
홈 모델은 하나의 사실 질문에는 일관되게 답하면서도 긴 음성 세션에서는 반복적으로 답하거나 창의적인 글쓰기에서는 불안정해질 수 있습니다. 가중치는 변하지 않습니다. 디코더가 매 단계마다 확률 분포에서 다르게 선택할 뿐입니다. 온도, 절단, 반복 패널티, 시드, 컨텍스트가 함께 작용하여 출력이 익숙한 반복 루프로 수렴할지, 아니면 확률이 낮은 다음 문맥으로 벗어날지를 결정합니다.
토큰을 선택하기 전에 온도가 확신도를 재조정합니다
각 단계에서 모델은 가능한 토큰에 로짓을 할당합니다. 온도는 정규화 전에 이러한 로짓을 재조정합니다. 낮은 값은 차이를 더 뚜렷하게 만들어 상위 후보를 선호하게 하고, 높은 값은 차이를 완화하여 낮은 순위 후보에도 더 많은 확률을 부여합니다. 탐욕적 디코딩은 샘플링을 건너뛰고 현재 최댓값을 항상 선택합니다.
기술적 설명에서는 온도와 토큰 필터를 구분합니다. 온도는 분포 전반의 상대적 확률을 바꾸고, top-k는 고정된 수의 후보를 유지하며, top-p는 누적 확률 질량이 특정 값에 도달하는 가장 작은 후보 집합을 유지합니다. 이러한 제어 방식은 서로 관련되어 있지만 서로 대체할 수는 없습니다.
낮은 무작위성은 형식과 사실을 설명하는 표현을 안정화할 수 있지만, 국소적으로 매력적인 동일한 다음 문맥을 반복해서 선택하게 만들 수도 있습니다. 높은 무작위성은 이러한 경로에서 벗어나는 데 도움이 되지만 오류도 허용할 수 있습니다. 따라서 안정성은 단순히 온도를 가장 낮추는 것이 아니라 작업에 맞게 분산을 제어하는 것을 의미합니다.
동적 필터는 확신도가 변할 때 후보 집합을 바꿉니다
Top-p는 누적 확률을 사용하므로 모델이 확신하지 못할 때 후보 수가 늘어나고, 하나의 토큰이 지배적일 때 줄어듭니다. 반면 min-p는 가장 확률이 높은 토큰을 기준으로 상대적인 임계값을 설정하여, 고정된 누적 확률 질량을 목표로 하지 않고 확신도에 맞춰 컷오프를 조정합니다.
min-p 샘플링에 관한 연구는 테스트한 높은 온도 설정에서 top-p보다 더 나은 창의성과 다양성을 보였다고 보고합니다. 이 메커니즘은 국소적으로 중요합니다. 소형 모델이나 양자화된 모델은 호스팅 인터페이스가 기본값에서 가정하는 것보다 더 뾰족하거나 노이즈가 많은 분포를 가질 수 있기 때문입니다.
필터는 무작위 추출 전에 작동하고, 패널티는 이전 토큰을 바탕으로 점수를 수정합니다. 공격적인 절단과 강한 반복 패널티를 결합하면 어색한 대안만 남을 수 있어, 각 설정을 따로 보면 보수적으로 보이더라도 출력이 불안정해 보일 수 있습니다.
더 많은 무작위성이 자연스러움을 향상하지 못하는 지점
창의적 다양성과 추론 정확도는 함께 움직이지 않습니다. 높은 온도는 다양한 이야기를 만들어 낼 수 있지만 산술, 코드, 인용의 충실성, 구조화된 출력을 손상할 수 있습니다. 반대로 탐욕적 디코딩은 제약이 강한 추출 작업에는 적합할 수 있지만 대화에서는 경직되게 들릴 수 있습니다.
선택적 샘플링에 관한 연구는 민감한 토큰 위치에서 높은 온도의 선택이 추론을 저하시킬 수 있음을 확인했으며, 균일한 무작위성보다 선택적 무작위성을 제안합니다. 하나의 전역 설정으로 모든 작업의 모든 부분을 최적화할 수는 없습니다. 이 차이는 가정에서 최종적으로 내리는 선택을 바꿉니다.
실패의 경계는 출력이 작업의 제약을 위반할 때 나타납니다. 잘못된 JSON, 근거 없는 주장, 깨진 코드, 반복되는 루프 등이 그 예입니다. 샘플링은 약한 프롬프트, 부족한 컨텍스트, 부적합한 모델, 손상된 대화 기록을 복구할 수 없습니다. 샘플링은 사용 가능한 확률 중에서 선택하는 방식만 바꿀 뿐입니다.
재현 가능한 샘플링 테스트 그리드 구축
대표적인 프롬프트 세 가지를 선택합니다. 결정론적 추출, 일반적인 대화, 자유로운 생성입니다. 모델 파일, 양자화 방식, 프롬프트, 컨텍스트, 최대 토큰 수를 고정합니다. 각 항목을 온도와 하나의 절단 방식으로 구성한 작은 그리드에서 실행하고, 고정된 시드와 여러 무작위 시드를 모두 사용합니다.
잘못된 출력, 동일한 구문의 반복, 고유 토큰 비율, 작업 정확도, 지연 시간을 기록합니다. 이를 통해 긴 컨텍스트의 일관성 문제와 디코딩을 구분할 수 있습니다. 긴 대화 컨텍스트는 답변 품질을 독립적으로 낮출 수 있습니다. 이 경계는 이후 근거를 검토하는 과정에서도 확인할 수 있습니다.
모든 작업에 하나의 보편적인 값을 적용하지 말고 작업 부하별로 별도의 프리셋을 선택합니다. 다양성은 높아지지만 작업의 엄격한 제약을 충족하지 못하는 프리셋은 제외하고, 모델, 양자화 방식, 프롬프트 템플릿 또는 반복 패널티를 변경한 뒤 그리드를 다시 실행합니다.
기술 및 AI 허브
더 읽어보기

다국어 임베딩: 하나의 벡터 공간이 여러 언어의 가정용 문서를 연결하는 방법
정렬된 임베딩이 언어 간 문서를 어떻게 연결하는지, 검색 품질이 달라지는 이유와 언어 간 근거 커버리지를 로컬에서 테스트하는 방법을 알아보세요.

에이전트 메모리 충돌: 최근 수정 사항이 반복되는 오래된 사실에 밀릴 수 있는 이유
중복된 오래된 메모리가 어떻게 정정을 압도하는지, 최신성 규칙이 실패하는 경우와 개인 에이전트 메모리 저장소에서 대체 여부를 테스트하는 방법을 알아보세요.

비공개 검색 재순위 지정: 두 번째 모델이 최종 근거 순서를 바꾸는 방식
1단계 유사도와 2단계 관련성이 왜 일치하지 않는지, 재순위 지정이 비공개 RAG에 언제 도움이 되는지, 그리고 재정렬된 근거를 평가하는 방법을 알아보세요.

