모델 상주란 요청 사이에 호스트 또는 가속기 메모리에 모델 가중치를 유지하여 다음 추론에서 일부 또는 전체 로딩 작업을 생략하는 것을 의미합니다.
몇 분마다 사용하는 홈 어시스턴트는 8GB 모델이 GPU 메모리에 남아 있는 경우와 매번 스토리지에서 읽어야 하는 경우 체감이 크게 다릅니다. 상주는 여러 수준에서 이루어질 수 있습니다. 파일 시스템 캐시, 매핑된 호스트 페이지, 고정 RAM, 또는 커널에서 바로 사용할 수 있는 VRAM이 그 예입니다. 가중치를 메모리에 유지하면 시작 지연이 줄어들지만, 한정된 메모리를 예약하고 다른 모델이나 워크로드의 실행을 막을 수 있습니다.
상주는 재사용 가능한 모델 상태가 남아 있는 위치를 나타냅니다
콜드 모델은 스토리지에만 존재하므로 추론 전에 읽고, 할당하고, 변환하고, 복사해야 합니다. 호스트에 상주하는 가중치는 스토리지 읽기를 피하고, 가속기에 상주하는 가중치는 호스트에서 디바이스로 전송하는 과정과 런타임 초기화 과정도 피합니다. 이러한 차이는 이후 가정 환경 테스트에서도 확인할 수 있습니다.
NVIDIA의 모델 스트리밍 분석은 모델 로딩 경로를 전송 및 초기화 작업과 구분하여, 많은 콜드 스타트에서 가중치 위치가 중요한 이유를 보여 줍니다. 웜 프로세스에서도 토크나이저, 그래프, 어댑터 또는 캐시 초기화가 필요할 수 있습니다. 자동화를 진행하기 전에 중간 결과를 확인할 수 있는 상태로 유지해야 합니다.
상주는 활성 요청과 같은 의미가 아닙니다. 모델은 KV 캐시나 사용자 데이터 없이도 로드된 상태로 남아, 메모리와 일부 백그라운드 리소스를 사용하면서 서비스를 제공할 준비를 할 수 있습니다. 이러한 경계는 현실적인 운영 조건에서 별도로 측정해야 합니다.
메모리 계층 전반에 걸쳐 웜 상태가 존재합니다
프로세스가 종료된 뒤에도 운영 체제가 모델 페이지를 페이지 캐시에 유지할 수 있고, 메모리 매핑은 페이지를 지연 방식으로 불러올 수 있으며, 서빙 프로세스는 텐서를 RAM 또는 VRAM에 유지할 수 있습니다. 일반적으로 더 높은 웜 수준은 지연 시간을 줄이지만, 더 제한적인 리소스를 사용합니다.
ServerlessLLM은 스토리지, 호스트 메모리, GPU 메모리에 걸친 계층형 모델 로딩을 검토하고, 콜드 스타트 비용을 줄이도록 로딩을 예약합니다. 이 계층 구조는 캐시 압박으로 페이지가 축출되기 전까지 겉보기에는 로드되지 않은 모델도 빠르게 다시 시작될 수 있는 이유를 설명합니다.
양자화는 상주에 필요한 바이트 수를 줄여 여러 특화 모델이 공존하도록 할 수 있습니다. 그러나 실행 커널과 품질도 바꿀 수 있으므로, 메모리 절약을 아무런 대가 없는 용량 증가로 간주해서는 안 됩니다. 여러 소스가 제한된 컨텍스트를 두고 경쟁할 때 이러한 실질적인 영향이 나타납니다.
축출 정책은 메모리 압박을 시작 지연으로 바꿉니다
서비스는 자주 사용하는 모델을 상주시키고, 최근 사용 시점, 예상 수요, 우선순위 또는 로딩 비용에 따라 덜 사용되는 모델을 축출할 수 있습니다. 여러 모델을 라우팅하려면 즉시 응답해야 하는 음성 모델이 백그라운드 작업 때문에 축출되지 않도록 승인 규칙이 필요합니다.
FlexGen은 제한된 추론 환경에서 GPU, CPU, 스토리지 간 가중치 오프로딩을 보여 줍니다. 처리량을 목표로 하지만 핵심적인 절충을 분명히 드러냅니다. 즉, 계층 간 가중치를 이동하면 부족한 메모리를 절약할 수 있지만 전송 및 스케줄링 비용이 추가됩니다.
실패 경계는 메모리 압박으로 인해 스와핑, OOM 재시작 또는 축출 반복이 발생하는 지점입니다. 너무 많은 가중치를 로드한 상태로 유지하면 더 작은 작업 집합을 의도적으로 웜 상태로 유지하는 것보다 모든 모델이 느려지고 안정성도 떨어질 수 있습니다. 이 종속성은 최종 인터페이스에 명확히 드러나야 합니다.
재사용 거리와 메모리 여유를 기준으로 상주를 설정합니다
모든 모델에 대해 콜드, 호스트 웜, 가속기 웜 시작 시간을 측정한 다음 요청 간격, 로드 바이트 수, VRAM 및 RAM 사용량, 유휴 전력, 축출 횟수, 경쟁 워크로드 수요를 기록합니다. 따라서 결과는 원본 근거와 대조하여 확인해야 합니다.
시작 메커니즘을 메모리 매핑 시작과 비교합니다. 버스트, 긴 유휴 기간, 동시 모델 요청을 포함하여 후보 유지 시간과 우선순위에 따라 일주일간의 요청 도착을 재현합니다. 이러한 차이는 이후 가정 환경 테스트에서도 확인할 수 있습니다.
로드 지연을 피하는 효과와 재사용 빈도가 보호된 메모리를 정당화할 때 모델을 상주 상태로 유지합니다. 예약된 용량 때문에 대기열이나 반복 축출이 발생하면 모델을 축출하고, KV 캐시와 일시적 할당을 위한 비상 여유 공간을 확보합니다.
기술 및 AI 허브
더 읽어보기

임베딩 드리프트란 무엇이며, 프라이빗 검색 인덱스를 언제 다시 구축해야 할까요?
모델, 전처리, 코퍼스 및 쿼리 드리프트를 해석하고, 모니터링과 비호환성을 구분하며, 프라이빗 인덱스를 언제 재구축해야 하는지 판단하세요.

토크나이저 호환성이란 무엇이며, 모델 전환을 중단시킬 수 있는 이유는 무엇인가요?
로컬 모델 전환을 위한 어휘 식별자, 특수 토큰 의미, 채팅 템플릿, 캐시된 토큰, 어댑터 및 호환성 검사를 해독합니다.

추측 디코딩 수용률이란 무엇이며, 왜 중요한가요?
로컬 추론을 위한 수용 지표, 검증 초안, 거부 동작, 속도 향상 한계, 워크로드 변동 및 측정 방법을 해석하세요.

