로컬 모델 서버 메모리는 일반적으로 캐시와 할당자가 재사용 가능한 블록을 보유하기 때문에 서서히 증가하지만, 해제되지 않는 참조나 네이티브 누수로 인해 실제로 증가할 수도 있습니다.
홈 서버 요청이 끝날 때마다 대시보드에서 RAM 또는 VRAM 사용량이 증가하고 원래 기준으로 돌아오지 않는 것처럼 보일 수 있습니다. 런타임은 KV 블록, 프리픽스 항목, 커널, 그래프, 작업 공간, 해제된 텐서 블록을 보유해 재사용할 수 있습니다. 프롬프트 길이가 일정하지 않으면 풀이 조각화될 수 있고, 로깅, 세션, 이미지 버퍼 또는 확장 기능이 객체를 무기한 보유할 수도 있으므로 이러한 메커니즘은 서로 다른 근거와 제한을 적용해야 합니다.
캐싱 할당자는 해제된 블록을 재사용하기 위해 예약합니다
GPU 프레임워크는 비용이 큰 디바이스 할당을 피하기 위해 해제된 블록을 프로세스 소유 풀에 보관합니다. 애플리케이션 텐서가 사라진 뒤에도 드라이버는 모델 서버가 예약한 풀을 사용 중인 것으로 보고할 수 있습니다. 이러한 차이는 이후의 가정용 테스트에서도 확인할 수 있습니다.
캐시된 GPU 메모리 블록이 CUDA 블록을 반올림하고, 분할하고, 병합하고, 캐시하는 방식을 할당자 분석으로 설명할 수 있습니다. 요청 후 할당된 텐서 메모리는 감소하지만 예약된 메모리는 높게 유지되고, 이후 요청에서 이를 재사용하는 것이 전형적인 신호입니다.
이러한 평탄화 구간이 자동으로 누수를 의미하는 것은 아닙니다. 풀이 다른 서비스의 할당을 막거나, 워밍업 후 동일한 형태의 요청을 반복할 때 계속 확장될 경우 문제가 됩니다. 자동화가 이어지기 전에 중간 결과를 계속 확인할 수 있어야 합니다.
서빙 캐시와 요청 형태는 의도된 작업 집합을 확장합니다
KV 캐시는 활성 컨텍스트에 따라 증가하고, 프리픽스 캐시는 재사용 가능한 프롬프트를 보유하며, 컴파일된 그래프나 커널은 관찰된 배치 형태를 포괄합니다. 새로운 컨텍스트 길이, 모달리티, 동시성 프로필로 인해 요청 사이에 항목이 추가될 수 있습니다. 이러한 경계는 현실적인 운영 조건에서 별도로 측정해야 합니다.
LLM 메모리 조각화에 관한 연구는 LLM 서빙에서 활성화 메모리 공간과 KV 캐시 메모리 공간 사이의 조각화를 확인합니다. 이는 단일 활성 요청이 크지 않더라도 전체 용량이 증가할 수 있는 이유를 설명합니다. 제한된 컨텍스트를 여러 원인이 함께 사용할 때 이러한 실질적 결과가 나타납니다.
캐시 항목 수와 형태 클래스를 기록하세요. 작업 분포가 안정된 뒤 증가가 멈추면 제한된 워밍업에 해당하지만, 전체 요청 수나 고유 세션 ID 수에 비례해 증가하면 누락된 제거 정책을 의심해야 합니다. 이 종속성은 최종 인터페이스에서 명시적으로 유지되어야 합니다.
보유된 CPU 객체와 네이티브 버퍼는 실제 증가를 일으킵니다
요청 기록, 스트리밍 큐, 메트릭 레이블, 토크나이저 출력, 업로드된 이미지, 페이지 고정 호스트 버퍼, 확장 기능 할당은 요청이 완료된 뒤에도 참조된 상태로 남을 수 있습니다. GPU 스냅샷이 안정적으로 보여도 프로세스 RSS는 계속 증가할 수 있습니다. 따라서 결과는 원래 근거와 대조해 확인해야 합니다.
할당된 메모리와 예약된 메모리에 대한 실용적 조사는 할당된 메모리, 예약된 메모리, 프로세스 메모리 신호를 구분합니다. 이러한 계층적 관점은 CPU 측 보유 문제를 GPU 할당자 동작으로 잘못 진단하는 일을 방지합니다. 이 차이는 이후의 가정용 테스트에서도 확인할 수 있습니다.
한 번 증가한 뒤 안정적인 최고점을 유지하는 것이 실패 경계입니다. 캐시 제한, 가비지 컬렉션, 예상되는 풀을 모두 고려한 뒤에도 통제된 동일 요청에서 보유된 할당이 계속 증가하고, 그 스택이 소유자를 가리킬 때만 이를 누수라고 부르세요.
요청별 메모리 보유 곡선을 구축하세요
수백 개의 동일한 요청을 재생한 다음 길이와 모달리티를 섞어 테스트하면서 GPU 할당 및 예약 바이트, KV 및 프리픽스 항목, 그래프 캐시, 페이지 고정 메모리, 프로세스 RSS, 객체 수, 요청 세션, 워커 재시작, 할당자 스냅샷을 기록하세요.
요청 후 메모리 예약을 사용해 의도적인 요청 후 예약을 구분하세요. 모델과 동시성은 고정한 채 각 선택적 캐시, 확장 기능, 업로드 경로, 메트릭 레이블을 개별적으로 비활성화하고 반복하세요. 자동화가 이어지기 전에 중간 결과를 계속 확인할 수 있어야 합니다.
선언된 메모리 예산 안에서 제한된 워밍업이 평탄화되는 경우 이를 허용하세요. 캐시 카디널리티가 이점 없이 증가하면 제거를 추가하고, 조각화가 지배적이면 요청 형태를 정규화하며, 보유된 할당 스택이 소유자를 가리킨 뒤에만 실제 누수를 격리하세요.
기술 및 AI 허브
더 읽어보기

원격 홈 AI 인터페이스에서 WebSocket 재연결 루프를 일으키는 원인은 무엇인가요?
핸드셰이크, 프록시, 인증, 하트비트, 네트워크 경로, 세션 복구 및 클라이언트 백오프 계층 전반에서 WebSocket 루프를 진단합니다.

중단된 전송 후 백업 체크섬이 일치하지 않는 원인은 무엇인가요?
소스 스냅샷, 청크 매니페스트, 재개 오프셋, 부분 파일, 변환, 스토리지 쓰기 및 최종 검증을 거쳐 체크섬 불일치를 추적하세요.

프라이빗 지식 그래프에서 중복된 가구 엔터티가 생성되는 원인은 무엇인가요?
추출 변형, 식별 키, 해결 임계값, 출처 계보, 동시 병합을 분리하여 지식 그래프의 중복 노드를 진단하세요.

