RAID 스크럽은 공유 스토리지 경로에서 검증 읽기가 모델 로딩, 검색, 로깅 또는 메모리 압박과 경쟁할 때 로컬 추론 지연 시간을 증가시킵니다.
GPU 메모리에 이미 상주한 모델은 스크럽 중에도 정상적으로 디코딩할 수 있지만, 첫 요청, RAG 조회 또는 스필 작업은 갑자기 느려질 수 있습니다. 스크럽은 할당된 데이터를 순회하고, 중복 복사본 또는 패리티를 읽어 무결성을 검증하며, 손상을 복구할 수도 있습니다. 스크럽의 영향은 RAID라는 단어 자체보다 추론에 여전히 필요한 디스크, 컨트롤러 큐, CPU 사이클 및 캐시 페이지에 따라 달라집니다.
스크럽은 유휴 용량을 검증 I/O로 전환합니다
스크럽은 할당된 블록을 체계적으로 읽고, 체크섬 또는 패리티를 검증하며, 중복성이 허용하는 경우 손상된 데이터를 재구성합니다. 정상적인 어레이에서도 읽기 및 검증 작업은 수행되므로, 이 작업으로 모든 구성 디스크가 몇 시간 동안 바쁘게 작동할 수 있습니다.
OpenZFS는 스크럽 및 리실버 작업을 일반 읽기 및 쓰기와의 균형을 맞추는 별도의 스크럽 I/O 클래스로 설명합니다. 스크럽 활동을 늘리면 검증을 더 빨리 완료할 수 있지만 포그라운드 작업의 지연 시간이 증가할 수 있습니다.
회전식 디스크 어레이에서는 스크럽 읽기가 작은 무작위 요청과 뒤섞일 때 헤드 이동이 발생하고, SSD 어레이에서는 컨트롤러 대역폭 또는 내부 플래시 채널이 포화될 수 있습니다. 따라서 동일한 명목 처리량이라도 테일 지연 시간은 매우 다르게 나타날 수 있습니다.
추론은 공유 종속성을 통해서만 스크럽의 영향을 받습니다
메모리에 완전히 상주한 가중치와 KV 캐시에서 토큰을 디코딩하는 작업은 주로 연산 및 메모리 대역폭을 사용하는 워크로드입니다. 스토리지는 모델 로드, 메모리 매핑 페이지 폴트, 검색, 프롬프트 로깅, 어댑터 교체, KV 오프로드 또는 체크포인트와 인덱스에 액세스할 때 드러납니다.
OpenZFS는 스크럽 작업이 디스크 읽기를 실행하며 스캔 순서에 따라 작업이 풀에 도달하는 방식이 달라진다고 설명합니다. 이러한 스캔 스케줄링 제어는 유용한 캐시 페이지를 축출하거나 지연 시간에 민감한 모델 또는 벡터 읽기가 도착하기 전에 큐를 점유할 수 있습니다.
CPU 체크섬 작업과 패리티 재구성도 토큰화, 검색 또는 CPU 추론과 경쟁할 수 있습니다. 관찰되는 지연은 출력 토큰/초의 균일한 감소가 아니라 첫 토큰 지연, 검색 지연 또는 주기적인 멈춤으로 나타날 수 있습니다.
스로틀링은 완료 시간과 테일 지연 시간 사이에서 절충합니다
스크럽 동시성을 제한하거나 대화형 사용 시간 동안 검증을 일시 중지하면 추론에 더 많은 큐 용량을 남길 수 있지만, 잠재적 오류가 발견되지 않은 상태로 남는 기간은 늘어납니다. 수요를 예측할 수 있고 유지 관리 목표 내에 스크럽을 완료할 수 있을 때만 일정 조정만으로 충분한 효과를 얻을 수 있습니다.
OpenZFS 튜닝 가이드는 스크럽 지연을 늘리면 동적 워크로드에 미치는 스크럽의 영향을 줄일 수 있다고 설명합니다. 미러, RAID-Z 그룹, SATA SSD 및 NVMe 풀이 서로 다른 병목을 드러내므로 적절한 설정은 하드웨어와 워크로드에 따라 달라집니다.
장애 경계는 성능 저하 어레이 또는 진행 중인 복구입니다. 데이터 재구성은 대화형 지연 시간보다 우선할 수 있으며, 과도한 스로틀링은 취약 상태를 prolong할 수 있습니다. 올바른 대응은 빠른 챗봇 뒤에 스토리지 위험을 숨기는 것이 아닙니다.
추론 핵심 경로를 기준으로 스크럽 하나를 프로파일링하세요
검증 전과 검증 중에 첫 토큰까지의 p50 및 p99 시간, 토큰 속도, 검색 지연 시간, 모델 페이지 폴트, 디스크 큐 깊이, 읽기 지연 시간, 처리량, CPU 사용량, ARC 또는 페이지 캐시 크기, 스크럽 진행률을 측정하세요. 이러한 차이는 이후 가정 내 테스트에서도 확인할 수 있습니다.
스냅샷 스토리지 경합을 사용해 스냅샷 경합과 스크럽 경합을 구분하세요. 모델 상주 및 콜드 상태, RAG 활성화 및 비활성화, 일반 및 제한된 스크럽 동시성, 스토리지만 사용하는 기준 조건으로 반복 테스트를 수행하세요. 자동화가 이어지기 전에 중간 결과를 검토할 수 있어야 합니다.
대화형 테일 지연 시간을 보호하면서도 무결성 검사를 일정에 맞춰 완료할 수 있는 제한을 선택하세요. GPU 상주 디코딩에는 영향이 없지만 검색이 멈춘다면 모델을 조정하는 대신 공유 스토리지 경로를 격리하거나 우선순위를 높이세요.
기술 및 AI 허브
더 읽어보기

임베딩 드리프트란 무엇이며, 프라이빗 검색 인덱스를 언제 다시 구축해야 할까요?
모델, 전처리, 코퍼스 및 쿼리 드리프트를 해석하고, 모니터링과 비호환성을 구분하며, 프라이빗 인덱스를 언제 재구축해야 하는지 판단하세요.

토크나이저 호환성이란 무엇이며, 모델 전환을 중단시킬 수 있는 이유는 무엇인가요?
로컬 모델 전환을 위한 어휘 식별자, 특수 토큰 의미, 채팅 템플릿, 캐시된 토큰, 어댑터 및 호환성 검사를 해독합니다.

모델 상주성이란 무엇이며, 로컬 AI 서비스는 언제 가중치를 로드된 상태로 유지해야 할까요?
가중치 상주, 캐시 수준, 콜드 스타트, 축출, 멀티플렉싱, 메모리 압박, 그리고 홈 AI 서비스를 웜 상태로 유지해야 하는 시점을 설명합니다.

