GPU에서 CPU로의 장애 조치는 서비스가 메모리 고갈로 활성 요청이 중단되기 전에 호환 가능한 보조 실행 경로를 계획한 경우에만 작동합니다.
홈 AI 서버는 장시간 프롬프트로 메모리가 안전 한계를 초과하기 전까지 하나의 가속기에서 음성 인식, 이미지 검색, LLM을 실행할 수 있습니다. 단순히 메모리 부족 오류를 감지하는 것은 모델 상태가 일관되지 않은 경우 이미 늦습니다. 안정적인 장애 조치에는 요청 허가 제어, 호환 가능한 CPU 가중치, 이전 가능한 요청 상태, 제한된 큐, 상태 신호, 명확한 성능 저하 서비스 정책이 필요합니다.
요청 허가 제어로 할당 실패 전에 압박 상태 감지
게이트웨이는 GPU 요청을 수락하기 전에 모델 가중치, KV 캐시 증가량, 임시 텐서, 배치 크기, 메모리 단편화를 추정합니다. 예약된 여유 공간은 커널과 동시 작업을 보호하고, 메모리 압박 임계값은 요청을 지연하거나 축소하거나 오프로딩하거나 다른 경로로 라우팅할지 결정합니다.
페이지 방식 KV 메모리는 GPU 메모리를 페이지 블록으로 취급하므로, 서버가 단편화를 줄이고 KV 캐시 용량을 더 효율적으로 공유할 수 있습니다. 이를 통해 안전한 작동 한계가 높아지지만, 메모리가 무한히 늘어나는 것은 아니며 명시적인 오버플로 경로를 대신할 수도 없습니다.
실제 장애 조치 결정에는 예측된 사용량과 관측된 사용량이 모두 필요합니다. 캐시된 할당자, 대기 중인 커널, 다른 서비스의 예약 공간이 확인 시점 이후 다음 할당 전에 공간을 사용할 수 있으므로, 여유 메모리 수치만으로는 오해가 생길 수 있습니다.
CPU 경로는 호환 가능한 모델 상태를 재구성해야 함
CPU 실행에는 GPU 경로와 동일한 토크나이저, 모델 버전, 양자화 의미, 프롬프트 템플릿, 샘플링 설정, 중지 규칙이 필요합니다. 서비스는 복구 시간 예산에 따라 CPU 복제본을 미리 실행 상태로 유지하거나, 가중치를 메모리 매핑하거나, 필요할 때 로드할 수 있습니다.
CPU-GPU 하이브리드 추론은 소비자용 하드웨어에서 CPU와 GPU 전반의 예측 가능한 활성화 희소성을 활용하는 하이브리드 추론을 보여줍니다. 이 설계는 CPU 참여를 단순한 비상용 복사본이 아니라 계획된 실행 모드로 취급할 수 있음을 보여줍니다.
이미 토큰을 생성한 요청은 KV 캐시와 무작위 상태를 이전하거나 다시 계산해야 하므로 이동하기가 더 어렵습니다. 따라서 많은 홈 서비스에서는 토큰 중간의 원활한 마이그레이션을 보장하기보다 요청 경계에서 장애 조치를 수행하고 멱등적으로 재시도해야 합니다.
상태 확인, 큐, 성능 저하 모드로 영향 범위 제한
회로 차단기는 반복적인 할당 오류, 드라이버 재설정 또는 상태 확인 실패가 발생하면 GPU를 사용할 수 없는 상태로 표시합니다. 새 작업은 동시성 제한, 더 짧은 컨텍스트 한도 또는 더 작은 대체 모델이 적용된 별도의 CPU 큐로 들어가므로, 느린 요청으로 호스트 전체가 마비되는 것을 방지할 수 있습니다.
계층형 추론 배치는 CPU, GPU, 스토리지 배치를 조정하여 가속기 메모리를 초과하는 모델을 실행합니다. 결과는 빠른 메모리에 들어맞는 경우와 느린 계층에 의존하는 경우의 큰 지연 시간 차이를 보여줍니다. 이러한 차이는 이후 가정 환경 테스트에서도 확인됩니다.
실패의 경계는 CPU 장애 조치가 동일한 서비스 수준을 유지한다고 가장하는 것입니다. GPU에서 20초 걸리는 모델이 CPU에서는 몇 분이 걸릴 수 있으며, 지원되지 않는 커널은 전혀 실행되지 않을 수 있습니다. 인터페이스는 요청을 조용히 멈추는 대신 대체 모델, 제한 사항, 예상 지연 시간, 취소 기능을 표시해야 합니다.
제어된 메모리 압박에서 장애 조치 검증
사용 가능한 메모리를 점진적으로 줄이면서 짧은 프롬프트, 긴 프롬프트, 동시 요청, 다른 GPU 작업을 재현합니다. 사전 요청 허가 라우팅, 생성 전 할당 실패, 드라이버 재설정, CPU 큐에서의 취소를 각각 트리거합니다. 자동화가 진행되기 전에 중간 결과를 확인할 수 있어야 합니다.
결과를 GPU 메모리 폴백의 폴백 경계와 비교합니다. 성공률, 중복 부작용, 예상되는 경우의 토큰 동등성, p95 지연 시간, 큐 대기 시간, 호스트 RAM, 복구 시간, 사용자가 성능 저하 모드 상태를 확인했는지를 기록합니다.
수락된 요청이 사라지지 않고 CPU 라우팅으로 시스템 메모리가 고갈되지 않을 때만 통과로 판정합니다. 요청 중간의 마이그레이션으로 출력이 변경되거나 도구 작업이 반복된다면 장애 조치를 안전한 체크포인트로 제한하고, 그 외의 경우에는 재개 가능한 오류를 반환합니다.
기술 및 AI 허브
더 읽어보기

민감한 파일을 보호하는 홈 AI 신뢰 경계를 구현하는 기능은 무엇인가요?
분류, 기능 범위로 제한된 액세스, 격리된 파싱, 검색 필터, 이그레스 정책, 승인 및 감사가 민감한 홈 파일을 어떻게 안전하게 보호하는지 확인해 보세요.

어떤 요인이 머클 트리 백업에서 무음 변경을 효율적으로 감지할 수 있는지를 결정하나요?
청크 크기, 팬아웃, 신뢰할 수 있는 루트, 캐시된 해시, 변경 지역성, 메타데이터 범위, 스크러빙이 Merkle 백업 검증 비용을 어떻게 결정하는지 알아보세요.

AI 인덱스와 모델 상태를 검증 가능한 방식으로 백업하려면 어떤 구성 요소가 필요한가요?
조정된 스냅샷, 콘텐츠 매니페스트, 체크섬, 버전 잠금, 복원 훈련 및 쿼리 테스트를 통해 AI 상태를 실제로 복구할 수 있음을 확인해 보세요.

