공개된 웨이트로 로컬에서 전체 Kimi K3 실행은 가능하지만, 실용적인 배포는 여전히 클러스터 규모의 메모리, 가속기 및 인터커넥트를 필요로 합니다.
7월 27일 오픈 웨이트 공개 이후, 체크포인트 존재 여부가 아니라 시스템이 이를 다운로드, 로드, 유용한 속도로 서빙할 수 있는지가 문제입니다. 공개 저장소는 96개의 safetensor 샤드에 걸쳐 약 1.56TB이며, 모델은 총 2.8조 파라미터를 포함하고 토큰당 1040억 개를 활성화합니다. 이 수치는 일반 PC, Mac, 가정용 NAS 또는 단일 GPU 서버가 실용적인 전체 모델 범위 밖에 있음을 의미하므로, 아래 섹션에서는 저장소, 메모리, 가속기 토폴로지, 런타임 지원 및 현실적인 대체 경로를 구분합니다.
| 출시 후 점검 | 현재 답변 |
|---|---|
| 전체 웨이트가 제공되나요? | 예. 모델 저장소와 기술 보고서는 공개되어 있습니다. |
| 일반 PC, Mac 또는 가정용 NAS가 전체 모델을 실용적으로 실행할 수 있나요? | 아니요. 실험적 오프로딩은 작업의 일부를 실행할 수 있지만, 대화형 전체 모델 서빙은 여전히 클러스터 규모 작업입니다. |
| 다운로드 가능한 저장소 크기는 얼마인가요? | 추가 임시 저장소 및 런타임 데이터를 제외한 96개의 safetensor 샤드에 걸쳐 약 1.56TB입니다. |
| 투명한 웨이트 전용 최소 용량은 얼마인가요? | 4비트당 2.8조 파라미터 기준 약 1.4TB, 즉 1.27TiB입니다. |
| 현재 추천되는 서빙 엔진은 무엇인가요? | vLLM, SGLang, TokenSpeed는 Kimi K3 전용 배포 경로를 사용합니다. |
Kimi K3 웨이트가 공개된 지금 무엇을 사용할 수 있나요?
Kimi K3 오픈 웨이트 공개에는 전체 모델 체크포인트와 기술 보고서가 포함되어 있습니다. 공개된 모델 저장소는 현재 약 1.56TB의 파일과 96개의 번호가 매겨진 safetensor 샤드를 보여줍니다. 이 수치는 다운로드 및 디스크 용량 계획에 유용하지만 최소 VRAM 사양은 아닙니다.
공개된 모델 요약에 따르면 총 2.8조 파라미터, 1040억 활성화 파라미터, 93개 레이어, 69개의 Kimi 델타 어텐션 레이어, 24개의 게이트드 MLA 레이어가 확인됩니다. Stable LatentMoE 라우팅은 토큰당 896명의 라우팅된 전문가 중 16명을 선택하며, 두 명의 공유 전문가도 사용합니다. 가중치는 MXFP4, 활성화는 MXFP8이며, 광고된 최대 컨텍스트는 1,048,576 토큰입니다.
배포 지원도 출시 전보다 더 구체적입니다. vLLM, SGLang, TokenSpeed가 권장 추론 엔진으로 나열되어 있지만 각각은 K3 인식 커널, 모델 코드, 샤딩 및 메모리 설정이 필요합니다. 클라이언트 라이브러리가 보여주는 일반 명령어가 체크포인트를 소비자 규모의 로컬 모델로 바꾸지는 않습니다.
왜 희소 MoE가 여전히 막대한 메모리를 요구하는가?
Kimi K3는 각 토큰에 대해 1,040억 활성화된 매개변수로 계산을 수행하지만 모든 MoE 전문가가 여전히 저장 및 서비스 메모리를 소비합니다. 라우터는 다음 토큰에 대해 다른 전문가를 선택할 수 있으므로 전체 2.8조 가중치 세트는 배포 어딘가에 접근 가능해야 합니다.
896명의 라우팅된 전문가 중 16명을 선택하는 것은 한 토큰에 대해 수행되는 전문가 작업을 줄입니다. 이것은 기계가 16명의 전문가만 유지하고 나머지는 버리면서도 출시된 모델을 변경 없이 실행할 수 있다는 의미가 아닙니다. 전문가 가지치기, 증류 또는 스트리밍은 다른 운영 트레이드오프를 만들며 일반 희소 활성화와 혼동해서는 안 됩니다.
따라서 1,040억 활성화된 수치는 계산 규모를 설명하는 것이며, 체크포인트 크기를 추정하는 지름길이 아닙니다. 1,040억에 4비트를 곱해 모델이 약 52GB만 필요하다고 주장하는 것은 비활성화되었지만 여전히 필요한 전문가 가중치, 밀집 구성 요소, 공유 전문가, 어텐션 레이어, 비전 가중치 및 런타임 상태를 무시하는 것입니다.
| 공개된 수치 | 설명하는 것 | 의미하지 않는 것 |
|---|---|---|
| 총 2.8조 매개변수 | 저장되고 접근 가능해야 하는 완전한 가중치 세트 | 모든 매개변수가 모든 토큰에 대해 계산된다는 것 |
| 1,040억 활성화된 매개변수 | 한 토큰의 순방향 패스 동안 사용된 대략적인 매개변수 규모 | 전체 모델이 4비트에서 52GB에 맞는다는 것 |
| 896명의 라우팅된 전문가 중 16명 | 토큰별 희소 전문가 라우팅 패턴 | 단지 16명의 전문가만 다운로드하거나 로드해야 한다는 것 |
최소 가중치-메모리 하한이란 무엇인가?
2.8조 개의 매개변수에서 가장 간단한 하한 계산은 총 매개변수 수에 매개변수당 저장된 비트 수를 곱하는 것입니다. MXFP4는 4비트 페이로드 하한을 제공합니다: 2.8T × 4비트는 약 1.4TB, 즉 대략 1.27TiB에 해당하며, 이는 순수 가중치 페이로드만을 의미합니다.
공개된 저장소는 약 1.56 TB로, 서비스 메모리가 단순 가중치 계산을 넘어 확장되는 이유를 보여줍니다. 체크포인트 패키징, 블록 스케일, 텐서 정렬, 구성 파일, 토크나이저 자산, 비전 구성 요소 및 기타 모델 데이터가 실제 다운로드 크기를 이론적 4비트 최소값 이상으로 밀어 올립니다.
네 가지 다른 예산을 별도로 계획해야 합니다: 영구 다운로드 저장소, 임시 스테이징 공간, 호스트 RAM, 가속기 HBM 또는 VRAM. 실행 중인 서비스는 또한 KDA 상태, MLA KV 캐시, 활성화, 통신 버퍼, 커널, 그래프 캡처 및 실패 여유 공간을 위한 추가 공간이 필요합니다. 따라서 1.56 TB 저장소 크기는 완전한 RAM 요구 사항이나 완전한 GPU 메모리 요구 사항이 아닙니다.
| 가중치 표현 | 대략적인 가중치 전용 메모리 | 숫자에 포함되지 않은 항목 |
|---|---|---|
| 16비트 등가 | 약 5.6 TB | 캐시, 활성화, 런타임 버퍼, 복제본 및 통신 작업 공간 |
| 8비트 등가 | 약 2.8 TB | 양자화 메타데이터 및 모든 비가중치 서비스 오버헤드 |
| MXFP4 이론적 최소값 | 약 1.4 TB / 약 1.27 TiB | 블록 스케일, 패키징, 캐시, 활성화 및 여유 용량 |
| 현재 공개 저장소 | 약 1.56 TB | 임시 다운로드 공간 및 로드 후 필요한 모든 메모리 |
실제로 어떤 하드웨어가 Kimi K3를 로컬에서 실행할 수 있나요?
전체 모델에 대해 정직한 소비자용 최소 GPU 목록은 없습니다. 기술적으로 체크포인트를 매핑하거나 스트리밍할 수 있는 시스템이 자동으로 안정적이고 상호작용 가능한 서비스를 제공할 수 있는 것은 아닙니다. 실용적인 Kimi K3 하드웨어 요구 사항은 가중치 상주, 지원되는 MXFP4 커널, 인터커넥트 대역폭, 캐시 용량, 컨텍스트 길이, 동시성 및 서비스 엔진에 따라 달라집니다.
게시된 day-zero Kimi K3 서비스 지원은 현실적인 시작 등급을 8가속기 엔터프라이즈 노드로 설정합니다. 현재 vLLM 자료는 8 GB300급 또는 MI350X/MI355X급 가속기를 시작점으로 설명하며, SGLang은 B300 1×8, GB300 2×4, B200 2×8, H200 2×8, H100 4×8, MI350X/MI355X 1×8 등 토폴로지 인지 예제를 게시합니다.
이들은 게시된 런타임 레시피 및 시작 구성으로, 모든 작업 부하에 대한 단일 인증 최소값이 아닙니다. 오래되었거나 작은 가속기는 더 많은 노드, 다른 양자화 커널, 축소된 컨텍스트 또는 추가 전문가 병렬 처리가 필요할 수 있습니다. 실제 운영 트래픽은 단순히 체크포인트를 한 번 적재하는 것뿐만 아니라 동시 요청, 실패한 작업자, 성능 여유 공간을 위한 용량도 필요합니다.
| 하드웨어 등급 | 완전한 Kimi K3 실행 가능성 | 주요 경계 |
|---|---|---|
| 일반 PC, Mac, 가정용 NAS 또는 단일 소비자 GPU | 실용적이지 않음 | 체크포인트 및 서비스 오버헤드가 일반 로컬 메모리 용량을 초과합니다 |
| 여러 소비자 GPU와 RAM/NVMe 오프로딩 | 실험용 전용 | PCIe, RAM, 스토리지 대역폭이 전문가 이동을 사용할 수 없을 정도로 느리게 만들 수 있음 |
| 8개 카드 최신 세대 가속기 노드 | 발표된 시작 클래스 | 지원되는 커널, 충분한 HBM, 런타임에 맞는 토폴로지 필요 |
| 멀티 노드 가속기 클러스터 | 현실적인 프로덕션 클래스 | RDMA 또는 동등한 패브릭, 분산 오케스트레이션, 장애 처리 필요 |
왜 하나의 워크스테이션이나 NAS가 여전히 잘못된 토폴로지인가요?
원시 용량 분할은 문제를 과소평가합니다. 충분한 총 메모리가 조립되더라도, 전문가 병렬성은 라우팅을 네트워크 트래픽으로 만듭니다. 토큰은 선택된 전문가를 보유한 가속기로 도달해야 하며, 다시 모델 파이프라인의 나머지 부분으로 돌아가야 합니다.
엔터프라이즈 가속기 노드는 메모리 이상의 것을 제공합니다. 이들은 고대역폭 GPU 링크, RDMA 지원 네트워킹, 집단 통신 라이브러리, 텐서, 전문가, 데이터 또는 파이프라인 병렬성을 위한 커널을 결합합니다. 일반 PCIe나 홈 네트워크를 통해 연결된 소비자용 GPU 모음은 명목상 충분한 용량을 보여줄 수 있지만, 유용한 서빙에는 너무 느리거나 불안정할 수 있습니다.
NAS는 체크포인트 샤드, 로그, 데이터셋, 검색 인덱스, 애플리케이션 데이터를 저장하는 데 유용하지만, 네트워크 스토리지는 가속기 메모리 대역폭을 대체하지 않습니다. 더 나은 홈 서버 역할은 보통 개인 데이터와 검색을 사용자 가까이에 유지하면서 최첨단 모델 추론은 적절한 클러스터나 호스팅된 엔드포인트에 맡기는 것입니다. 그 설계에서 홈 서버는 로컬 데이터 계층을 최첨단 추론과 분리합니다.
KDA 상태, MLA KV 캐시, 그리고 컨텍스트 길이는 어떻게 예산을 증가시키나요?
Kimi K3는 93개 레이어 전체에 걸쳐 하나의 균일한 풀 어텐션 캐시를 사용하지 않습니다. 69개의 KDA 레이어와 24개의 게이트드 MLA 레이어는 두 가지 다른 서빙 메모리 요구를 만듭니다: 허용된 요청을 위한 고정 모델 기하학의 KDA 상태 풀과 저장된 토큰과 함께 증가하는 페이징된 MLA KV 풀입니다.
이 분할은 KDA가 기존 어텐션에서 발견되는 긴 컨텍스트 증가를 줄일 수 있음을 의미하지만, 백만 토큰 요청을 무료로 만들지는 않습니다. KDA 상태와 MLA KV 메모리가 가속기 용량을 경쟁하기 때문에, KDA 측은 허용된 요청을 제한할 수 있고 MLA 측은 총 캐시된 토큰을 제한합니다.
배치 크기, 동시성, 평균 프롬프트 길이, 생성된 추론 길이, 멀티모달 입력, 캐시 정밀도, 사전 채우기/디코드 전략 모두 사용 가능한 용량에 영향을 미칩니다. 100만 토큰 수치는 최대 모델 능력이며 권장 기본값이 아닙니다. 첫 배포는 더 짧은 최대 컨텍스트, 배치 크기 1, 낮은 동시성으로 시작하여 메모리 부족 실패, 사전 채우기 시간, 디코드 속도, 노드 간 트래픽을 측정해야 합니다.
오픈 웨이트 공개 후 Kimi K3를 로컬에서 어떻게 실행할 수 있나요?
지금 Kimi K3를 로컬에서 실행한다는 것은 일반 데스크톱 애플리케이션을 설치하는 것이 아니라 공개된 체크포인트를 중심으로 분산 추론 서비스를 구축하는 것을 의미합니다. 가장 안전한 순서는 컨텍스트나 트래픽을 늘리기 전에 스토리지, 런타임 지원, 토폴로지, 그리고 작은 운영 지점을 검증하는 것입니다.
- 스토리지를 준비하세요. 약 1.56TB 저장소 공간과 부분 다운로드, 캐시, 컨테이너 이미지, 로그, 임시 파일을 위한 추가 공간을 예약하세요.
- 지원되는 엔진을 선택하세요. 필요한 모델 코드, 커널, 컨테이너 또는 브랜치 버전과 함께 Kimi K3 전용 vLLM, SGLang 또는 TokenSpeed 배포 경로를 사용하세요.
- 토폴로지를 맞추세요. 텐서 및 전문가 병렬 설정에 필요한 충분한 HBM과 NVLink, MNNVL, 또는 RDMA 경로가 있는 엔터프라이즈 다중 GPU 또는 다중 노드 구성을 선택하세요.
- 헤드라인 제한 이하에서 시작하세요. 최대 모델 길이, 배치 크기, 동시성을 줄인 후 로딩, OOM 동작, 출력 정확성, 사전 채우기 속도, 디코드 속도, 전 노드 간 트래픽을 확인하세요.
- 측정 후에만 확장하세요. 컨텍스트, 동시 요청, 캐시 기능, 멀티모달 입력 또는 추측적 디코딩을 한 번에 하나씩 추가하세요.
다음과 같은 명령어 vllm serve 또는 sglang serve 호환 가능한 분산 런타임 시작 방법을 설명하며, 하드웨어 요구 사항을 제거하지는 않습니다. 필요한 가속기 클래스가 없을 경우 현실적인 선택지는 호스팅 API, 파일과 검색을 로컬에 유지하는 하이브리드 아키텍처, 또는 홈 서버의 실제 메모리와 신뢰성 예산에 맞는 더 작은 로컬 모델입니다.
자주 묻는 질문
일반 PC, Mac 또는 홈 NAS에서 Kimi K3를 로컬로 실행할 수 있나요?
실제 전체 모델 속도는 아닙니다. 저장소 크기는 서비스 오버헤드 이전에 약 1.56TB이며, 일반 로컬 시스템은 현재 런타임에서 기대하는 가속기 메모리와 고대역폭 토폴로지를 갖추지 못했습니다. 실험적인 전문가 스트리밍이나 무거운 오프로딩은 기술적으로 실행 가능함을 증명할 수 있지만, 이는 반응성 있거나 생산 준비가 된 서비스와는 다릅니다.
Kimi K3는 얼마나 많은 저장 공간과 메모리를 필요로 하나요?
투명한 MXFP4 가중치 페이로드 최소 용량은 약 1.4TB이고, 공개 저장소는 약 1.56TB입니다. 여기에 추가 디스크 공간, 호스트 RAM, 가속기 HBM 또는 VRAM, KDA 상태, MLA KV 캐시, 활성화, 통신 작업 공간, 운영 여유 공간이 필요합니다. 이 모든 계층을 대표하는 단일 숫자는 없습니다.
Kimi K3의 최소 공개 GPU 구성은 무엇인가요?
가장 작은 공개된 데이제로 구성은 8카드 엔터프라이즈 가속기 노드이며, 현재 vLLM과 SGLang 경로는 B300, GB300, 또는 MI350X/MI355X급 하드웨어를 중심으로 합니다. 이를 런타임 시작점으로 간주하고, 보편적인 최소 요구사항으로 보지 마세요; 컨텍스트, 동시성, 엔진 버전, 생산 목표에 따라 더 많은 자원이 필요할 수 있습니다.
Kimi K3를 SSD나 NAS 오프로딩으로 실행할 수 있나요?
SSD나 NAS 저장소는 체크포인트 조각을 보관할 수 있고, 실험적 런타임은 호스트 메모리를 통해 가중치를 스트리밍할 수 있습니다. 제한 요소는 전문가 가중치와 상태를 저장소, 네트워크, RAM, PCIe 링크를 통해 반복적으로 이동시키는 것입니다. 이 경로들은 가속기 HBM 및 고속 GPU 패브릭보다 훨씬 느리므로, 실험적 실행은 사용 불가능한 지연 시간을 초래할 수 있습니다.
Ollama가 전체 Kimi K3 모델을 로컬에서 실행하나요?
현재 Ollama Kimi K3 항목은 kimi-k3:cloud 태그를 사용합니다. 로컬 Ollama 클라이언트를 실행한다고 해서 1.56TB 체크포인트가 로컬 머신에 로드되는 것은 아니며, 나열된 경로는 클라우드 기반입니다.
최종 요약
Kimi K3는 이제 진정한 오픈 가중치 모델로 제공되어 클러스터 운영자가 사전 출시 추정치에 의존하지 않고 전체 체크포인트를 다운로드하고 배포할 수 있습니다. 이번 릴리스는 검증 및 도구 가용성에 변화를 주지만, 2.8T 파라미터 모델의 물리적 규모는 변하지 않습니다.
가장 유용한 Kimi K3 메모리 수치는 서로 다른 질문에 답합니다: 약 1.4TB는 투명한 4비트 가중치 전용 최소 용량이고, 약 1.56TB는 현재 저장소 크기이며, 104B는 토큰당 활성화된 계산 규모입니다. 이 숫자들만으로는 실행 중인 서비스에 필요한 전체 메모리를 설명하지 못합니다.
대부분의 개인 및 홈 서버 사용자에게 중단 경계는 명확합니다: 엔터프라이즈급 8가속기 노드나 분산 클러스터가 없다면, 호스팅된 추론을 사용하고, 개인 데이터와 검색 계층은 로컬에 유지하거나, 더 작은 모델을 선택하세요. NAS, 워크스테이션 또는 단일 GPU를 최첨단 모델 슈퍼노드로 취급하지 않고 Kimi K3의 이점을 누리는 실용적인 방법입니다.
기술 및 AI 허브
더 읽어보기

계절에 따른 생활 패턴 변화 후 스마트 홈 예측이 부정확해지는 이유는 무엇인가요?
계절에 따른 생활 패턴의 변화는 시간, 센서, 재실 여부, 원하는 동작 간의 관계를 바꾸어, 과거 습관을 기반으로 학습한 모델을 낡게 만듭니다.

객체 추적을 활성화하면 가정용 NVR이 짧은 이벤트를 놓치는 이유는 무엇인가요?
추적을 시작하고 궤적을 확인하려면 충분한 감지가 필요하므로, 짧게 나타난 객체는 NVR이 유효한 이벤트를 생성하기 전에 사라질 수 있습니다.

모델 업그레이드 후 AI 사진 라벨이 바뀌는 이유는 무엇인가요?
모델 업그레이드는 레이블을 할당하는 데 사용되는 표현과 순위를 변경하므로, 동일한 사진도 서로 다른 의미적 또는 신뢰도 경계를 넘을 수 있습니다.

