Xiaomi AI Cube가 120B 모델을 로컬에서 실행한다—이것이 개인용 AI 컴퓨터의 미래일까?

로렌 판ZimaSpace의 창립자이며 이자 호평받는 ZimaBoard 시리즈의 설계자입니다. 산업 디자인과 임베디드 엔지니어링을 결합하여, Lauren은 명확한 사명을 가지고 ZimaSpace를 시작했습니다: 개인 클라우드 컴퓨팅의 대중화. 그는 하드웨어가 "해킹 가능하고 아름다워야 한다"는 신념을 가지고 있습니다—산업용 서버와 소비자 기기 사이의 격차를 해소하는 것입니다. 오늘날 그는 창작자들이 디지털 삶을 완전히 제어할 수 있는 도구를 만드는 엔지니어링 팀을 이끌고 있습니다.

샤오미 AI Cube는 한 대의 150W 본체에 충분한 메모리와 특화된 로컬 연산 성능을 담아 120B 모델과 훨씬 작은 3B 모델을 모두 로컬에서 사용할 수 있도록 설계한 독특한 아이디어를 기반으로 한 프로토타입 데스크톱 AI 컴퓨터입니다. 샤오미는 80GB 통합 메모리, 세 개의 XRING 프로세서(O3, O100, D100), 그리고 프런트엔드 개발과 복잡한 코딩을 포함한 워크로드를 위한 빠른 모델/느린 모델 전환 기능을 확인했습니다.

하지만 “120B를 로컬에서 실행한다”는 것은 용량에 관한 주장일 뿐, 완전한 성능 벤치마크는 아닙니다. 샤오미는 아직 Cube의 전체 메모리 토폴로지, 120B 양자화 방식, 사용 가능한 컨텍스트, 생성 속도, 소프트웨어 호환성, 가격 또는 정식 출시일을 공개하지 않았습니다. 현재로서는 AI Cube를 구매자가 평가할 수 있는 완제품이라기보다 새로운 개인용 AI 컴퓨터 아키텍처의 미리보기로 보는 편이 더 적절합니다.

샤오미 AI Cube란 무엇인가요?

샤오미 AI Cube는 대규모 모델의 로컬 추론을 위해 세 개의 자체 개발 XRING 프로세서와 80GB 통합 메모리를 결합한 엔지니어링 프로토타입입니다.

AI Cube 세부 정보 샤오미가 확인한 내용
상태 엔지니어링 프로토타입
프로세서 XRING O3 + O100 + D100
메모리 통합 메모리 80GB
로컬 모델 120B 모델 + 3B 모델
모델 동작 빠른 모델/느린 모델 전환
지속 성능 최대 150W
시연된 워크로드 프런트엔드 개발 및 복잡한 코딩
가격 미발표
출시일 미발표

샤오미의 공식 설명은 공식 AI Cube 프로토타입 게시물에서 확인할 수 있습니다.

120B라는 숫자가 주목을 끌지만, 더 중요한 질문은 이 정도 크기의 모델을 책상 위에서 실용적으로 사용하려면 무엇이 필요한가입니다.

120B 모델을 로컬에서 실행하는 것이 왜 그렇게 큰일일까요?

1,200억 개의 매개변수를 가진 모델은 즉시 메모리 문제를 일으킵니다.

16비트 정밀도에서는 원시 가중치만으로도 대략 다음과 같은 메모리가 필요합니다.

120B × 2바이트 ≈ 240GB

8비트 정밀도에서는 약 120GB로 줄어들고, 4비트 가중치는 런타임 오버헤드를 제외하면 대략 60GB입니다.

따라서 고도로 양자화된 120B 모델을 탑재하는 데 80GB 시스템이 가능해 보이지만, 가중치를 탑재하는 것은 배포의 일부에 불과합니다.

추론에도 다음과 같은 메모리가 필요합니다.

  • 양자화 메타데이터,
  • 런타임 버퍼,
  • KV 캐시,
  • 컨텍스트 토큰,
  • 시스템 소프트웨어,
  • 그리고 잠재적으로 멀티모달 상태도 필요합니다.

모델을 탑재하는 것과 유용한 속도 및 컨텍스트로 실행하는 것은 다릅니다.

실제 로컬 AI 하드웨어 요구 사항이 단순한 RAM 수치 하나가 아니라 모델 크기, 양자화, 컨텍스트 및 동시 실행에 따라 달라지는 것도 같은 이유입니다.

80GB 통합 메모리로 정말 120B 모델을 실행할 수 있을까요?

예, 양자화된 120B 모델은 80GB급 메모리 예산 안에 들어갈 가능성이 높지만, Xiaomi는 Cube의 실제 사용 가능한 컨텍스트나 처리량을 계산할 수 있을 만큼 충분한 정보를 아직 공개하지 않았습니다.

답이 나오지 않은 변수는 다음과 같습니다.

  • 정확한 120B 모델 버전,
  • 양자화 형식,
  • 사용 가능한 컨텍스트 길이,
  • 첫 토큰까지 걸리는 시간,
  • 생성 속도,
  • 3B 및 120B 모델이 동시에 메모리에 상주하는지 여부.

기술적으로 로드되지만 생성 속도가 사용할 수 없을 정도로 느린 모델은 반응성이 뛰어난 개인 비서와는 전혀 다릅니다. 긴 컨텍스트와 여러 에이전트의 동시 실행도 상당한 추가 메모리를 사용할 수 있습니다.

이 구분, 즉 모델을 탑재할 수 있는지와 실제로 사용할 수 있는지는 더 큰 오픈 모델이 가정용 하드웨어로 이동함에 따라 특히 중요해지고 있습니다. 현재의 홈 서버 AI 워크로드에서도 비슷한 제약이 나타나며, 모델을 단순히 탑재할 수 있다고 해서 항상 켜 둔 상태에서 쾌적하게 사용할 수 있는 것은 아닙니다.

Xiaomi AI Cube는 정말 1.22TB/s의 메모리 대역폭을 제공할까요?

Xiaomi는 XRING O100 가속기의 근접 메모리 대역폭을 1.22TB/s로 발표했지만, 이것만으로 전체 AI Cube 80GB 메모리 풀이 1.22TB/s로 작동한다는 사실이 입증되지는 않습니다.

이러한 구분은 프로토타입을 둘러싼 가장 중요한 기술적 질문 중 하나가 되었습니다.

O100은 3D 웨이퍼 레벨 적층을 사용하는 고대역폭 AI 가속기로 설계되었습니다. D100은 훨씬 더 큰 메모리 구성을 지원하는 별도의 고연산 AI 프로세서이며, O3는 범용 SoC입니다.

Xiaomi는 아직 다음 내용을 설명하는 메모리 블록 다이어그램을 공개하지 않았습니다.

  • 80GB 풀이 어떻게 분배되는지,
  • 각 칩이 어떤 메모리를 소유하는지,
  • O100의 최고 대역폭 경로에 액세스할 수 있는 부분,
  • 칩 간 대역폭,
  • 120B 모델 가중치가 상주하는 위치,
  • 또는 KV 캐시가 유지되는 위치입니다.

사용 가능한 프로세서 사양은 Xiaomi XRING 출시 사양에 요약되어 있습니다.

로컬 AI 사용자들은 거의 즉시 같은 모호함을 지적했습니다. 대규모 LocalLLaMA AI Cube 토론에서는 O100의 대역폭이 D100 및 Cube의 더 큰 메모리 풀과 어떤 관련이 있는지에 대해 집중적으로 다뤘습니다.

샤오미가 토폴로지를 공개하기 전까지 가장 안전한 해석은 간단합니다. 1.22TB/s는 O100의 사양이며, AI Cube의 80GB 메모리 전체 바이트에 대해 확인된 대역폭 수치가 아닙니다.

로컬 AI에서 메모리 대역폭이 중요한 이유는 무엇일까요?

대규모 모델 추론에서는 토큰을 생성하는 동안 모델 데이터가 메모리를 통해 반복적으로 이동합니다. 따라서 가속기의 산술 연산은 성능을 결정하는 한 요소에 불과합니다.

기기는 엄청난 TOPS를 내세우면서도 데이터가 연산 유닛에 도달하기를 기다릴 수 있습니다. 따라서 토큰을 하나씩 디코딩하는 작업은 메모리 대역폭에 크게 좌우될 수 있습니다.

이 때문에 O100의 아키텍처가 흥미롭습니다. 6nm 공정이 샤오미의 최신 칩보다 덜 앞선 것처럼 들리더라도, O100은 단순히 최고 연산 성능을 극대화하기보다 고대역폭 근접 메모리 AI 작업을 목표로 설계되었기 때문입니다.

로컬 LLM에서는 거대한 TOPS 수치보다 메모리 대역폭이 실제 추론 성능에 대해 더 많은 정보를 제공하는 경우가 있습니다.

하지만 샤오미가 개별 칩 사양이 아닌 시스템 수준의 벤치마크를 공개하기 전까지는 Cube의 실제 120B 성능은 여전히 알 수 없습니다.

샤오미 AI Cube가 120B를 실행할 수 있는데 왜 3B 모델을 실행해야 할까요?

소형 3B 모델이 오히려 전면에 내세운 120B 모델보다 AI Cube의 아키텍처를 더 잘 보여줄 수도 있습니다.

모든 요청에 가장 큰 모델을 사용하면 최첨단 수준의 추론이 필요하지 않은 작업에 지연 시간, 메모리 대역폭, 에너지를 낭비하게 됩니다.

소형 모델은 다음과 같은 일상적인 작업을 처리할 수 있습니다.

  • 의도 감지,
  • 분류,
  • 라우팅,
  • 짧은 변환 작업,
  • 메타데이터 추출,
  • 파일 태깅,
  • 그리고 가벼운 백그라운드 작업에도 사용할 수 있습니다.

그다음 더 큰 모델은 복잡한 코딩, 계획 수립, 어려운 추론, 장문 종합과 같은 더 까다로운 작업에 할당할 수 있습니다.

그러면 다음과 같은 유용한 아키텍처가 구성됩니다.

기본 부하는 소형 로컬 모델이 처리하고, 에스컬레이션이 필요할 때는 더 큰 로컬 모델을 사용합니다.

샤오미는 빠른 모델과 느린 모델 간 전환을 지원한다고 확인했지만, 실제 라우팅 정책은 공개하지 않았습니다. 따라서 특정 작업이 이미 3B 모델 또는 120B 모델에 할당되었다고 주장하는 것은 추측에 불과합니다.

더 큰 개념은 이미 현대의 로컬 및 프런티어 AI 워크로드와 관련이 있습니다. 모든 요청에 가장 강력한 모델을 기본으로 사용할 필요는 없습니다.

샤오미 AI Cube에는 왜 서로 다른 AI 칩이 세 개나 필요할까?

일반적인 로컬 AI 워크스테이션은 보통 시스템 RAM과 하나 이상의 개별 GPU에 범용 CPU를 결합합니다.

반면 AI Cube는 공개된 역할이 서로 다른 세 개의 프로세서를 결합합니다.

XRING 칩 공개 포지셔닝
O3 CPU, GPU 및 NPU를 갖춘 범용 플래그십 SoC
O100 메모리 근접 컴퓨팅에 초점을 맞춘 고대역폭 AI 가속기
D100 대용량 메모리 구성을 지원하는 고연산 AI 프로세서

이는 이기종 로컬 AI 컴퓨팅을 가리킵니다. 하나의 대형 GPU에 모든 작업을 맡기는 대신, 워크로드 특성에 따라 서로 다른 실리콘을 사용하는 방식입니다.

그러나 샤오미는 칩별 실행 맵을 공개하지 않았습니다. 아직 O3가 소형 모델을 실행하는지, O100이 특정 추론 단계를 담당하는지, D100이 대형 모델 실행 경로를 맡는지는 알 수 없습니다.

이는 타당한 엔지니어링 가설이지만, 구현 세부 사항으로 확인된 것은 아닙니다.

샤오미 AI Cube는 DGX Spark의 대안이 되려는 것일까?

아키텍처 측면에서 AI Cube는 DGX Spark 및 대용량 메모리를 갖춘 Apple Silicon 시스템과 같은 신흥 범주에 속합니다. 즉, 유난히 큰 AI 모델을 사용자 가까이에 두도록 설계된 개인용 하드웨어입니다.

실제로는 직접 비교하기에 아직 이릅니다.

항목 샤오미 AI Cube 아직 입증이 필요한 사항
메모리 통합 메모리 80GB 전체 토폴로지 및 사용 가능한 대역폭
컴퓨팅 O3 + O100 + D100 실제 모델 처리량
모델 용량 120B + 3B 로컬 배포 양자화, 컨텍스트 및 동시성
소프트웨어 공개 세부 정보 불완전 런타임 및 프레임워크 지원
전력 지속 전력 목표 150W 측정된 추론 효율
가격 미발표 성숙한 플랫폼과 비교했을 때의 실질적 가치

DGX Spark의 강점은 단순히 하드웨어에 있지 않습니다. NVIDIA는 CUDA, 성숙한 라이브러리, 추론 런타임 및 확립된 개발자 생태계를 제공합니다.

따라서 AI Cube의 다음 과제는 실리콘보다는 소프트웨어에 더 가깝습니다.

샤오미 AI Cube는 실제로 어떤 소프트웨어를 실행할 수 있을까?

하드웨어 용량만으로 유용한 로컬 AI 플랫폼이 자동으로 만들어지는 것은 아닙니다.

개발자는 결국 다음 지원 여부에 대한 명확한 답변을 원할 것입니다:

  • llama.cpp,
  • Ollama,
  • vLLM,
  • PyTorch,
  • Linux 개발 환경,
  • Docker 또는 컨테이너 워크로드,
  • GGUF 및 일반적인 양자화 형식,
  • OpenAI 호환 API,
  • 미세 조정 프레임워크,
  • 현재 에이전트 하네스.

샤오미는 코딩 워크로드를 시연했지만, AI Cube에 대한 광범위한 타사 호환성 매트릭스는 공개하지 않았습니다.

강력한 가속기라도 런타임 지원이 부족하면, 성숙한 커널, 안정적인 드라이버, 손쉬운 모델 변환, 대규모 개발자 커뮤니티를 갖춘 느린 하드웨어보다 유용성이 떨어질 수 있기 때문입니다.

이러한 우려는 LocalLLaMA 토론에서도 반복해서 나타납니다. 사용자들은 80GB와 120B만으로 AI Cube를 평가하는 것이 아니라, XRING이 이러한 사양을 유용하게 활용할 수 있도록 필요한 소프트웨어 생태계를 구축할 수 있을지 묻고 있습니다.

개인용 AI 컴퓨터에는 AI 가속기만이 아니라 소프트웨어 플랫폼이 필요합니다.

AI Cube는 PC, 워크스테이션, 아니면 상시 실행 AI 서버일까요?

AI Cube는 기존 PC라기보다 개인용 AI 컴퓨팅 어플라이언스로서 더 흥미로울 수 있습니다.

기존 PC는 대체로 상호작용 중심입니다. 사용자가 애플리케이션을 열 때 애플리케이션이 실행됩니다. 개인 AI 노드는 다음 작업을 위해 모델을 계속 사용할 수 있는 상태로 유지할 수 있습니다.

  • 코딩 에이전트,
  • 백그라운드 추론,
  • 문서 처리,
  • 비공개 멀티모달 분석,
  • 로컬 AI API,
  • RAG 워크플로,
  • 그리고 장시간 실행되는 자동화도 지원합니다.

이에 따라 하드웨어의 우선순위도 영구 메모리, 지속적인 냉각, 예측 가능한 추론, 높은 대역폭, 안정적인 로컬 서비스 중심으로 바뀝니다.

그렇기 때문에 새롭게 등장하는 로컬 우선 AI 에이전트도 점점 일반적인 데스크톱 애플리케이션보다는 인프라 워크로드에 가까운 형태를 보이고 있습니다.

AI Cube가 컴퓨팅 노드라면 AI 데이터는 어디에 저장해야 할까요?

전용 AI 컴퓨터가 홈 서버나 NAS를 자동으로 대체하는 것은 아닙니다. 추론과 영구 데이터는 서로 다른 문제를 해결하기 때문입니다.

AI 컴퓨팅 노드는 다음 요소를 중심으로 최적화됩니다.

  • 모델 가중치,
  • 고대역폭 메모리,
  • 가속기,
  • 낮은 지연 시간의 추론,
  • 및 추론 워크로드.

영구 로컬 인프라는 다음 요소를 중심으로 최적화됩니다.

  • 문서,
  • 사진 및 동영상,
  • 코드 저장소,
  • RAG 소스 파일,
  • 벡터 데이터베이스,
  • 에이전트 메모리,
  • 로그,
  • 백업,
  • 그리고 상시 실행 애플리케이션을 지원합니다.

이 구분이 중요한 이유는 AI 컴퓨팅은 개인 데이터보다 빠르게 변화하기 때문입니다. 모델, 가속기, 런타임은 몇 년마다 교체될 수 있지만 파일, 프로젝트 기록, 개인 지식은 안정적으로 유지되어야 합니다.

로컬 AI와 파일 스토리지를 하나의 머신에서 함께 사용할지, 아니면 특화된 시스템으로 분리할지 결정할 때도 동일한 구분이 나타납니다.

지속형 서버는 가장 큰 모델을 동일한 장치에서 호스팅할 필요 없이, 개인용 NAS AI 어시스턴트가 사용하는 비공개 파일, 검색 인덱스 및 영구 컨텍스트도 제공할 수 있습니다.

AI Cube는 개인용 AI 컴퓨팅은 교체 가능해지고 개인용 AI 데이터는 지속적으로 유지될 수 있음을 시사합니다.

샤오미 AI Cube에 대해 아직 무엇을 모를까요?

질문 현재 답변
120B를 로컬에서 실행할 수 있나요? 샤오미는 그렇다고 말합니다
정확히 어떤 120B 모델인가요? 샤오미가 공개한 프로토타입 세부 정보에는 완전히 문서화되어 있지 않음
어떻게 양자화되나요? 공개되지 않음
사용 가능한 컨텍스트는 얼마나 되나요? 공개되지 않음
120B 모델은 얼마나 빠른가요? 공개되지 않음
80GB 전체가 1.22TB/s로 작동하나요? 확인되지 않음. 1.22TB/s는 O100 사양입니다
3B와 120B는 어떻게 라우팅되나요? 빠른/느린 전환은 확인됨. 정책은 공개되지 않음
Ollama 또는 llama.cpp를 지원하나요? 공식적으로 확인되지 않음
가격은 얼마인가요? 미발표
언제 구매할 수 있나요? 소매 출시일 미발표

샤오미의 별도 O100 시연 단말과 AI Cube의 벤치마크 수치를 서로 합산해서는 안 된다는 점도 중요합니다.

또 다른 O3 + O100 프로토타입은 훨씬 더 작은 MiMo 워크로드에서 높은 토큰 처리량을 시연했습니다. 그렇다고 해서 AI Cube가 120B 모델을 같은 속도로 실행한다는 뜻은 아닙니다. 이 차이점은 샤오미의 프로토타입 시연에서 다룹니다.

샤오미 AI Cube는 의미를 가지려면 저렴해야 할까요?

아키텍처 시연으로서는 아닙니다. 하지만 새로운 개인용 컴퓨팅 범주로서는 분명히 그렇습니다.

대용량 메모리 로컬 AI 하드웨어가 고급 소비자용 워크스테이션 가격대에 도달한다면, 훨씬 더 많은 개발자가 100B급 로컬 추론을 실용적으로 사용할 수 있게 될 것입니다.

최종 가격이 몇 배 더 높다면, 동일한 하드웨어는 대중 시장용 개인 AI 컴퓨터가 아니라 전문가용 AI 워크스테이션이 됩니다.

Reddit 사용자들은 이미 가격을 두고 활발히 추측하고 있지만, 샤오미는 아직 가격을 발표하지 않았습니다. 상용 제품이 출시되기 전까지 가격 추정은 추측에 머물러야 합니다.

이것이 장기적인 로컬 AI 비용 비교가 하드웨어 가격만큼이나 중요한 이유이기도 합니다. 활용도, 모델 크기, 전기 요금, 클라우드 비용 상승은 전용 로컬 컴퓨팅이 경제적으로 타당한지에 모두 영향을 미칩니다.

샤오미 AI Cube는 개인용 AI 컴퓨터의 미래일까요?

최종적인 개인용 AI 컴퓨터가 이 프로토타입과 정확히 같은 모습이 아니더라도, 아마도 아키텍처 측면에서는 그럴 수 있습니다.

핵심 아이디어는 다음과 같습니다.

  • 모델 가중치에 맞춘 대용량 공유 메모리,
  • 고대역폭 AI 가속,
  • 이기종 프로세서,
  • 작은 모델과 대형 모델을 함께 사용 가능,
  • 일시적인 처리 성능이 아닌 지속적인 컴퓨팅,
  • 로컬 모델 실행,
  • 그리고 지속적으로 사용 가능한 AI 서비스

이는 일반 PC에 NPU를 추가하고 AI PC라고 부르는 것보다 더 중요한 의미를 가집니다.

AI Cube는 모델 워크로드를 출발점으로 삼아 그에 맞춰 장비를 설계합니다.

이 프로토타입에는 여전히 120B 성능, 메모리 토폴로지, 소프트웨어 지원, 가격 및 출시 여부와 관련한 중요한 미해결 문제가 있습니다. 그러나 이 아키텍처는 로컬 AI가 자체 전용 컴퓨팅 계층을 갖고, 파일과 메모리 및 장기 상태는 영구적인 로컬 인프라에 남아 있는 그럴듯한 미래를 가리킵니다.

개인용 AI 컴퓨터는 가끔 AI를 실행하는 PC가 아닐 수 있습니다. 사용자의 영구 데이터는 해당 연도에 가장 빠른 가속기가 무엇이든 그것과 독립적으로 유지하면서, 여러 모델을 제공하도록 설계된 항상 사용 가능한 로컬 컴퓨팅 노드일 수 있습니다.

FAQ: Xiaomi AI Cube와 로컬 120B 모델

Xiaomi AI Cube는 클라우드 없이 120B 모델을 실행할 수 있나요?

Xiaomi는 프로토타입이 120B 모델을 로컬에서 배포할 수 있다고 밝혔습니다. 그러나 해당 배포에 사용된 정확한 양자화 방식, 컨텍스트 길이 또는 런타임 구성은 공개하지 않았습니다.

120B 모델에는 메모리가 얼마나 필요한가요?

원시 120B 가중치에는 런타임 오버헤드를 제외하고 FP16에서 약 240GB, 8비트에서 120GB, 4비트에서 약 60GB가 필요합니다. 실제 메모리 사용량은 양자화 메타데이터, KV 캐시, 컨텍스트 길이 및 추론 소프트웨어에 따라서도 달라집니다.

Xiaomi AI Cube는 Ollama를 지원하나요?

Xiaomi는 Ollama 지원을 공식적으로 확인하지 않았습니다. Ollama, llama.cpp, vLLM 및 기타 인기 로컬 AI 런타임과의 호환성은 여전히 가장 큰 미해결 소프트웨어 문제 중 하나입니다.

Xiaomi AI Cube는 어떤 120B 모델을 실행하나요?

공개 보도에서는 이 프로토타입이 Xiaomi의 MiMo 모델 제품군과 관련이 있다고 전했지만, Xiaomi의 공식 AI Cube 공개 설명에는 완전한 모델/버전 및 양자화 사양이 제공되지 않았습니다.

Xiaomi AI Cube를 구매할 수 있나요?

현재로서는 아닙니다. AI Cube는 엔지니어링 프로토타입으로 소개되었으며, Xiaomi는 이 특정 기기의 소매 가격이나 출시일을 발표하지 않았습니다.

Xiaomi AI Cube는 NAS나 홈 서버를 대체하나요?

반드시 그런 것은 아닙니다. AI Cube는 대용량 메모리를 활용한 AI 추론에 최적화되어 있는 반면, NAS나 홈 서버는 영구 파일, RAG 소스, 데이터베이스, 백업, 에이전트 상태 및 기타 상시 실행 서비스에 더 적합합니다. 두 역할은 서로 보완할 수 있습니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.