Xiaomi AI Cubeは120Bモデルをローカルで実行――これがパーソナルAIコンピューターの未来なのか?

ローレン・パンZimaSpaceの創設者です そして 高く評価されているZimaBoardシリーズの設計者です。産業デザインと組み込みエンジニアリングを融合させ、 Laurenは明確な使命を持ってZimaSpaceを立ち上げました:パーソナルクラウドコンピューティングを民主化することです 。彼はハードウェアは「ハック可能」であり美しくあるべきだと信じています—産業用サーバーと消費者向けガジェットのギャップを埋めること。現在、彼はエンジニアリングチームを率いて、クリエイターが デジタルライフを完全にコントロールできるツールを構築していますfull control over their digital lives.

Xiaomi AI Cubeは、120Bモデルとはるかに小さい3Bモデルの両方をローカルで利用できるよう、十分なメモリと専用ローカルコンピューティングを1台の150Wボックスに搭載するという、独特な発想に基づくプロトタイプのデスクトップAIコンピューターです。 Xiaomiは、80GBのユニファイドメモリ、3つのXRINGプロセッサー(O3、O100、D100)、そしてフロントエンド開発や複雑なコーディングなどのワークロード向けの高速/低速モデル切り替えを確認しています。

しかし、「120Bをローカルで実行できる」というのは容量に関する主張であり、性能ベンチマークの全体像ではありません。Xiaomiは、Cubeの完全なメモリ構成、120Bの量子化方式、利用可能なコンテキスト、生成速度、ソフトウェア互換性、価格、または小売発売日を公表していません。現時点では、AI Cubeは購入者が評価できる完成品というより、新しいパーソナルAIコンピューターのアーキテクチャを示す先行例として捉える方が適切です。

Xiaomi AI Cubeとは?

Xiaomi AI Cubeは、3つの自社製XRINGプロセッサーと80GBのユニファイドメモリを組み合わせ、大規模モデルのローカル推論を実現するエンジニアリングプロトタイプです。

AI Cubeの詳細 Xiaomiが確認したこと
ステータス エンジニアリングプロトタイプ
プロセッサー XRING O3+O100+D100
メモリ 80GBのユニファイドメモリ
ローカルモデル 120Bモデル+3Bモデル
モデルの挙動 高速/低速モデルの切り替え
持続性能 最大150W
実証されたワークロード フロントエンド開発と複雑なコーディング
価格 未発表
発売日 未発表

Xiaomiによる公開説明は、公式AI Cubeプロトタイプの投稿で確認できます。

120Bという数字は注目を集めますが、より重要なのは、そのサイズのモデルをデスク上で実用化するために何が必要かという点です。

120Bモデルをローカルで実行することが、なぜそれほど大きな意味を持つのでしょうか?

1200億パラメータのモデルは、たちまちメモリの問題を引き起こします。

16ビット精度では、重みだけでおよそ次の容量が必要になります。

120B × 2バイト ≈ 240GB

8ビット精度では約120GBまで減少し、4ビットの重みはランタイムのオーバーヘッドを含める前でおよそ60GBです。

そのため、80GBのマシンで高度に量子化された120Bモデルを扱うことは現実的に思えますが、重みを収めることは導入の一部にすぎません。

推論には次のメモリも必要です。

  • 量子化メタデータ、
  • ランタイムバッファ、
  • KVキャッシュ、
  • コンテキストトークン、
  • システムソフトウェア、
  • さらに、マルチモーダルな状態も含まれる可能性があります。

モデルを適合させることと、実用的な速度とコンテキストで実行することは同じではありません。

このため、実用的なローカルAIハードウェア要件は、単純なRAM容量一つではなく、モデルサイズ、量子化、コンテキスト、同時実行数によって決まります。

80GBの統合メモリで本当に120Bモデルを実行できるのか?

量子化された120Bモデルは80GBクラスのメモリ容量に収まる可能性がありますが、XiaomiはCubeで実際に利用可能なコンテキスト長やスループットを算出するための十分な情報をまだ公開していません。

未解決の変数には次のものがあります。

  • 正確な120Bモデルのバージョン、
  • 量子化形式、
  • 実用的なコンテキスト長、
  • 最初のトークンが生成されるまでの時間、
  • 生成速度、
  • 3Bモデルと120Bモデルが同時に常駐し続けるかどうか。

技術的には読み込めても、実用にならないほど低速で生成するモデルは、応答性の高いパーソナルアシスタントとは大きく異なります。長いコンテキストや複数のエージェントの同時実行でも、追加のメモリを大量に消費する可能性があります。

この違い、つまりモデルを格納できることと実用的に展開できることの違いは、より大規模なオープンモデルが家庭用ハードウェアへ移行する中で特に重要です。同様の制約は現在のホームサーバー向けAIワークロードにも見られます。モデルを単に格納できるだけでは、常時稼働に適した快適な体験が保証されません。

Xiaomi AI Cubeは本当に1.22TB/sのメモリ帯域幅を備えているのか?

XiaomiはXRING O100アクセラレーターについて1.22TB/sの近接メモリ帯域幅を公表していますが、AI Cubeの80GBメモリプール全体が1.22TB/sで動作することを意味するわけではありません。

この違いは、プロトタイプをめぐる最も重要な技術的疑問の一つとなっています。

O100は3Dウェハーレベル・スタッキングを採用した高帯域幅AIアクセラレーターとして位置付けられています。D100は、はるかに大容量のメモリ構成をサポートする、別個の高演算性能AIプロセッサーです。一方、O3は汎用SoCです。

Xiaomiは、次の点を説明するメモリブロック図をまだ公開していません。

  • 80GBのプールがどのように分配されるのか、
  • どのチップがどのメモリを所有するのか、
  • O100の最高帯域幅経路にアクセスできる部分、
  • チップ間帯域幅、
  • 120Bモデルの重みが格納される場所、
  • または、KVキャッシュが保持される場所。

利用可能なプロセッサー仕様は、Xiaomi XRINGの発表仕様にまとめられています。

ローカルAIユーザーは、ほぼ直ちに同じ曖昧さに気づきました。大規模なLocalLLaMA AI Cubeに関する議論では、O100の帯域幅がD100やCubeのより大きなメモリプールとどのように関係するのかが大きな焦点となりました。

Xiaomiがトポロジーを公開するまで、最も無難な解釈は単純です。1.22TB/sはO100の仕様であり、AI Cubeの80GBメモリのすべてのバイトに対して確認された帯域幅の数値ではありません。

ローカルAIでメモリ帯域幅が重要なのはなぜか?

大規模モデルの推論では、トークンを生成しながらモデルデータをメモリ上で繰り返し移動させます。つまり、アクセラレーターの演算能力は性能を決める要素の一部にすぎません。

デバイスは膨大なTOPSをうたっていても、データが演算ユニットに届くまで待機し続けることがあります。そのため、トークン単位のデコードはメモリ帯域幅の影響を強く受ける可能性があります。

そのため、Xiaomiの新しいチップより6nmプロセスが進んでいないように見えるにもかかわらず、O100のアーキテクチャは興味深いのです。その設計は、単に公称演算性能を最大化するのではなく、高帯域幅の近メモリAIワークロードを対象としています。

ローカルLLMでは、巨大なTOPS値よりも、メモリ帯域幅のほうが実用的な推論性能をよく示す場合があります。

しかし、Xiaomiが個々のチップ仕様ではなくシステムレベルのベンチマークを公開するまで、Cubeの実際の120B性能は不明なままです。

Xiaomi AI Cubeが120Bを実行できるのに、なぜ3Bモデルを動かすのか?

小型の3Bモデルのほうが、看板となる120Bモデルよりも、AI Cubeのアーキテクチャについて多くを明らかにする可能性があります。

すべてのリクエストに利用可能な最大のモデルを使うと、最先端レベルの推論を必要としない処理に、レイテンシー、メモリ帯域幅、電力を浪費することになります。

小型モデルは、次のような定型的な処理を担える可能性があります。

  • 意図の検出、
  • 分類、
  • ルーティング、
  • 短い変換処理、
  • メタデータの抽出、
  • ファイルのタグ付け、
  • 軽量なバックグラウンドタスク。

その後、大型モデルを複雑なコーディング、計画立案、難しい推論、長文の統合といった、より困難な作業に専念させられます。

これにより、実用的なアーキテクチャが実現します。

ベース負荷には小型のローカルモデルを使い、負荷が高まったらより大型のローカルモデルに切り替える。

Xiaomiは高速/低速の切り替えを確認していますが、実際のルーティングポリシーは公開していません。したがって、特定のタスクがすでに3Bモデルまたは120Bモデルに割り当てられていると主張するのは推測にすぎません。

より広い観点では、この考え方は現代のローカルAIおよびフロンティアAIのワークロードにすでに関係しています。あらゆるリクエストで最も強力なモデルをデフォルトにする必要はありません。

Xiaomi AI Cubeにはなぜ3種類の異なるAIチップが必要なのか?

一般的なローカルAIワークステーションは、汎用CPUにシステムRAMと1基以上のディスクリートGPUを組み合わせます。

一方、AI Cubeは公開上の役割が異なる3つのプロセッサーを組み合わせています。

XRINGチップ 公開上の位置づけ
O3 CPU、GPU、NPUを搭載した汎用フラッグシップSoC
O100 メモリ近接演算に重点を置いた高帯域幅AIアクセラレーター
D100 大容量メモリ構成に対応する高性能AIプロセッサー

これは異種ローカルAIコンピューティングを示唆しています。つまり、1基の大型GPUにすべてを任せるのではなく、ワークロードの特性に応じて異なるシリコンを使い分けるということです。

しかし、Xiaomiはチップごとの実行マップを公開していません。O3が小規模モデルを実行するのか、O100が特定の推論段階を担うのか、D100が大規模モデルの実行経路を担当するのかは、まだ分かっていません。

これらは妥当な工学的仮説ですが、実装の詳細が確認されたわけではありません。

Xiaomi AI CubeはDGX Sparkの代替を目指しているのか?

アーキテクチャ上、AI CubeはDGX Sparkや大容量メモリを搭載したApple Siliconシステムと同じ、新たに登場しつつあるカテゴリーに属します。これは、非常に大規模なAIモデルをユーザーの身近に置くために設計されたパーソナルハードウェアです。

実際のところ、直接比較を行うのは時期尚早です。

項目 Xiaomi AI Cube 今後検証が必要な点
メモリ 80GBのユニファイドメモリ 完全なトポロジーと実効帯域幅
計算処理 O3 + O100 + D100 実際のモデルスループット
モデル容量 120B + 3Bのローカル展開 量子化、コンテキスト、同時実行数
ソフトウェア 公開情報が不完全 ランタイムとフレームワークのサポート
消費電力 継続運用時の目標150W 測定済みの推論効率
価格 未発表 成熟したプラットフォームに対する実質的な価値

DGX Sparkの優位性は、単なるハードウェアではありません。NVIDIAは、CUDA、成熟したライブラリ、推論ランタイム、そして確立された開発者エコシステムを提供しています。

そのため、AI Cubeに関する次の疑問は、シリコンよりもソフトウェアに重点が置かれます。

Xiaomi AI Cubeは実際にどのソフトウェアを実行できるのか?

ハードウェアの性能だけで、実用的なローカルAIプラットフォームが自動的に構築されるわけではありません。

開発者は最終的に、次のサポートについて明確な回答を求めるでしょう。

  • llama.cpp、
  • Ollama、
  • vLLM、
  • PyTorch、
  • Linux開発環境、
  • Dockerまたはコンテナーワークロード、
  • GGUFおよび一般的な量子化形式、
  • OpenAI互換API、
  • ファインチューニングフレームワーク、
  • 現在のエージェント用ハーネス。

Xiaomiはコーディング処理を実演していますが、AI Cubeの広範なサードパーティー互換性マトリックスは公開していません。

これは、ランタイムサポートが弱い高性能アクセラレーターよりも、成熟したカーネル、安定したドライバー、容易なモデル変換、そして大規模な開発者コミュニティに支えられた低速なハードウェアのほうが有用な場合があるためです。

この懸念は、LocalLLaMAの議論でも繰り返し現れます。ユーザーはAI Cubeを80GBや120Bという数値だけで評価しているのではありません。XRINGが、これらの仕様を実用的なものにするために必要なソフトウェアエコシステムを構築できるかどうかを問うています。

パーソナルAIコンピューターには、AIアクセラレーターだけでなくソフトウェアプラットフォームも必要です。

AI CubeはPC、ワークステーション、それとも常時稼働するAIサーバーなのか?

AI Cubeは、従来のPCというよりもパーソナルAIコンピュートアプライアンスとしてのほうが興味深いかもしれません。

従来のPCは主にインタラクティブです。アプリケーションはユーザーが開いたときに実行されます。一方、パーソナルAIノードはモデルを常時利用可能な状態に保ち、次の用途に対応できます。

  • コーディングエージェント、
  • バックグラウンド推論、
  • ドキュメント処理、
  • プライベートなマルチモーダル分析、
  • ローカルAI API、
  • RAGワークフロー、
  • 長時間稼働する自動化。

これにより、ハードウェアの優先事項は、永続メモリ、持続的な冷却、予測可能な推論、高帯域幅、安定したローカルサービスへと変わります。

そのため、新たに登場しているローカルファーストAIエージェントも、一般的なデスクトップアプリケーションよりインフラのワークロードに近いものになりつつあります。

AI Cubeをコンピュートノードにするなら、AIデータはどこに保存するのか?

専用AIコンピューターは、推論と永続データが異なる問題を解決するため、ホームサーバーやNASを自動的に置き換えるものではありません。

AIコンピュートノードは、次の要素を中心に最適化されます。

  • モデルウェイト、
  • 広帯域メモリ、
  • アクセラレーター、
  • 低遅延推論、
  • 推論および推論処理のワークロード。

永続的なローカルインフラは、次の要素を中心に最適化されます。

  • ドキュメント、
  • 写真と動画、
  • コードリポジトリ、
  • RAGのソースファイル、
  • ベクトルデータベース、
  • エージェントのメモリ、
  • ログ、
  • バックアップ、
  • 常時稼働するアプリケーション。

この違いが重要なのは、AIコンピューティングは個人データより速く変化するためです。モデル、アクセラレーター、ランタイムは数年ごとに置き換わる可能性がありますが、ファイル、プロジェクト履歴、個人的な知識は安定して保持されるべきです。

同じ区別は、ローカルAIとファイルストレージを1台のマシンで共有するか、用途別のシステムに分けるかを決める際にも現れます。

永続的に稼働するサーバーは、最大規模のモデルを同じ筐体でホストする必要なく、プライベートNAS AIアシスタントが利用するプライベートファイル、検索インデックス、永続的なコンテキストも提供できます。

AI Cubeは、パーソナルAIのコンピューティングは交換可能になり得る一方、パーソナルAIのデータは永続的に保持される可能性を示しています。

Xiaomi AI Cubeについて、まだ何がわかっていないのか?

質問 現在の回答
120Bをローカルで実行できますか? Xiaomiは対応していると述べています
どの120Bモデルですか? Xiaomiが公開しているプロトタイプの詳細では、完全には文書化されていません
どのように量子化されていますか? 未開示
利用できるコンテキスト量はどのくらいですか? 未開示
120Bモデルの速度はどのくらいですか? 未開示
80GB全体が1.22TB/sで動作しますか? 未確定。1.22TB/sはO100の仕様です
3Bと120Bはどのように振り分けられますか? 高速/低速の切り替えは確認済み。ポリシーは未開示
Ollamaまたはllama.cppに対応していますか? 公開情報では未確認
価格はいくらですか? 未発表
いつ購入できますか? 小売発売日は未発表

また、Xiaomiが別途実施したO100デモ端末のベンチマーク数値をAI Cubeと混同しないことも重要です。

別のO3 + O100プロトタイプでは、はるかに小規模なMiMoワークロードで高いトークン処理性能が実証されました。これは、AI Cubeが120Bモデルを同じ速度で実行することを意味しません。この違いについては、Xiaomiのプロトタイプデモンストレーションで説明しています。

Xiaomi AI Cubeは重要になるために安価である必要があるのか?

アーキテクチャのデモンストレーションとしては、いいえ。新しいパーソナルコンピューティングカテゴリーとしては、間違いなくそうです。

大容量メモリのローカルAIハードウェアが高性能コンシューマーワークステーション相当の価格帯に達すれば、より多くの開発者にとって100Bクラスのローカル推論が実用的になる可能性があります。

最終価格が数倍高くなる場合、同じハードウェアでも大衆向けのパーソナルAIコンピューターではなく、専門家向けのAIワークステーションになります。

Redditユーザーはすでに価格について盛んに推測していますが、Xiaomiはまだ価格を発表していません。製品が商用化されるまでは、価格の見積もりは推測にとどめるべきです。

このため、長期的なローカルAIのコスト比較は、ハードウェア価格だけの場合よりも重要です。利用率、モデルサイズ、電力、クラウド料金の上昇が、専用ローカルコンピューティングを経済的に合理化できるかどうかに影響します。

Xiaomi AI CubeはパーソナルAIコンピューターの未来なのか?

おそらく最終的なパーソナルAIコンピューターがこのプロトタイプとまったく同じ外観にならないとしても、アーキテクチャの面ではそう言えるでしょう。

重要な考え方は次のとおりです。

  • モデルの重みに合わせた大容量共有メモリ、
  • 広帯域幅のAIアクセラレーション、
  • 異種プロセッサー、
  • 小規模モデルと大規模モデルを同時に利用可能、
  • 一時的なバースト処理ではなく、持続的なコンピュート、
  • ローカルモデルの実行、
  • そして、常時利用可能なAIサービス。

これは、通常のPCにNPUを追加してAI PCと呼ぶだけのことよりも重要です。

AI Cubeはモデルのワークロードを起点とし、それを中心にマシンを設計しています。

このプロトタイプには、120Bの性能、メモリトポロジー、ソフトウェアサポート、価格、提供時期など、依然として大きな未解決の疑問があります。しかし、そのアーキテクチャは、ローカルAIが専用のコンピュート層を持ち、ファイル、メモリ、長期的な状態は永続的なローカルインフラストラクチャに残るという、十分に実現可能な未来を示しています。

パーソナルAIコンピューターは、ときどきAIを実行するPCではないかもしれません。ユーザーの永続データを、その年に最も高速なアクセラレーターが何であれ、そこから独立させたまま、複数のモデルを提供するよう設計された、常時利用可能なローカルコンピュートノードになる可能性があります。

FAQ:Xiaomi AI Cubeとローカル120Bモデル

Xiaomi AI Cubeはクラウドなしで120Bモデルを実行できますか?

Xiaomiによると、このプロトタイプは120Bモデルをローカルで展開できます。ただし、同社はその展開で使用した正確な量子化方式、コンテキスト長、ランタイム構成を公開していません。

120Bモデルにはどれくらいのメモリが必要ですか?

120Bモデルの未加工の重みには、ランタイムのオーバーヘッドを除いて、FP16でおよそ240GB、8ビットで120GB、4ビットで約60GBが必要です。実際のメモリ使用量は、量子化メタデータ、KVキャッシュ、コンテキスト長、推論ソフトウェアによっても変わります。

Xiaomi AI CubeはOllamaに対応していますか?

XiaomiはOllamaのサポートを公に確認していません。Ollama、llama.cpp、vLLM、その他の一般的なローカルAIランタイムとの互換性は、依然として最大の未解決ソフトウェア課題の一つです。

Xiaomi AI Cubeはどの120Bモデルを実行しますか?

公開報道では、このプロトタイプはXiaomiのMiMoモデルファミリーと関連付けられていますが、Xiaomiが公開したAI Cubeの説明では、完全なモデル名・バージョンや量子化仕様は示されていません。

Xiaomi AI Cubeは購入できますか?

現時点ではなりません。AI Cubeはエンジニアリングプロトタイプとして発表されており、Xiaomiはこの特定のデバイスの販売価格や出荷時期を発表していません。

Xiaomi AI CubeはNASやホームサーバーの代替になりますか?

必ずしもそうではありません。AI Cubeは大容量メモリを活用したAI推論向けに最適化されている一方、NASやホームサーバーは、永続ファイル、RAGソース、データベース、バックアップ、エージェントの状態、その他の常時稼働サービスに適しています。この2つの役割は相互に補完できます。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.