Le Xiaomi AI Cube est un ordinateur de bureau prototype dédié à l’IA, fondé sur une idée originale : intégrer suffisamment de mémoire et de puissance de calcul locale spécialisée dans un boîtier de 150 W pour conserver localement un modèle de 120 milliards de paramètres et un modèle bien plus petit de 3 milliards. Xiaomi a confirmé 80 Go de mémoire unifiée, trois processeurs XRING — O3, O100 et D100 — ainsi qu’un basculement rapide/lent entre les modèles pour des charges de travail telles que le développement front-end et la programmation complexe.
Mais « exécute localement un modèle de 120 milliards » est une affirmation de capacité, et non un benchmark complet des performances. Xiaomi n’a pas publié la topologie complète de la mémoire du Cube, la quantification du modèle de 120 milliards, le contexte utilisable, la vitesse de génération, la compatibilité logicielle, le prix ni la date de commercialisation. Pour l’instant, l’AI Cube est davantage un aperçu d’une nouvelle architecture d’ordinateur personnel dédié à l’IA qu’un produit fini que les acheteurs peuvent évaluer.
Qu’est-ce que le Xiaomi AI Cube ?
Le Xiaomi AI Cube est un prototype d’ingénierie qui associe trois processeurs XRING conçus en interne à 80 Go de mémoire unifiée pour l’inférence locale de grands modèles.
| Détails de l’AI Cube | Ce que Xiaomi a confirmé |
|---|---|
| Statut | Prototype d’ingénierie |
| Processeurs | XRING O3 + O100 + D100 |
| Mémoire | Mémoire unifiée de 80 Go |
| Modèles locaux | Modèle de 120 milliards + modèle de 3 milliards |
| Comportement du modèle | Basculement rapide/lent entre les modèles |
| Performances soutenues | Jusqu’à 150 W |
| Charges de travail démontrées | Développement front-end et programmation complexe |
| Prix | Non annoncé |
| Date de sortie | Non annoncé |
La description publique de Xiaomi peut être consultée dans l’publication officielle sur le prototype AI Cube.
Le nombre 120 milliards attire l’attention, mais la question la plus utile est de savoir ce qu’il faut pour rendre pratique sur un bureau un modèle de cette taille.
Pourquoi l’exécution locale d’un modèle de 120 milliards de paramètres est-elle si importante ?
Un modèle de 120 milliards de paramètres pose immédiatement un problème de mémoire.
Avec une précision de 16 bits, les seuls poids bruts nécessiteraient environ :
120 milliards × 2 octets ≈ 240 Go
Avec une précision de 8 bits, cela descend vers 120 Go, tandis que les poids en 4 bits occupent environ 60 Go avant la surcharge d’exécution.
Cela rend plausible l’utilisation d’une machine de 80 Go avec un modèle de 120 milliards de paramètres fortement quantifié, mais faire tenir les poids ne constitue qu’une partie du déploiement.
L’inférence nécessite également de la mémoire pour :
- les métadonnées de quantification,
- les tampons d’exécution,
- le cache KV,
- les jetons de contexte,
- les logiciels système,
- et potentiellement un état multimodal.
Ajuster un modèle n’est pas la même chose que l’exécuter à une vitesse et avec un contexte utiles.
C’est pour la même raison que les besoins matériels pratiques pour l’IA locale dépendent de la taille du modèle, de la quantification, du contexte et de la concurrence, plutôt que d’une simple quantité de RAM.
80 Go de mémoire unifiée peuvent-ils vraiment exécuter un modèle 120B ?
Oui, un modèle 120B quantifié peut vraisemblablement tenir dans un budget mémoire de 80 Go, mais Xiaomi n’a pas publié suffisamment d’informations pour calculer le contexte réellement exploitable ou le débit du Cube.
Les variables encore inconnues comprennent :
- la version exacte du modèle 120B,
- le format de quantification,
- la longueur de contexte exploitable,
- le délai avant le premier jeton,
- la vitesse de génération,
- et si les modèles 3B et 120B restent simultanément en mémoire.
Un modèle qui se charge techniquement mais génère du texte à une vitesse inutilisable est très différent d’un assistant personnel réactif. Les longs contextes et plusieurs agents simultanés peuvent également consommer une quantité importante de mémoire supplémentaire.
Cette distinction — capacité à contenir le modèle contre déploiement réellement exploitable — est particulièrement importante alors que les modèles ouverts de grande taille arrivent sur le matériel domestique. Des contraintes similaires apparaissent dans les charges de travail IA actuelles sur les serveurs domestiques, où le simple fait de faire tenir un modèle ne garantit pas une expérience satisfaisante en fonctionnement permanent.
Le Xiaomi AI Cube dispose-t-il vraiment d’une bande passante mémoire de 1,22 To/s ?
Xiaomi a publié une valeur de bande passante mémoire proche de la mémoire de 1,22 To/s pour l’accélérateur XRING O100, mais cela ne prouve pas que l’ensemble du pool mémoire de 80 Go de l’AI Cube fonctionne à 1,22 To/s.
Cette distinction est devenue l’une des questions techniques les plus importantes concernant le prototype.
L’O100 est présenté comme un accélérateur IA à large bande passante utilisant un empilement 3D au niveau de la tranche. Le D100 est un processeur IA distinct, axé sur le calcul, prenant en charge des configurations mémoire beaucoup plus importantes, tandis que l’O3 est le SoC polyvalent.
Xiaomi n’a pas encore publié de schéma mémoire expliquant :
- comment le pool de 80 Go est réparti,
- quelle puce possède quelle mémoire,
- quelle partie peut accéder au chemin à bande passante maximale de l’O100,
- la bande passante interpuces,
- où résident les poids du modèle 120B,
- ou là où le cache KV est conservé.
Les spécifications des processeurs disponibles sont résumées dans les spécifications de lancement de Xiaomi XRING.
Les utilisateurs de l’IA locale ont presque immédiatement remarqué la même ambiguïté. Une vaste discussion LocalLLaMA sur AI Cube s’est largement concentrée sur le rapport entre la bande passante d’O100 et D100, ainsi que sur le pool de mémoire plus important de la Cube.
Tant que Xiaomi n’aura pas publié la topologie, l’interprétation la plus prudente est simple : 1.22TB/s est une spécification d’O100, et non une valeur de bande passante confirmée pour chaque octet des 80GB de mémoire d’AI Cube.
Pourquoi la bande passante mémoire est-elle importante pour l’IA locale ?
L’inférence de modèles volumineux déplace à plusieurs reprises les données du modèle à travers la mémoire lors de la génération des tokens. Cela signifie que les calculs de l’accélérateur ne constituent qu’une partie des performances.
Un appareil peut afficher un nombre de TOPS colossal tout en attendant que les données parviennent à ses unités de calcul. Le décodage token par token peut donc devenir fortement dépendant de la bande passante mémoire.
C’est pourquoi l’architecture d’O100 est intéressante, même si son procédé de gravure en 6 nm semble moins avancé que celui des puces plus récentes de Xiaomi. Sa conception cible les charges de travail d’IA à large bande passante et à mémoire proche, plutôt que la simple maximisation de la puissance de calcul annoncée.
Pour les LLM locaux, la bande passante mémoire peut parfois en dire davantage sur l’inférence pratique qu’un nombre colossal de TOPS.
Mais les performances réelles du modèle 120B de la Cube resteront inconnues jusqu’à ce que Xiaomi publie des benchmarks au niveau du système plutôt que les spécifications de chaque puce.
Pourquoi exécuter un modèle 3B si Xiaomi AI Cube peut exécuter un modèle 120B ?
Le petit modèle 3B pourrait en réalité en révéler davantage sur l’architecture d’AI Cube que le modèle phare 120B.
Utiliser le plus grand modèle disponible pour chaque requête gaspillerait de la latence, de la bande passante mémoire et de l’énergie pour des tâches qui ne nécessitent pas un raisonnement de niveau avancé.
Un petit modèle peut potentiellement gérer les charges de travail courantes telles que :
- la détection des intentions,
- la classification,
- le routage,
- les transformations courtes,
- l’extraction des métadonnées,
- l’étiquetage des fichiers,
- et les tâches d’arrière-plan légères.
Le modèle plus grand peut alors être réservé aux tâches plus difficiles, comme le codage complexe, la planification, le raisonnement difficile et la synthèse longue.
Cela crée une architecture utile :
petit modèle local pour la charge de base, modèle local plus grand pour la montée en puissance.
Xiaomi a confirmé la commutation rapide/lente, mais n’a pas publié la politique de routage effective. Il serait donc spéculatif d’affirmer que certaines tâches sont déjà attribuées au modèle 3B ou au modèle 120B.
L’idée générale est déjà pertinente pour les charges de travail modernes d’IA locale et d’IA de pointe : le modèle le plus puissant n’a pas besoin d’être utilisé par défaut pour chaque requête.
Pourquoi Xiaomi AI Cube a-t-il besoin de trois puces d’IA différentes ?
Une station de travail d’IA locale classique associe généralement un CPU polyvalent à de la mémoire vive et à un ou plusieurs GPU dédiés.
AI Cube associe au contraire trois processeurs aux rôles publics différents.
| Puce XRING | Positionnement public |
|---|---|
| O3 | SoC phare polyvalent intégrant un CPU, un GPU et un NPU |
| O100 | Accélérateur d’IA à large bande passante axé sur le calcul proche de la mémoire |
| D100 | Processeur d’IA à hautes performances prenant en charge de grandes configurations mémoire |
Cela suggère un calcul d’IA local hétérogène : des composants en silicium différents pour des caractéristiques de charge de travail différentes, au lieu de demander à un seul grand GPU de tout exécuter.
Cependant, Xiaomi n’a pas publié de schéma d’exécution détaillé puce par puce. Nous ne savons pas encore si O3 exécute le petit modèle, si O100 gère une étape d’inférence particulière ou si D100 prend en charge le chemin d’exécution du modèle plus volumineux.
Il s’agit d’hypothèses d’ingénierie raisonnables, et non de détails d’implémentation confirmés.
Xiaomi AI Cube cherche-t-il à devenir une alternative à DGX Spark ?
Sur le plan architectural, AI Cube appartient à la même catégorie émergente que DGX Spark et les systèmes Apple Silicon à mémoire élevée : du matériel personnel conçu pour maintenir des modèles d’IA exceptionnellement volumineux à proximité de l’utilisateur.
En pratique, une comparaison directe est prématurée.
| Domaine | Xiaomi AI Cube | Ce qui doit encore être démontré |
|---|---|---|
| Mémoire | Mémoire unifiée de 80 Go | Topologie complète et bande passante utilisable |
| Calcul | O3 + O100 + D100 | Débit réel des modèles |
| Capacité des modèles | Déploiement local de 120B + 3B | Quantification, contexte et concurrence |
| Logiciels | Détails publics incomplets | Prise en charge des environnements d’exécution et des frameworks |
| Consommation | Objectif soutenu de 150 W | Efficacité d’inférence mesurée |
| Prix | Non annoncé | Valeur réelle face aux plateformes matures |
L’avantage de DGX Spark ne tient pas simplement au matériel. NVIDIA apporte CUDA, des bibliothèques matures, des environnements d’inférence et un écosystème de développeurs bien établi.
La prochaine question concernant AI Cube porte donc moins sur le silicium que sur les logiciels.
Quels logiciels Xiaomi AI Cube fera-t-il réellement fonctionner ?
La capacité matérielle ne suffit pas automatiquement à créer une plateforme d’IA locale utile.
Les développeurs voudront tôt ou tard obtenir des réponses claires sur la prise en charge de :
- llama.cpp,
- Ollama,
- vLLM,
- PyTorch,
- les environnements de développement Linux,
- les charges de travail Docker ou conteneurisées,
- GGUF et les formats de quantification courants,
- les API compatibles avec OpenAI,
- les frameworks de fine-tuning,
- et les frameworks d’agents actuels.
Xiaomi a présenté des charges de travail de programmation, mais n’a pas publié de matrice générale de compatibilité tierce pour AI Cube.
C’est important, car un accélérateur puissant doté d’un support d’exécution limité peut être moins utile qu’un matériel plus lent soutenu par des noyaux matures, des pilotes stables, une conversion facile des modèles et une vaste communauté de développeurs.
Cette préoccupation revient également dans les discussions de LocalLLaMA. Les utilisateurs n’évaluent pas l’AI Cube uniquement sur la base de ses 80 Go et 120B ; ils se demandent si XRING peut développer l’écosystème logiciel nécessaire pour rendre ces caractéristiques utiles.
Un ordinateur IA personnel a besoin d’une plateforme logicielle, pas seulement d’un accélérateur IA.
L’AI Cube est-il un PC, une station de travail ou un serveur IA toujours actif ?
L’AI Cube peut être plus intéressant en tant qu’appareil personnel de calcul IA qu’en tant que PC conventionnel.
Un PC traditionnel est principalement interactif : les applications s’exécutent lorsque l’utilisateur les ouvre. Un nœud IA personnel peut maintenir les modèles disponibles en permanence pour :
- agents de programmation,
- inférence en arrière-plan,
- traitement des documents,
- analyse multimodale privée,
- API d’IA locales,
- flux de travail RAG,
- et l’automatisation de longue durée.
Cela fait évoluer les priorités matérielles vers une mémoire persistante, un refroidissement continu, une inférence prévisible, une large bande passante et des services locaux stables.
C’est aussi pourquoi les agents IA privilégiant le local émergents ressemblent de plus en plus à des charges de travail d’infrastructure plutôt qu’à des applications de bureau ordinaires.
Si l’AI Cube est le nœud de calcul, où résident vos données IA ?
Un ordinateur IA dédié ne remplace pas automatiquement un serveur domestique ou un NAS, car l’inférence et les données persistantes répondent à des besoins différents.
Un nœud de calcul IA est optimisé pour :
- les poids des modèles,
- la mémoire à large bande passante,
- les accélérateurs,
- l’inférence à faible latence,
- et les charges de travail de raisonnement.
L’infrastructure locale persistante est optimisée pour :
- documents,
- photos et vidéos,
- dépôts de code,
- fichiers sources RAG,
- bases de données vectorielles,
- mémoire des agents,
- journaux,
- sauvegardes,
- et des applications fonctionnant en permanence.
Cette distinction est importante, car le calcul IA évolue plus rapidement que les données personnelles. Les modèles, les accélérateurs et les environnements d’exécution peuvent être remplacés tous les quelques années ; les fichiers, l’historique des projets et les connaissances privées doivent rester stables.
La même distinction apparaît lorsqu’il s’agit de décider si l’IA locale et le stockage de fichiers doivent partager une même machine ou être répartis entre des systèmes spécialisés.
Un serveur persistant peut également fournir les fichiers privés, les index de récupération et le contexte durable utilisés par un assistant IA privé sur NAS, sans exiger que le même boîtier héberge le modèle le plus volumineux possible.
L’AI Cube laisse penser que le calcul personnel pour l’IA pourrait devenir remplaçable, tandis que les données personnelles liées à l’IA resteraient persistantes.
Que ne savons-nous toujours pas sur le Xiaomi AI Cube ?
| Question | Réponse actuelle |
|---|---|
| Peut-il exécuter le modèle 120B localement ? | Xiaomi répond par l’affirmative |
| Quel modèle 120B exactement ? | Pas entièrement documenté dans les informations publiques détaillées de Xiaomi sur le prototype |
| Comment est-il quantifié ? | Non communiqué |
| Quelle quantité de contexte peut être utilisée ? | Non communiqué |
| À quelle vitesse le modèle 120B s’exécute-t-il ? | Non communiqué |
| Les 80 Go fonctionnent-ils tous à 1,22 To/s ? | Non établi ; 1,22 To/s est une spécification de l’O100 |
| Comment les modèles 3B et 120B sont-ils répartis ? | Basculement rapide/lent confirmé ; politique non communiquée |
| Prend-il en charge Ollama ou llama.cpp ? | Pas confirmé publiquement |
| Combien coûtera-t-il ? | Non annoncé |
| Quand pourrez-vous l’acheter ? | Aucune date de sortie commerciale annoncée |
Il est également important de ne pas combiner les chiffres de performance de la démonstration distincte du terminal O100 de Xiaomi avec ceux de l’AI Cube.
Un autre prototype O3 + O100 a démontré un débit élevé de jetons sur une charge de travail MiMo bien plus petite. Cela ne signifie pas que l’AI Cube exécute son modèle 120B à la même vitesse. Cette distinction est expliquée dans les démonstrations de prototypes de Xiaomi.
Le Xiaomi AI Cube doit-il être bon marché pour être important ?
En tant que démonstration d’architecture, non. En tant que nouvelle catégorie d’informatique personnelle, absolument.
Si le matériel d’IA local doté d’une grande mémoire atteint les prix des stations de travail haut de gamme pour particuliers, il pourrait rendre l’inférence locale de modèles de classe 100B accessible à bien plus de développeurs.
Si le prix final est plusieurs fois plus élevé, le même matériel devient une station de travail spécialisée pour l’IA plutôt qu’un ordinateur personnel doté d’IA destiné au grand public.
Les utilisateurs de Reddit spéculent déjà largement sur le prix, mais Xiaomi n’en a pas annoncé. Tant qu’il n’existe pas de produit commercial, les estimations de prix doivent rester de simples spéculations.
C’est également pourquoi les comparaisons des coûts de l’IA locale à long terme sont plus importantes que le seul prix du matériel : le taux d’utilisation, la taille du modèle, l’électricité et l’augmentation des coûts du cloud influencent tous la rentabilité d’un calcul local dédié.
Le Xiaomi AI Cube est-il l’avenir de l’ordinateur personnel doté d’IA ?
Peut-être sur le plan architectural, même si l’ordinateur personnel doté d’IA final ne ressemble pas exactement à ce prototype.
Les idées importantes sont les suivantes :
- grande mémoire partagée dimensionnée en fonction des poids des modèles,
- accélération de l’IA à large bande passante,
- processeurs hétérogènes,
- petits et grands modèles disponibles simultanément,
- calcul soutenu plutôt que limité à des accélérations ponctuelles,
- exécution de modèles locaux,
- et des services d’IA qui restent disponibles en continu.
C’est plus important que d’ajouter simplement un NPU à un PC classique et de l’appeler un PC IA.
L’AI Cube part de la charge de travail du modèle et conçoit la machine autour de celle-ci.
Le prototype soulève encore d’importantes questions sans réponse : performances avec les modèles 120B, architecture mémoire, prise en charge logicielle, prix et disponibilité. Mais son architecture laisse entrevoir un avenir plausible où l’IA locale disposerait de sa propre couche de calcul dédiée, tandis que les fichiers, la mémoire et l’état à long terme resteraient sur une infrastructure locale persistante.
L’ordinateur personnel doté d’IA ne sera peut-être pas un PC qui exécute occasionnellement des tâches d’IA. Il pourrait s’agir d’un nœud de calcul local toujours disponible, conçu pour servir plusieurs modèles, tandis que les données durables de l’utilisateur restent indépendantes de l’accélérateur qui se trouve être le plus rapide cette année.
FAQ : Xiaomi AI Cube et modèles locaux 120B
Le Xiaomi AI Cube peut-il exécuter un modèle 120B sans le cloud ?
Xiaomi affirme que le prototype peut déployer localement un modèle 120B. Toutefois, l’entreprise n’a pas publié la quantification exacte, la longueur du contexte ni la configuration d’exécution utilisées pour ce déploiement.
De combien de mémoire un modèle 120B a-t-il besoin ?
Les poids bruts d’un modèle 120B nécessitent environ 240 Go en FP16, 120 Go en 8 bits et environ 60 Go en 4 bits, avant la prise en compte de la surcharge liée à l’environnement d’exécution. L’utilisation réelle de la mémoire dépend également des métadonnées de quantification, du cache KV, de la longueur du contexte et du logiciel d’inférence.
Le Xiaomi AI Cube prend-il en charge Ollama ?
Xiaomi n’a pas confirmé publiquement la prise en charge d’Ollama. La compatibilité avec Ollama, llama.cpp, vLLM et d’autres environnements d’exécution d’IA locale populaires reste l’une des principales questions sans réponse concernant les logiciels.
Quel modèle 120B le Xiaomi AI Cube exécute-t-il ?
Les informations publiques ont associé le prototype à la famille de modèles MiMo de Xiaomi, mais la description publique de l’AI Cube par Xiaomi ne fournit pas les spécifications complètes du modèle, de sa version et de sa quantification.
Peut-on acheter le Xiaomi AI Cube ?
Pas pour le moment. L’AI Cube a été présenté comme un prototype d’ingénierie, et Xiaomi n’a annoncé ni prix de vente ni date d’expédition pour cet appareil précis.
Le Xiaomi AI Cube remplace-t-il un NAS ou un serveur domestique ?
Pas nécessairement. L’AI Cube est optimisé pour l’inférence IA nécessitant beaucoup de mémoire, tandis qu’un NAS ou un serveur domestique convient mieux aux fichiers persistants, aux sources RAG, aux bases de données, aux sauvegardes, à l’état des agents et aux autres services fonctionnant en continu. Ces deux rôles peuvent se compléter.
Centre Tech & IA
Plus à lire

Pourquoi Immich retraitе-t-il les données existantes après une mise à niveau ?
Immich peut retraiter les fichiers lorsque’une mise à niveau invalide des dérivés, des métadonnées, des modèles ou l’état des tâches précédents ; un traitement...

Quelles dépendances fixent le plus souvent la véritable limite de performances d’Immich ?
Immich est limité par la dépendance la plus lente sur chaque chemin mesuré : l’importation, la recherche, la navigation et la lecture peuvent donc...

Réseau Immich : comment la découverte, le DNS et le routage assurent l’accessibilité
Immich n’est accessible que lorsque la sélection du point de terminaison, le DNS, le routage, la gestion du NAT ou du proxy, le TLS...

