De Xiaomi AI Cube draait lokaal een model van 120 miljard parameters—Is dit de toekomst van de persoonlijke AI-computer?

Lauren Pan is de oprichter van ZimaSpace en de ontwerper achter de befaamde ZimaBoard-serie. Door industrieel ontwerp te combineren met embedded engineering, lanceerde Lauren ZimaSpace met een duidelijke missie: persoonlijke cloud computing democratiseren. Hij gelooft dat hardware zowel "hackbaar" als mooi moet zijn—de kloof tussen industriële servers en consumentengadgets overbruggend. Tegenwoordig leidt hij het engineeringteam dat tools ontwikkelt die makers volledige controle geven over hun digitale leven.

De Xiaomi AI Cube is een prototype van een desktop-AI-computer, gebaseerd op een ongebruikelijk idee: voldoende geheugen en gespecialiseerde lokale rekenkracht in één behuizing van 150 W plaatsen om zowel een 120B-model als een veel kleiner 3B-model lokaal beschikbaar te houden. Xiaomi heeft 80 GB uniform geheugen, drie XRING-processors—O3, O100 en D100—en snel/langzaam wisselen tussen modellen bevestigd voor werklasten zoals front-endontwikkeling en complexe codering.

Maar “lokaal 120B uitvoeren” is een capaciteitsclaim, geen volledige prestatiebenchmark. Xiaomi heeft de volledige geheugenarchitectuur, de kwantisering van het 120B-model, de bruikbare context, de generatiesnelheid, de softwarecompatibiliteit, de prijs of de releasedatum voor de verkoop nog niet gepubliceerd. Voorlopig is de AI Cube vooral nuttig als voorproefje van een nieuwe architectuur voor persoonlijke AI-computers, en niet als een afgewerkt product dat kopers kunnen beoordelen.

Wat is de Xiaomi AI Cube?

De Xiaomi AI Cube is een engineeringprototype dat drie eigen XRING-processors combineert met 80 GB uniform geheugen voor lokale inferentie met grote modellen.

Details van de AI Cube Wat Xiaomi heeft bevestigd
Status Engineeringprototype
Processors XRING O3 + O100 + D100
Geheugen 80 GB unified memory
Lokale modellen 120B-model + 3B-model
Modelgedrag Snel/langzaam wisselen tussen modellen
Aanhoudende prestaties Tot 150 W
Aangetoonde werklasten Front-endontwikkeling en complexe codering
Prijs Niet aangekondigd
Releasedatum Niet aangekondigd

Xiaomi's openbare beschrijving is te bekijken in het officiële bericht over het AI Cube-prototype.

Het getal 120B trekt de aandacht, maar de nuttigere vraag is wat ervoor nodig is om een model van die omvang praktisch op een bureau te gebruiken.

Waarom is het lokaal uitvoeren van een 120B-model zo bijzonder?

Een model met 120 miljard parameters vormt direct een geheugenprobleem.

Bij 16-bitsprecisie zouden alleen de onbewerkte gewichten ongeveer het volgende vereisen:

120B × 2 bytes ≈ 240 GB

Bij 8-bitsprecisie daalt dat richting 120 GB, terwijl gewichten van 4 bits vóór runtime-overhead ongeveer 60 GB in beslag nemen.

Dat maakt een machine van 80 GB aannemelijk voor een zwaar gekwantiseerd model van 120 miljard parameters, maar het passend maken van de gewichten is slechts een deel van de implementatie.

Inferentie heeft ook geheugen nodig voor:

  • kwantiseringsmetadata,
  • runtimebuffers,
  • KV-cache,
  • contexttokens,
  • systeemsoftware,
  • en mogelijk een multimodale toestand.

Een model passend maken is niet hetzelfde als het met een bruikbare snelheid en context uitvoeren.

Dit is dezelfde reden waarom praktische hardwarevereisten voor lokale AI afhangen van modelgrootte, kwantisering, context en gelijktijdigheid, in plaats van één eenvoudig RAM-getal.

Kan 80 GB verenigd geheugen echt een 120B-model uitvoeren?

Ja, een gekwantiseerd 120B-model past waarschijnlijk binnen een geheugenbudget van ongeveer 80 GB, maar Xiaomi heeft nog niet genoeg informatie vrijgegeven om de werkelijk bruikbare context of doorvoersnelheid van de Cube te berekenen.

De onbeantwoorde variabelen zijn:

  • de exacte versie van het 120B-model,
  • kwantiseringsindeling,
  • bruikbare contextlengte,
  • tijd tot het eerste token,
  • generatiesnelheid,
  • en of de 3B- en 120B-modellen gelijktijdig in het geheugen blijven.

Een model dat technisch gezien wordt geladen maar met een onbruikbaar lage snelheid genereert, verschilt sterk van een responsieve persoonlijke assistent. Een lange context en meerdere gelijktijdige agents kunnen ook aanzienlijk extra geheugen verbruiken.

Dat onderscheid — tussen het passen van een model en bruikbare inzet — is vooral belangrijk nu grotere open modellen hun weg vinden naar hardware voor thuisgebruik. Vergelijkbare beperkingen komen voor bij huidige AI-taken op thuisservers, waarbij het simpelweg passen van een model geen goede ervaring garandeert wanneer het systeem altijd aanstaat.

Heeft de Xiaomi AI Cube echt een geheugenbandbreedte van 1,22 TB/s?

Xiaomi heeft een near-memorybandbreedte van 1,22 TB/s gepubliceerd voor de XRING O100-versneller, maar dat bewijst niet dat de volledige AI Cube-geheugenpool van 80 GB op 1,22 TB/s werkt.

Dit onderscheid is een van de belangrijkste technische vragen rond het prototype geworden.

De O100 wordt gepositioneerd als een AI-versneller met hoge bandbreedte die gebruikmaakt van 3D-stapeling op waferniveau. De D100 is een afzonderlijke AI-processor met hoge rekenprestaties en ondersteuning voor veel grotere geheugenconfiguraties, terwijl de O3 de SoC voor algemeen gebruik is.

Xiaomi heeft nog geen geheugenblokschema gepubliceerd waarin wordt uitgelegd:

  • hoe de pool van 80 GB wordt verdeeld,
  • welke chip welk geheugen beheert,
  • welk deel toegang heeft tot het pad met de hoogste bandbreedte van de O100,
  • bandbreedte tussen chips,
  • waar de gewichten van het 120B-model zich bevinden,
  • of waar de KV-cache wordt bijgehouden.

De beschikbare processorspecificaties worden samengevat in specificaties van de Xiaomi XRING-lancering.

Gebruikers van lokale AI merkten dezelfde onduidelijkheid vrijwel onmiddellijk op. Een uitgebreide LocalLLaMA-discussie over AI Cube richtte zich sterk op de relatie tussen de bandbreedte van O100, D100 en de grotere geheugenpool van de Cube.

Tot Xiaomi de topologie publiceert, is de veiligste interpretatie eenvoudig: 1,22 TB/s is een specificatie van O100 en geen bevestigde bandbreedtewaarde voor elke byte van het 80 GB-geheugen van AI Cube.

Waarom is geheugenbandbreedte belangrijk voor lokale AI?

Inferentie met grote modellen verplaatst modelgegevens herhaaldelijk door het geheugen terwijl tokens worden gegenereerd. Dat betekent dat de rekenkracht van de accelerator slechts één onderdeel van de prestaties is.

Een apparaat kan enorme TOPS-waarden adverteren en toch wachten tot gegevens zijn aangekomen bij de rekeneenheden. Token-voor-token decodering kan daardoor sterk afhankelijk worden van geheugenbandbreedte.

Daarom is de architectuur van O100 interessant, ook al klinkt het 6nm-proces minder geavanceerd dan de nieuwere chips van Xiaomi. Het ontwerp is gericht op AI-workloads met hoge bandbreedte en geheugen-nabije verwerking, in plaats van simpelweg het maximale rekenvermogen op papier te behalen.

Bij lokale LLM's kan geheugenbandbreedte soms meer zeggen over praktische inferentie dan een enorm TOPS-getal.

Maar de daadwerkelijke 120B-prestaties van de Cube blijven onbekend totdat Xiaomi systeem-benchmarks publiceert in plaats van afzonderlijke chipspecificaties.

Waarom een 3B-model draaien als Xiaomi AI Cube 120B kan draaien?

Het kleine 3B-model kan mogelijk meer onthullen over de architectuur van AI Cube dan het veelbesproken 120B-model.

Het grootste beschikbare model voor elk verzoek gebruiken zou latency, geheugenbandbreedte en energie verspillen aan werk waarvoor geen redeneren op frontier-niveau nodig is.

Een klein model kan mogelijk routinematige taken afhandelen, zoals:

  • intentieherkenning,
  • classificatie,
  • routering,
  • korte transformaties,
  • metadata extraheren,
  • bestanden taggen,
  • en lichte achtergrondtaken.

Het grotere model kan dan worden gereserveerd voor complexer werk, zoals complexe code, planning, moeilijke redeneertaken en synthese van lange teksten.

Dat levert een nuttige architectuur op:

klein lokaal model voor de basisbelasting, groter lokaal model voor opschaling.

Xiaomi heeft bevestigd dat er snel en langzaam kan worden gewisseld, maar heeft het daadwerkelijke routeringsbeleid niet gepubliceerd. Het zou daarom speculatie zijn om te beweren dat specifieke taken al aan het 3B- of 120B-model zijn toegewezen.

Het bredere idee is al relevant voor moderne lokale en frontier-AI-werklasten: het sterkste model hoeft niet voor elk verzoek de standaardkeuze te zijn.

Waarom heeft Xiaomi AI Cube drie verschillende AI-chips nodig?

Een conventioneel lokaal AI-werkstation combineert doorgaans een algemene CPU met systeem-RAM en een of meer afzonderlijke GPU's.

AI Cube combineert daarentegen drie processors met verschillende openbare rollen.

XRING-chip Openbare positionering
O3 Algemene vlaggenschip-SoC met CPU, GPU en NPU
O100 AI-accelerator met hoge bandbreedte, gericht op berekeningen dicht bij het geheugen
D100 AI-processor met hoge rekenkracht en ondersteuning voor grote geheugenconfiguraties

Dit wijst op heterogene lokale AI-rekenkracht: verschillende chips voor verschillende kenmerken van werklasten, in plaats van één grote GPU alles te laten doen.

Xiaomi heeft echter geen uitvoeringskaart per chip gepubliceerd. We weten nog niet of O3 het kleine model uitvoert, of O100 een bepaalde inferentiefase afhandelt, of dat D100 verantwoordelijk is voor het uitvoeren van het grotere model.

Dat zijn redelijke technische hypothesen, geen bevestigde implementatiedetails.

Probeert Xiaomi AI Cube een alternatief voor DGX Spark te worden?

Architectonisch behoort AI Cube tot dezelfde opkomende categorie als DGX Spark en Apple Silicon-systemen met veel geheugen: persoonlijke hardware die ongewoon grote AI-modellen dicht bij de gebruiker houdt.

Praktisch gezien is een directe vergelijking voorbarig.

Gebied Xiaomi AI Cube Wat nog bewezen moet worden
Geheugen 80 GB unified memory Volledige topologie en bruikbare bandbreedte
Rekenkracht O3 + O100 + D100 Werkelijke modelsnelheid
Modelcapaciteit Lokale implementatie van 120B + 3B Kwantisering, context en gelijktijdigheid
Software Onvolledige openbare details Ondersteuning voor runtimes en frameworks
Energieverbruik Doel van 150 W continu Gemeten inferentie-efficiëntie
Prijs Niet aangekondigd Werkelijke waarde ten opzichte van volwassen platforms

Het voordeel van DGX Spark is niet alleen hardware. NVIDIA levert CUDA, volwassen bibliotheken, inferentieruntimes en een gevestigd ontwikkelaarsecosysteem.

Daarmee gaat de volgende vraag over AI Cube minder over silicium en meer over software.

Welke software draait er daadwerkelijk op Xiaomi AI Cube?

Hardwarecapaciteit creëert niet automatisch een bruikbaar lokaal AI-platform.

Ontwikkelaars zullen uiteindelijk duidelijke antwoorden willen over ondersteuning voor:

  • llama.cpp,
  • Ollama,
  • vLLM,
  • PyTorch,
  • Linux-ontwikkelomgevingen,
  • Docker- of containerwerklasten,
  • GGUF en gangbare kwantiseringsindelingen,
  • OpenAI-compatibele API's,
  • frameworks voor fine-tuning,
  • en huidige agentharnassen.

Xiaomi heeft programmeerwerklasten gedemonstreerd, maar heeft geen uitgebreide compatibiliteitsmatrix van derden voor AI Cube gepubliceerd.

Dit is belangrijk omdat een krachtige accelerator met beperkte runtimeondersteuning minder nuttig kan zijn dan tragere hardware met volwassen kernels, stabiele drivers, eenvoudige modelconversie en een grote ontwikkelaarsgemeenschap.

Die zorg komt ook herhaaldelijk naar voren in de LocalLLaMA-discussie. Gebruikers beoordelen AI Cube niet alleen op basis van 80 GB en 120B; ze vragen zich af of XRING het software-ecosysteem kan ontwikkelen dat nodig is om deze specificaties bruikbaar te maken.

Een persoonlijke AI-computer heeft een softwareplatform nodig, niet alleen een AI-accelerator.

Is AI Cube een pc, een workstation of een altijd actieve AI-server?

AI Cube is mogelijk interessanter als persoonlijk AI-computerapparaat dan als conventionele pc.

Een traditionele pc is voornamelijk interactief: toepassingen worden uitgevoerd wanneer de gebruiker ze opent. Een persoonlijke AI-node kan modellen continu beschikbaar houden voor:

  • codeeragents,
  • achtergrondinferentie,
  • documentverwerking,
  • privé multimodale analyse,
  • lokale AI-API's,
  • RAG-workflows,
  • en automatisering die langdurig actief is.

Dit verschuift de hardwareprioriteiten naar permanent geheugen, continue koeling, voorspelbare inferentie, hoge bandbreedte en stabiele lokale services.

Daarom lijken opkomende local-first AI-agents steeds meer op infrastructuurworkloads dan op gewone desktoptoepassingen.

Als AI Cube de computenode is, waar staan je AI-gegevens dan?

Een speciale AI-computer vervangt niet automatisch een thuisserver of NAS, omdat inferentie en permanente gegevens verschillende problemen oplossen.

Een AI-computenode is geoptimaliseerd voor:

  • modelgewichten,
  • geheugen met hoge bandbreedte,
  • accelerators,
  • inferentie met lage latentie,
  • en redeneerworkloads.

Permanente lokale infrastructuur is geoptimaliseerd voor:

  • documenten,
  • foto's en video's,
  • coderepositories,
  • RAG-bronbestanden,
  • vectordatabases,
  • geheugen van agents,
  • logboeken,
  • back-ups,
  • en toepassingen die altijd actief zijn.

Dit onderscheid is belangrijk omdat AI-computing sneller verandert dan persoonlijke gegevens. Modellen, accelerators en runtimes kunnen om de paar jaar worden vervangen; bestanden, projectgeschiedenis en privékennis moeten stabiel blijven.

Dezelfde scheiding komt naar voren bij de beslissing of lokale AI en bestandsopslag één machine moeten delen of over gespecialiseerde systemen moeten worden verdeeld.

Een persistente server kan ook de privébestanden, retrievalindexen en duurzame context leveren die een private NAS-AI-assistent gebruikt, zonder dat dezelfde behuizing het grootst mogelijke model hoeft te hosten.

AI Cube suggereert dat persoonlijke AI-rekenkracht mogelijk vervangbaar wordt, terwijl persoonlijke AI-gegevens persistent blijven.

Wat weten we nog steeds niet over Xiaomi AI Cube?

Vraag Huidig antwoord
Kan het lokaal 120B draaien? Xiaomi zegt van wel
Welk specifiek 120B-model? Niet volledig gedocumenteerd in Xiaomi's openbare prototypedetails
Hoe wordt het gekwantiseerd? Niet bekendgemaakt
Hoeveel context is bruikbaar? Niet bekendgemaakt
Hoe snel is het 120B-model? Niet bekendgemaakt
Werkt de volledige 80 GB op 1,22 TB/s? Niet vastgesteld; 1,22 TB/s is een specificatie van de O100
Hoe worden 3B en 120B gerouteerd? Snel/langzaam schakelen bevestigd; beleid niet bekendgemaakt
Ondersteunt hij Ollama of llama.cpp? Niet publiekelijk bevestigd
Hoeveel gaat hij kosten? Niet aangekondigd
Wanneer kun je hem kopen? Er is geen releasedatum voor de retailversie aangekondigd

Het is ook belangrijk om benchmarkcijfers van Xiaomi's afzonderlijke O100-demonstratieterminal niet te combineren met die van AI Cube.

Een ander prototype met O3 + O100 demonstreerde een hoge tokensnelheid bij een veel kleinere MiMo-workload. Dat betekent niet dat AI Cube zijn 120B-model met dezelfde snelheid draait. Dit onderscheid wordt behandeld in Xiaomi's demonstraties van prototypes.

Moet de Xiaomi AI Cube goedkoop zijn om ertoe te doen?

Als architectuurdemonstratie: nee. Als nieuwe categorie binnen personal computing: absoluut.

Als lokale AI-hardware met veel geheugen de prijs van high-end consumentenwerkstations bereikt, kan dat lokale inferentie op 100B-niveau voor veel meer ontwikkelaars praktisch haalbaar maken.

Als de uiteindelijke prijs meerdere keren hoger ligt, wordt dezelfde hardware een gespecialiseerde AI-werkplek in plaats van een persoonlijke AI-computer voor de massamarkt.

Reddit-gebruikers speculeren al volop over de prijs, maar Xiaomi heeft er geen aangekondigd. Zolang er geen commercieel product is, moeten prijsramingen speculatief blijven.

Daarom zijn kostenvergelijkingen voor lokale AI op de lange termijn belangrijker dan alleen de hardwareprijs: gebruik, modelgrootte, elektriciteit en stijgende cloudkosten bepalen allemaal of speciale lokale rekenkracht economisch zinvol is.

Is de Xiaomi AI Cube de toekomst van de persoonlijke AI-computer?

Misschien architectonisch, zelfs als de uiteindelijke persoonlijke AI-computer er niet precies zo uitziet als dit prototype.

De belangrijkste ideeën zijn:

  • groot gedeeld geheugen dat is afgestemd op modelgewichten,
  • AI-versnelling met hoge bandbreedte,
  • heterogene processors,
  • kleine en grote modellen die tegelijkertijd beschikbaar zijn,
  • continue in plaats van uitsluitend tijdelijke rekenkracht,
  • lokale uitvoering van modellen,
  • en AI-services die continu beschikbaar blijven.

Dat is ingrijpender dan simpelweg een NPU aan een normale pc toevoegen en die een AI-pc noemen.

AI Cube begint bij de modelbelasting en ontwerpt de machine daaromheen.

Het prototype laat nog belangrijke vragen onbeantwoord: prestaties met 120B-modellen, geheugentopologie, softwareondersteuning, prijs en beschikbaarheid. De architectuur wijst echter op een plausibele toekomst waarin lokale AI een eigen speciale rekenlaag heeft, terwijl bestanden, geheugen en langetermijnstatus op permanente lokale infrastructuur blijven.

De persoonlijke AI-computer is mogelijk geen pc die af en toe AI draait. Het kan een lokaal computeknooppunt zijn dat altijd beschikbaar is en meerdere modellen kan bedienen, terwijl de duurzame gegevens van de gebruiker onafhankelijk blijven van de accelerator die dit jaar toevallig het snelst is.

Veelgestelde vragen: Xiaomi AI Cube en lokale 120B-modellen

Kan Xiaomi AI Cube een 120B-model draaien zonder de cloud?

Xiaomi zegt dat het prototype lokaal een 120B-model kan implementeren. Het bedrijf heeft echter niet de exacte kwantisering, contextlengte of runtimeconfiguratie gepubliceerd die voor die implementatie is gebruikt.

Hoeveel geheugen heeft een 120B-model nodig?

Onbewerkte gewichten van een 120B-model vereisen ongeveer 240 GB bij FP16, 120 GB bij 8-bit en circa 60 GB bij 4-bit, vóór de runtime-overhead. Het daadwerkelijke geheugengebruik hangt ook af van metagegevens voor kwantisering, de contextlengte en de inferentiesoftware.

Ondersteunt Xiaomi AI Cube Ollama?

Xiaomi heeft ondersteuning voor Ollama niet publiekelijk bevestigd. Compatibiliteit met Ollama, llama.cpp, vLLM en andere populaire lokale AI-runtimes blijft een van de grootste onbeantwoorde softwarevragen.

Welk 120B-model draait op Xiaomi AI Cube?

Openbare berichtgeving heeft het prototype in verband gebracht met Xiaomi's MiMo-modelfamilie, maar Xiaomi's eigen openbare beschrijving van AI Cube bevat geen volledige specificatie van het model, de versie en de kwantisering.

Kun je Xiaomi AI Cube kopen?

Vooralsnog niet. AI Cube is gepresenteerd als een engineeringprototype en Xiaomi heeft geen verkoopprijs of verzenddatum voor precies dit apparaat aangekondigd.

Is Xiaomi AI Cube een vervanging voor een NAS of thuisserver?

Niet per se. AI Cube is geoptimaliseerd voor AI-inferentie met veel geheugen, terwijl een NAS of thuisserver beter geschikt is voor permanente bestanden, RAG-bronnen, databases, back-ups, agentstatus en andere services die altijd actief zijn. De twee rollen kunnen elkaar aanvullen.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.