Xiaomi AI Cube kör en modell med 120 miljarder parametrar lokalt – är detta framtidens personliga AI-dator?

Lauren Pan är grundaren av ZimaSpace och arkitekten bakom den hyllade ZimaBoard-serien . Genom att kombineraindustriell design med inbyggd teknik startade Lauren ZimaSpace med ett tydligt uppdrag: attdemokratisera personlig molndatabehandling . Han arbetar utifrån tron att hårdvara ska vara både"hackbar" och vacker —och därmed överbrygga klyftan mellan industriklassade servrar och konsumentprylar. Idag leder han ingenjörsteamet som bygger verktyg som ger skaparefull kontroll över sina digitala liv full control over their digital lives.

Xiaomi AI Cube är en stationär AI-datorprototyp byggd kring en ovanlig idé: att placera tillräckligt med minne och specialiserad lokal beräkningskraft i en enda låda på 150 W för att hålla både en 120B-modell och en mycket mindre 3B-modell tillgängliga lokalt. Xiaomi har bekräftat 80 GB enhetligt minne, tre XRING-processorer—O3, O100 och D100—samt snabbt/långsamt modellbyte för arbetsbelastningar som frontendutveckling och komplex programmering.

Men att ”köra 120B lokalt” är ett kapacitetsanspråk, inte ett fullständigt prestandatest. Xiaomi har inte publicerat Cube-enhetens fullständiga minnesarkitektur, 120B-kvantiseringsnivå, användbara kontext, genereringshastighet, programvarukompatibilitet, pris eller lanseringsdatum för detaljhandeln. För närvarande är AI Cube mer användbar som en förhandsvisning av en ny arkitektur för personliga AI-datorer än som en färdig produkt som köpare kan utvärdera.

Vad är Xiaomi AI Cube?

Xiaomi AI Cube är en teknisk prototyp som kombinerar tre egenutvecklade XRING-processorer med 80 GB enhetligt minne för lokal inferens med stora modeller.

AI Cube i detalj Vad Xiaomi har bekräftat
Status Teknisk prototyp
Processorer XRING O3 + O100 + D100
Minne 80 GB enhetligt minne
Lokala modeller 120B-modell + 3B-modell
Modellbeteende Snabbt/långsamt modellbyte
Varaktig prestanda Upp till 150 W
Demonstrerade arbetsbelastningar Frontendutveckling och komplex programmering
Pris Inte meddelat
Lanseringsdatum Inte meddelat

Xiaomis offentliga beskrivning finns i det officiella inlägget om AI Cube-prototypen.

Siffran 120B väcker uppmärksamhet, men den mer användbara frågan är vad som krävs för att göra en modell av den storleken praktisk på ett skrivbord.

Varför är det en så stor sak att köra en 120B-modell lokalt?

En modell med 120 miljarder parametrar skapar omedelbart ett minnesproblem.

Vid 16-bitars precision skulle enbart råvikterna kräva ungefär:

120B × 2 byte ≈ 240 GB

Vid 8-bitars precision sjunker det till omkring 120 GB, medan 4-bitarsvikter kräver ungefär 60 GB före körningens minnesöverhead.

Det gör en dator med 80 GB plausibel för en kraftigt kvantiserad 120B-modell, men att få plats med vikterna är bara en del av driftsättningen.

Inferens kräver också minne för:

  • kvantiseringsmetadata,
  • körningsbuffertar,
  • KV-cache,
  • kontexttokens,
  • systemprogramvara,
  • och potentiellt multimodalt tillstånd.

Att an anpassa en modell är inte samma sak som att köra den med användbar hastighet och kontext.

Det är av samma anledning som praktiska maskinvarukrav för lokal AI beror på modellstorlek, kvantisering, kontext och samtidighet snarare än på ett enda enkelt RAM-värde.

Kan 80 GB enhetligt minne verkligen köra en modell med 120 miljarder parametrar?

Ja, en kvantiserad modell med 120 miljarder parametrar kan plausibelt få plats inom en minnesbudget i klassen 80 GB, men Xiaomi har inte släppt tillräckligt med information för att beräkna Cubens verkligt användbara kontext eller genomströmning.

De obesvarade variablerna omfattar:

  • den exakta versionen av 120B-modellen,
  • kvantiseringsformat,
  • användbar kontextlängd,
  • tid till första token,
  • genereringshastighet,
  • och om 3B- och 120B-modellerna förblir residenta samtidigt.

En modell som tekniskt sett kan läsas in men genererar text med oacceptabelt låg hastighet skiljer sig avsevärt från en responsiv personlig assistent. Långa kontexter och flera samtidiga agenter kan också förbruka betydande mängder extra minne.

Denna åtskillnad – mellan att få plats med modellen och att kunna använda den i praktiken – är särskilt viktig när större öppna modeller börjar köras på hemmamaskinvara. Liknande begränsningar förekommer i aktuella AI-arbetsbelastningar på hemservrar, där det inte räcker att en modell får plats för att garantera en bra upplevelse vid kontinuerlig drift.

Har Xiaomi AI Cube verkligen 1,22 TB/s minnesbandbredd?

Xiaomi har publicerat en bandbreddssiffra på 1,22 TB/s för XRING O100-acceleratorns närminne, men det bevisar inte att hela AI Cube-minnespoolen på 80 GB arbetar med 1,22 TB/s.

Denna åtskillnad har blivit en av de viktigaste tekniska frågorna kring prototypen.

O100 är positionerad som en AI-accelerator med hög bandbredd och 3D-stapling på wafernivå. D100 är en separat AI-processor med hög beräkningskapacitet och stöd för betydligt större minneskonfigurationer, medan O3 är en SoC för allmänna ändamål.

Xiaomi har ännu inte publicerat något minnesblocksdiagram som förklarar:

  • hur poolen på 80 GB fördelas,
  • vilket chip som äger vilket minne,
  • vilken del som kan använda O100:s väg med högst bandbredd,
  • bandbredd mellan kretsarna,
  • där modellvikterna på 120 miljarder parametrar lagras,
  • eller där KV-cachen lagras.

De tillgängliga processorspecifikationerna sammanfattas i Xiaomis lanseringsspecifikationer för XRING.

Användare av lokal AI lade nästan omedelbart märke till samma tvetydighet. En stor LocalLLaMA-diskussion om AI Cube fokuserade i hög grad på hur O100:s bandbredd förhåller sig till D100 och Cubes större minnespool.

Tills Xiaomi publicerar topologin är den säkraste tolkningen enkel: 1,22 TB/s är en O100-specifikation, inte en bekräftad bandbreddssiffra för varje byte av AI Cubes 80 GB minne.

Varför är minnesbandbredd viktig för lokal AI?

Inferens med stora modeller flyttar upprepade gånger modelldata genom minnet medan tokens genereras. Det innebär att acceleratorns aritmetik bara är en del av prestandan.

En enhet kan ange enorma TOPS-tal och ändå vänta på att data ska nå beräkningsenheterna. Token-för-token-avkodning kan därför bli starkt beroende av minnesbandbredd.

Det är därför O100:s arkitektur är intressant, även om dess 6 nm-process låter mindre avancerad än Xiaomis nyare chip. Konstruktionen är inriktad på AI-arbetsbelastningar med hög bandbredd och minnesnära bearbetning, snarare än att bara maximera den angivna beräkningskapaciteten.

För lokala LLM:er kan minnesbandbredd ibland säga mer om praktisk inferens än ett enormt TOPS-tal.

Men Cubes faktiska prestanda med 120B förblir okänd tills Xiaomi publicerar systemomfattande benchmarkresultat i stället för individuella chipspecifikationer.

Varför köra en 3B-modell om Xiaomi AI Cube kan köra 120B?

Den lilla 3B-modellen kan faktiskt avslöja mer om AI Cubes arkitektur än den omskrivna 120B-modellen.

Att använda den största tillgängliga modellen för varje förfrågan skulle slösa latens, minnesbandbredd och energi på arbete som inte kräver resonemang på frontnivå.

En liten modell kan potentiellt hantera rutinbelastningar som:

  • avsiktsdetektering,
  • klassificering,
  • routning,
  • korta transformationer,
  • extrahering av metadata,
  • filmärkning,
  • och lätta bakgrundsuppgifter.

Den större modellen kan då reserveras för svårare uppgifter som komplex kodning, planering, avancerat resonemang och syntes av långa texter.

Det skapar en användbar arkitektur:

liten lokal modell för grundbelastningen, större lokal modell för eskalering.

Xiaomi har bekräftat växling mellan snabb och långsam, men har inte publicerat den faktiska routningspolicyn. Det vore därför spekulation att hävda att specifika uppgifter redan har tilldelats 3B- eller 120B-modellen.

Den bredare idén är redan relevant för moderna lokala AI-arbetsbelastningar och frontier-AI-arbetsbelastningar: den starkaste modellen behöver inte vara standardvalet för varje förfrågan.

Varför behöver Xiaomi AI Cube tre olika AI-chip?

En konventionell lokal AI-arbetsstation kombinerar vanligtvis en processor för allmänna ändamål med systemminne och en eller flera separata GPU:er.

AI Cube kombinerar i stället tre processorer med olika offentliga roller.

XRING-chip Offentlig positionering
O3 Flaggskepps-SoC för allmänna ändamål med CPU, GPU och NPU
O100 AI-accelerator med hög bandbredd, inriktad på beräkning nära minnet
D100 AI-processor med hög beräkningskapacitet och stöd för stora minneskonfigurationer

Detta pekar mot heterogen lokal AI-beräkning: olika kisel för olika arbetsbelastningsegenskaper i stället för att låta en enda stor GPU göra allt.

Xiaomi har dock inte släppt någon exekveringskarta chip för chip. Vi vet ännu inte om O3 kör den lilla modellen, om O100 hanterar ett visst inferenssteg eller om D100 ansvarar för exekveringssökvägen för den större modellen.

Det är rimliga tekniska hypoteser – inte bekräftade implementeringsdetaljer.

Försöker Xiaomi AI Cube bli ett alternativ till DGX Spark?

Arkitektoniskt hör AI Cube till samma framväxande kategori som DGX Spark och Apple Silicon-system med mycket minne: personlig hårdvara utformad för att hålla ovanligt stora AI-modeller nära användaren.

I praktiken är en direkt jämförelse för tidig.

Område Xiaomi AI Cube Vad som fortfarande måste bevisas
Minne 80 GB enhetligt minne Full topologi och användbar bandbredd
Beräkningskraft O3 + O100 + D100 Verklig modellgenomströmning
Modellkapacitet Lokal distribution av 120B + 3B Kvantiseringsgrad, kontext och samtidighet
Programvara Ofullständiga offentliga uppgifter Stöd för körmiljöer och ramverk
Strömförbrukning 150 W kontinuerligt mål Uppmätt inferenseffektivitet
Pris Inte meddelat Verkligt värde jämfört med mogna plattformar

DGX Sparks fördel ligger inte enbart i hårdvaran. NVIDIA bidrar med CUDA, mogna bibliotek, inferensmiljöer och ett etablerat utvecklarekosystem.

Det gör AI Cubes nästa fråga mindre till en fråga om kisel och mer till en fråga om programvara.

Vilken programvara kommer Xiaomi AI Cube faktiskt att köra?

Hårdvarukapacitet skapar inte automatiskt en användbar plattform för lokal AI.

Utvecklare kommer så småningom att vilja ha tydliga svar om stöd för:

  • llama.cpp,
  • Ollama,
  • vLLM,
  • PyTorch,
  • Linux-utvecklingsmiljöer,
  • Docker- eller containerarbetsbelastningar,
  • GGUF och vanliga kvantiseringsformat,
  • OpenAI-kompatibla API:er,
  • ramverk för finjustering,
  • och aktuella agentramverk.

Xiaomi har demonstrerat kodningsarbetsbelastningar, men har inte publicerat någon bred kompatibilitetsmatris från tredje part för AI Cube.

Detta är viktigt eftersom en kraftfull accelerator med svagt stöd för körtider kan vara mindre användbar än långsammare hårdvara med mogna kärnor, stabila drivrutiner, enkel modellkonvertering och en stor utvecklargemenskap.

Denna oro återkommer även i LocalLLaMA-diskussionen. Användare utvärderar inte AI Cube enbart utifrån 80 GB och 120B; de frågar om XRING kan utveckla det programvaruekosystem som krävs för att göra dessa specifikationer användbara.

En personlig AI-dator behöver en mjukvaruplattform, inte bara en AI-accelerator.

Är AI Cube en dator, en arbetsstation eller en alltid aktiv AI-server?

AI Cube kan vara mer intressant som en personlig AI-beräkningsenhet än som en traditionell dator.

En traditionell dator är främst interaktiv: applikationer körs när användaren öppnar dem. En personlig AI-nod kan hålla modeller tillgängliga kontinuerligt för:

  • kodningsagenter,
  • bakgrundsinferens,
  • dokumentbearbetning,
  • privat multimodal analys,
  • lokala AI-API:er,
  • RAG-arbetsflöden,
  • och långvarig automatisering.

Detta förändrar hårdvaruprioriteringarna mot beständigt minne, kontinuerlig kylning, förutsägbar inferens, hög bandbredd och stabila lokala tjänster.

Det är också därför framväxande local-first AI-agenter allt oftare liknar infrastrukturarbetsbelastningar mer än vanliga skrivbordsapplikationer.

Om AI Cube är beräkningsnoden, var finns då dina AI-data?

En dedikerad AI-dator ersätter inte automatiskt en hemserver eller NAS, eftersom inferens och beständiga data löser olika problem.

En AI-beräkningsnod är optimerad för:

  • modellvikter,
  • minne med hög bandbredd,
  • acceleratorer,
  • inferens med låg latens,
  • och arbetsbelastningar för resonemang.

Beständig lokal infrastruktur är optimerad för:

  • dokument,
  • foton och videor,
  • kodarkiv,
  • RAG-källfiler,
  • vektordatabaser,
  • agentminne,
  • loggar,
  • säkerhetskopior,
  • och alltid aktiva applikationer.

Denna skillnad är viktig eftersom AI-beräkningskraft förändras snabbare än personuppgifter. Modeller, acceleratorer och körtider kan bytas ut med några års mellanrum, medan filer, projekthistorik och privat kunskap bör förbli stabila.

Samma uppdelning gäller när man avgör om lokal AI och fillagring bör dela på samma maskin eller delas upp i specialiserade system.

En beständig server kan också tillhandahålla de privata filerna, sökindexen och den varaktiga kontext som används av en privat NAS-AI-assistent utan att samma enhet måste vara värd för den största möjliga modellen.

AI Cube antyder att personlig AI-beräkningskraft kan bli utbytbar, medan personliga AI-data förblir beständiga.

Vad vet vi fortfarande inte om Xiaomi AI Cube?

Fråga Aktuellt svar
Kan den köra 120B lokalt? Xiaomi säger ja
Vilken exakt 120B-modell? Inte fullständigt dokumenterat i Xiaomis offentliga prototypdetaljer
Hur kvantiseras den? Inte offentliggjort
Hur mycket kontext kan användas? Inte offentliggjort
Hur snabbt är 120B-modellen? Inte offentliggjort
Körs hela 80 GB med 1,22 TB/s? Inte fastställt; 1,22 TB/s är en O100-specifikation
Hur dirigeras 3B och 120B? Växling mellan snabbt och långsamt läge bekräftad; policy ej offentliggjord
Har den stöd för Ollama eller llama.cpp? Inte offentligt bekräftat
Hur mycket kommer den att kosta? Inte meddelat
När kan man köpa den? Inget lanseringsdatum för detaljhandeln har meddelats

Det är också viktigt att inte kombinera benchmarkresultat från Xiaomis separata O100-demoterminal med AI Cube.

En annan O3 + O100-prototyp demonstrerade hög token-genomströmning vid en betydligt mindre MiMo-arbetsbelastning. Det betyder inte att AI Cube kör sin 120B-modell i samma hastighet. Skillnaden beskrivs i Xiaomis prototypdemonstrationer.

Måste Xiaomi AI Cube vara billig för att vara betydelsefull?

Som arkitekturdemonstration, nej. Som en ny kategori inom persondatorer, absolut.

Om lokal AI-hårdvara med stora mängder minne når prisnivån för avancerade arbetsstationer för konsumenter kan det göra lokal inferens i 100B-klassen praktiskt genomförbar för betydligt fler utvecklare.

Om det slutliga priset blir flera gånger högre blir samma hårdvara en specialiserad AI-arbetsstation snarare än en personlig AI-dator för massmarknaden.

Reddit-användare spekulerar redan flitigt om priset, men Xiaomi har inte meddelat något. Innan det finns en kommersiell produkt bör prisuppskattningar förbli spekulationer.

Det är också därför långsiktiga kostnadsjämförelser för lokal AI är viktigare än enbart hårdvarupriset: användningsgrad, modellstorlek, elektricitet och stigande molnkostnader påverkar alla om dedikerad lokal beräkningskraft är ekonomiskt rimlig.

Är Xiaomi AI Cube framtidens personliga AI-dator?

Kanske arkitekturellt, även om den slutliga personliga AI-datorn inte ser exakt ut som den här prototypen.

De viktiga idéerna är:

  • stort delat minne dimensionerat efter modellvikterna,
  • AI-acceleration med hög bandbredd,
  • heterogena processorer,
  • små och stora modeller tillgängliga samtidigt,
  • kontinuerlig snarare än enbart tillfällig beräkningskapacitet,
  • lokal körning av modeller,
  • och AI-tjänster som förblir tillgängliga hela tiden.

Det är mer betydelsefullt än att bara lägga till en NPU i en vanlig dator och kalla den en AI-dator.

AI Cube utgår från modellens arbetsbelastning och utformar maskinen kring den.

Prototypen lämnar fortfarande flera viktiga frågor obesvarade: 120B-prestanda, minnesarkitektur, programvarustöd, pris och tillgänglighet. Men arkitekturen pekar mot en plausibel framtid där lokal AI har ett eget dedikerat beräkningslager, medan filer, minne och långsiktigt tillstånd förblir på beständig lokal infrastruktur.

Den personliga AI-datorn kanske inte är en dator som bara kör AI ibland. Den kan vara en alltid tillgänglig lokal beräkningsnod, utformad för att köra flera modeller samtidigt, medan användarens beständiga data förblir oberoende av vilken accelerator som råkar vara snabbast i år.

Vanliga frågor: Xiaomi AI Cube och lokala 120B-modeller

Kan Xiaomi AI Cube köra en 120B-modell utan molnet?

Xiaomi uppger att prototypen kan köra ut en 120B-modell lokalt. Företaget har dock inte publicerat den exakta kvantiseringen, kontextlängden eller körningskonfigurationen som används för detta.

Hur mycket minne behöver en 120B-modell?

Obehandlade 120B-vikter kräver ungefär 240 GB i FP16, 120 GB i 8-bitarsformat och cirka 60 GB i 4-bitarsformat, innan körningsöverhead räknas med. Den faktiska minnesanvändningen beror också på kvantiseringsmetadata, KV-cache, kontextlängd och inferensprogramvara.

Har Xiaomi AI Cube stöd för Ollama?

Xiaomi har inte offentligt bekräftat stöd för Ollama. Kompatibilitet med Ollama, llama.cpp, vLLM och andra populära lokala AI-körmiljöer är fortfarande en av de största obesvarade mjukvarufrågorna.

Vilken 120B-modell kör Xiaomi AI Cube?

Offentlig rapportering har kopplat prototypen till Xiaomis MiMo-modellfamilj, men Xiaomis egen offentliga beskrivning av AI Cube innehåller ingen fullständig specifikation av modell/version och kvantisering.

Kan man köpa Xiaomi AI Cube?

Inte för närvarande. AI Cube har presenterats som en teknisk prototyp, och Xiaomi har inte meddelat något butikspris eller leveransdatum för just den här enheten.

Är Xiaomi AI Cube ett alternativ till en NAS eller hemserver?

Inte nödvändigtvis. AI Cube är optimerad för AI-inferens som kräver mycket minne, medan en NAS eller hemserver passar bättre för beständiga filer, RAG-källor, databaser, säkerhetskopior, agenttillstånd och andra tjänster som alltid är aktiva. De två rollerna kan komplettera varandra.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.