Grok 4.8 is nog niet publiekelijk uitgebracht, maar Elon Musk heeft al twee ongewoon belangrijke details onthuld: het is een model met 2,5 biljoen parameters en xAI heeft het getraind met een nieuwe C++-softwarestack. Hij zei ook dat het model na de huidige trainingsfase zou overstappen op reinforcement learning.
Het getal 2,5 biljoen zal de meeste krantenkoppen halen. De C++-stack kan ons meer vertellen over de richting waarin frontier-AI zich ontwikkelt. Op deze schaal zijn betere modellen niet alleen afhankelijk van architectuur en trainingsdata, maar ook van hoe efficiënt duizenden accelerators communiceren, van storingen herstellen, data verplaatsen, checkpoints opslaan en weken of maanden actief blijven.
Wat weten we nu eigenlijk over Grok 4.8?
De openbare informatie is nog steeds beperkt, waardoor het belangrijk is bevestigde details van speculatie te onderscheiden.
| Details over Grok 4.8 | Wat publiekelijk bekend is |
|---|---|
| Modelnaam | Grok 4.8 |
| Totaal aantal parameters | 2,5 biljoen, volgens Elon Musk |
| Trainingsstack | Nieuwe C++-softwarestack, volgens Musk |
| Trainingsfase | Naar verwachting volgt reinforcement learning na de belangrijkste trainingsfase |
| Dense of MoE | Niet bekendgemaakt |
| Actieve parameters | Niet bekendgemaakt |
| Contextvenster | Niet bekendgemaakt |
| API-prijzen | Niet aangekondigd |
| Releasedatum | Niet aangekondigd |
| Open gewichten | Niet aangekondigd |
Op 20 september 2026 vermeldt xAI's openbare modeldocumentatie Grok 4.6 nog steeds als zijn vlaggenschipmodel voor algemeen gebruik. Grok 4.8 heeft nog geen openbare API-modelpagina of technisch rapport.
Dat onderscheid is belangrijk, omdat het voltooien van een belangrijke trainingsfase niet hetzelfde is als het uitbrengen van een voltooid model.
Waarom de nieuwe C++-trainingsstack mogelijk belangrijker is dan 2,5 biljoen parameters
xAI beschouwt infrastructuur vanaf het begin als onderdeel van modelontwikkeling. De oorspronkelijke engineeringpost over Grok van het bedrijf beschreef een aangepaste stack voor training en inferentie, gebouwd rond JAX, Rust en Kubernetes, en benadrukte hoe moeilijk het is om grote GPU-clusters productief te houden ondanks hardwarestoringen.
Op frontier-schaal moet trainingssoftware veel meer beheren dan alleen het neurale netwerk zelf.
- GPU-benutting en planning
- communicatie tussen accelerators
- sharding van parameters en activaties
- geheugentoewijzing
- dataladen
- checkpointing
- foutdetectie en herstel
- gedistribueerde synchronisatie
- kerneluitvoering
- monitoring en telemetrie
Een cluster kan enorm veel theoretische rekenkracht bevatten en toch een aanzienlijk deel daarvan verspillen als accelerators te veel tijd besteden aan wachten op communicatie, data, synchronisatie of herstel.
Dit is de werkelijke reden waarom de nieuwe C++-stack van Grok 4.8 interessant is. Het mogelijke voordeel is niet simpelweg dat “C++ sneller is dan Python”. Het is dat een aangepaste stack op lager niveau xAI mogelijk meer controle geeft over de dure onderdelen van gedistribueerde training.
Hetzelfde principe van knelpunten doet zich op veel kleinere schaal voor bij lokale AI. Een systeem kan over een krachtige GPU beschikken, maar toch wachten op toegang tot geheugen, opslag of netwerk. Begrijpen of de beperking ligt bij rekenkracht, geheugen, opslag of netwerk is nuttiger dan ervan uitgaan dat elk prestatieprobleem een grotere GPU vereist.
Maakt C++ AI-training automatisch sneller?
Nee.
Moderne AI-frameworks voeren de meeste zware tensorbewerkingen al uit via gecompileerde GPU-kernels, acceleratorbibliotheken en grafiekcompilers. Python fungeert vaak als interface op hoog niveau en voert niet zelf de matrixvermenigvuldiging uit.
| Veelgebruikte aanname | Wat belangrijker is |
|---|---|
| C++ is sneller dan Python | Of de nieuwe stack echte knelpunten tijdens runtime wegneemt |
| Een herschrijving maakt training automatisch sneller | Hoeveel inactieve GPU-tijd, geheugenoverhead of communicatievertraging wordt verminderd |
| De programmeertaal bepaalt de trainingssnelheid | De volledige compiler-, kernel-, communicatie-, geheugen- en orkestratiestack is van belang |
Een C++-implementatie kan belangrijk zijn als deze de planning, het geheugenbeheer, de communicatie, het maken van checkpoints, aangepaste kernels of herstel na fouten verbetert. Maar totdat xAI de architectuur van de nieuwe stack publiceert, zouden beweringen over waar de verbeteringen precies vandaan komen speculatief zijn.
Het is ook nog te vroeg om te zeggen dat xAI JAX volledig heeft verlaten. Grok-1.5 is expliciet gebouwd op een trainingsframework met JAX, Rust en Kubernetes. Musks uitspraak over Grok 4.8 bevestigt een nieuwe C++-stack, maar niet welke oudere componenten behouden blijven.
Wat betekenen 2,5 biljoen parameters eigenlijk?
Het ruwe aantal klinkt buitengewoon, maar het totale aantal parameters en het aantal actieve parameters zijn niet hetzelfde.
Als Grok 4.8 een dense architectuur gebruikt, nemen waarschijnlijk de meeste of al deze parameters deel aan de inferentie. Als het een Mixture-of-Experts-architectuur gebruikt, wordt per token mogelijk slechts een subset geactiveerd.
xAI heeft niet bekendgemaakt welke architectuur Grok 4.8 gebruikt.
Grok-1 laat zien waarom dit onderscheid belangrijk is. Volgens de officiële Grok-1-repository had het eerdere model:
| Specificaties van Grok-1 | Waarde |
|---|---|
| Totaal aantal parameters | 314B |
| Architectuur | Mixture-of-Experts |
| Experts | 8 |
| Geselecteerde experts per token | 2 |
| Actieve gewichten per token | Ongeveer 25% |
Dit bewijst niet dat Grok 4.8 dezelfde architectuur gebruikt. Het laat zien waarom “2,5 biljoen parameters” op zichzelf niet kan aangeven wat de inferentiekosten, geheugenvereisten of effectieve rekenkracht per token zijn.
Totdat xAI de modelarchitectuur publiceert, blijven verschillende vragen open:
- Is Grok 4.8 een dense model of een MoE-model?
- Hoeveel experts bevat het?
- Hoeveel worden er voor elke token geactiveerd?
- Wat is het aantal actieve parameters?
- Welk deel van het getal van 2,5 biljoen behoort tot multimodale componenten?
Dit is een van de belangrijkste redenen om grensmodellen niet alleen te vergelijken op basis van het totale aantal parameters.
Betekent een model met 2,5 biljoen parameters automatisch betere intelligentie?
Nee. Het aantal parameters meet de modelcapaciteit, niet de voltooide functionaliteit.
Prestaties in de praktijk hangen ook af van:
- modelarchitectuur
- kwaliteit van trainingsdata
- datamix
- stabiliteit van optimalisatie
- post-training
- reinforcement learning
- toolgebruik
- compute tijdens de test
- serving- en inference-ontwerp
De recente releases van xAI laten al zien hoe belangrijk post-training is geworden. In de aankondiging van Grok 4.5 benadrukte xAI reinforcement learning op honderdduizenden taken en langlopende agentische roll-outs, in plaats van modelgrootte als enige bron van verbetering te presenteren.
Dit betekent dat de nuttige vraag niet is:
Hoe groot is Grok 4.8?
Het is:
Hoe effectief zet xAI die capaciteit om in redeneren, programmeren, toolgebruik en betrouwbaar agentgedrag?
Wat betekent “starten met RL” voor Grok 4.8?
De overstap naar reinforcement learning betekent niet dat Grok 4.8 onmiddellijk wordt gelanceerd.
Een grensmodel kan na zijn primaire trainingsrun nog veel werk vereisen, waaronder:
- reinforcement learning en andere post-training
- optimalisatie van het volgen van instructies
- training voor agents en toolgebruik
- veiligheids- en capaciteitsbeoordelingen
- optimalisatie voor serving
- afstemming van latentie en geheugen
- API- en productintegratie
RL kan grote invloed hebben op hoe het model zich gedraagt, zelfs wanneer het onderliggende aantal parameters niet verandert.
Een model kan genoeg kennis bevatten om een moeilijk programmeerprobleem op te lossen, maar toch slecht presteren als agent wanneer het te vroeg stopt, de verkeerde tool kiest, te veel stappen verspilt of zijn eigen werk niet controleert.
De huidige koers van xAI maakt dit bijzonder relevant. Grok 4.6 wordt expliciet gepositioneerd rond langlopende agents, programmeren en kenniswerk, en de officiële release benadrukt volharding bij meerstapstaken.
Voor Grok 4.8 kan de RL-fase daarom bijna net zo belangrijk zijn als de pretraining op 2,5 biljoen parameters voor wat gebruikers uiteindelijk ervaren.
Waarom trainingssoftware een concurrentievoordeel wordt op grensschaal
Hoe groter de trainingsrun wordt, hoe duurder kleine inefficiënties worden.
| Kleinere AI-workload | Trainingsworkload aan de grens |
|---|---|
| Enkele accelerators | Grote acceleratorclusters |
| Kortere trainingsruns | Langlopende gedistribueerde taken |
| Een herstart kan onpraktisch zijn | Een herstart kan aanzienlijke rekencapaciteit verspillen |
| Een deel van de hardware ongebruikt laten is aanvaardbaar | Kleine benuttingsverliezen vermenigvuldigen zich over het cluster |
| Eenvoudige checkpoints | Checkpointing wordt een probleem van gedistribueerde opslag |
| Beperkte communicatie-overhead | Communicatie kan een belangrijke bottleneck worden |
xAI's oorspronkelijke Grok-infrastructuur richtte zich expliciet op het maximaliseren van nuttige rekenkracht per watt en het handhaven van een hoge Model FLOP Utilization, zelfs wanneer hardware uitviel.
Dat geeft Groks C++-stack een nuttigere interpretatie:
frontier-AI-labs concurreren steeds vaker niet alleen op modelontwerp, maar ook op hoeveel nuttige intelligentie ze uit dezelfde dure hardware kunnen halen.
Het principe lijkt verrassend veel op lokale AI, ook al is de schaal volledig anders. Lokale systemen profiteren er eveneens van als elke workload aan de juiste resource wordt gekoppeld, in plaats van blindweg meer hardware aan te schaffen.
Kan Grok 4.8 lokaal draaien?
Er is momenteel geen basis om te zeggen dat Grok 4.8 lokaal kan draaien.
xAI heeft het volgende niet uitgebracht:
- gewichten van Grok 4.8
- een modelarchitectuur
- aantallen actieve parameters
- gekwantiseerde checkpoints
- vereisten voor lokale hardware
- instructies voor self-hosting
Zelfs het cijfer 2,5T kan geen zinvolle VRAM-schatting opleveren zonder te weten of het model dense of sparse is.
Hierdoor verschilt Grok 4.8 sterk van open modellen die kunnen worden gekwantiseerd en op consumentenhardware kunnen worden uitgevoerd. Voorlopig behoort het tot de gecentraliseerde frontier-computekant van AI.
Dat maakt lokale AI niet irrelevant. Het maakt scheiding van workloads belangrijker.
Waarom een frontiermodel van 2,5T lokale AI waardevoller kan maken
Frontier-AI en lokale AI optimaliseren steeds vaker voor tegengestelde beperkingen.
| Frontier-AI | Lokale AI |
|---|---|
| Mogelijkheden maximaliseren | Alleen de mogelijkheden gebruiken die de taak nodig heeft |
| Massale gecentraliseerde rekenkracht | Hardware voor consumenten of thuisservers |
| Clusterbenutting optimaliseren | RAM, VRAM, opslag en energie optimaliseren |
| Veel gebruikers bedienen | Eén gebruiker, huishouden of klein team bedienen |
| Cloud als uitgangspunt | Lokaal als uitgangspunt of hybride |
De belangrijke vraag voor een lokale gebruiker is niet of een model van 7B, 14B of 30B Grok 4.8 in het algemeen kan overtreffen.
Het gaat erom of de huidige taak überhaupt intelligentie op het niveau van Grok 4.8 nodig heeft.
| Taak | Waarschijnlijk het beste startpunt |
|---|---|
| Privébestanden classificeren | Klein lokaal model of classifier |
| Privédocumenten doorzoeken | Lokaal ophalen van informatie en embeddings |
| Routinematige samenvatting | Klein of middelgroot lokaal model |
| Monitoring van always-on-agents | Lokaal of hybride systeem |
| Moeilijk wetenschappelijk redeneren | Frontier-cloudmodel |
| Moeilijke software-engineering | Frontiermodel voor redeneren of coderen |
Daarom worden hybride AI en modelroutering nuttiger naarmate frontier-systemen groter worden. Routinematige, private en herhaalde workloads kunnen lokaal blijven, terwijl moeilijke gevallen worden doorgestuurd naar een frontier-API.
Een privé-AI-assistent kan bijvoorbeeld het ophalen van informatie, documenttoegang, geheugen en lichte inferentie dicht bij lokale bestanden houden, zonder voor elke stap het krachtigste cloudmodel nodig te hebben.
Ook de privacygrens is van belang. Een systeem is niet echt lokaal alleen omdat het belangrijkste LLM thuis draait. Embeddings, authenticatie, routering of toolaanroepen kunnen nog steeds afhankelijk zijn van externe diensten. Een echt offline-compatibele AI-workflow moet in de volledige afhankelijkheidsketen lokaal blijven.
Grok 4.8 is in wezen een infrastructuurverhaal
Wanneer Grok 4.8 wordt gelanceerd, zal de meeste aandacht waarschijnlijk verschuiven naar benchmarkscores, programmeerresultaten, redeneertests en vergelijkingen met andere frontiermodellen.
Maar nog voordat die cijfers bestaan, is het infrastructuurverhaal al zichtbaar.
xAI begon met een aangepaste JAX-, Rust- en Kubernetes-stack. Het bedrijf legde publiekelijk de nadruk op GPU-storingen, checkpointing, synchronisatie, nuttige rekenkracht per watt en Model FLOP Utilization. Nu zegt Musk dat een model van 2,5 biljoen parameters wordt getraind met een nieuwe C++-softwarestack.
Dat suggereert dat de concurrentiestrijd zich verder verplaatst naar infrastructuur.
Voor xAI is de vraag hoe meer nuttige training uit enorme hoeveelheden rekenkracht kan worden gehaald.
Voor gebruikers van lokale AI is de nuttigere vraag het omgekeerde: hoeveel rekenkracht kunnen we in de eerste plaats vermijden?
Het beste lokale systeem is misschien niet het systeem dat thuis een frontiermodel van 2,5 biljoen parameters probeert te reproduceren. Het kan beter het systeem zijn dat routinetaken lokaal uitvoert, waar mogelijk gespecialiseerde modellen gebruikt en alleen frontierintelligentie inschakelt wanneer de extra capaciteit het resultaat daadwerkelijk verandert.
Veelgestelde vragen over Grok 4.8
Is Grok 4.8 uitgebracht?
Nee. Op 20 september 2026 heeft xAI geen openbare release van Grok 4.8, API-model of releasedatum aangekondigd. In de openbare modeldocumentatie staat Grok 4.6 momenteel vermeld als het vlaggenschipmodel voor algemene doeleinden.
Hoeveel parameters heeft Grok 4.8?
Elon Musk zegt dat Grok 4.8 2,5 biljoen parameters heeft. xAI heeft nog geen modelkaart gepubliceerd waarin wordt uitgelegd hoeveel van die parameters tijdens inferentie actief zijn.
Is Grok 4.8 een Mixture-of-Experts-model?
xAI heeft niet publiekelijk bevestigd of Grok 4.8 een dicht model of een MoE-model is. Grok-1 gebruikte een Mixture-of-Experts-architectuur, maar dat is geen bewijs dat Grok 4.8 hetzelfde ontwerp gebruikt.
Wat is de C++-trainingsstack van Grok 4.8?
Musk heeft gezegd dat Grok 4.8 de nieuwe C++-softwarestack van xAI gebruikt, maar xAI heeft daar geen technische beschrijving van vrijgegeven. De belangrijkste onbeantwoorde vraag is welke componenten voor training, communicatie, geheugen en orkestratie de nieuwe stack vervangt of optimaliseert.
Kan Grok 4.8 lokaal draaien?
Er is momenteel geen openbare lokale versie. xAI heeft de gewichten, kwantisaties, architectuurdetails of hardwarevereisten van Grok 4.8 niet vrijgegeven, dus elke schatting van het lokale VRAM-gebruik zou speculatief zijn.
Tech & AI HUB
Meer om te lezen

Waarom verbetert meertalige embeddingondersteuning privézoekopdrachten thuis in 2026?
Ontdek hoe gedeelde ruimtes zoekopdrachten in meerdere talen mogelijk maken, waarom een evenwichtige training belangrijk is en waar exacte termen en talen met weinig...

Waarom wordt compressie van vector databases in 2026 steeds belangrijker voor AI thuis?
Ontdek hoe kwantisatie vectoren verkleint, waarom geheugenlocaliteit zoekopdrachten kan versnellen en waar compressie de recall vermindert of de complexiteit van opnieuw opbouwen verhoogt.

Waarom verschuift herstel van AI-systemen thuis in 2026 naar gecoördineerde checkpoints voor modellen en indexen?
Ontdek waarom back-ups een AI-status met gemengde versies veroorzaken, hoe gecoördineerde controlepunten de consistentie herstellen en wanneer opnieuw opbouwen de betere herstelmethode is.

