Grok 4.8 non è stato rilasciato pubblicamente, ma Elon Musk ha già rivelato due dettagli insolitamente importanti: è un modello con 2,5 trilioni di parametri e xAI lo ha addestrato utilizzando un nuovo stack software C++. Ha inoltre affermato che il modello sarebbe passato all'apprendimento per rinforzo dopo l'attuale fase di addestramento.
La cifra di 2,5T sarà quella che attirerà maggiormente l'attenzione. Lo stack C++ potrebbe dirci di più sulla direzione dell'IA frontier. A questa scala, modelli migliori dipendono non solo dall'architettura e dai dati di addestramento, ma anche dall'efficienza con cui migliaia di acceleratori comunicano, si riprendono dai guasti, trasferiscono dati, salvano checkpoint e rimangono operativi per settimane o mesi.
Che cosa sappiamo davvero di Grok 4.8?
Le informazioni pubbliche sono ancora limitate, quindi è importante separare i dettagli confermati dalle speculazioni.
| Dettaglio su Grok 4.8 | Ciò che è noto pubblicamente |
|---|---|
| Nome del modello | Grok 4.8 |
| Parametri totali | 2,5 trilioni, secondo Elon Musk |
| Stack di addestramento | Nuovo stack software C++, secondo Musk |
| Fase di addestramento | Dovrebbe passare all'apprendimento per rinforzo dopo la fase principale di addestramento |
| Denso o MoE | Non divulgato |
| Parametri attivi | Non divulgato |
| Finestra di contesto | Non divulgato |
| Prezzi delle API | Non annunciato |
| Data di rilascio | Non annunciato |
| Pesi aperti | Non annunciato |
Al 20 settembre 2026, la documentazione pubblica sui modelli di xAI elenca ancora Grok 4.6 come modello di punta per uso generale. Grok 4.8 non dispone ancora di una pagina pubblica del modello per le API né di un rapporto tecnico.
Questa distinzione è importante perché completare una fase importante dell'addestramento non equivale a rilasciare un modello finito.
Perché il nuovo stack C++ per l'addestramento potrebbe essere più importante di 2,5T di parametri
Fin dall'inizio xAI ha considerato l'infrastruttura parte integrante dello sviluppo dei modelli. Il post originale di xAI sull'ingegneria di Grok descriveva uno stack personalizzato per l'addestramento e l'inferenza basato su JAX, Rust e Kubernetes e sottolineava la difficoltà di mantenere produttivi grandi cluster di GPU nonostante i guasti hardware.
Su scala frontier, il software di addestramento deve gestire molto più della sola rete neurale.
- utilizzo e pianificazione delle GPU
- comunicazione tra acceleratori
- suddivisione dei parametri e delle attivazioni
- allocazione della memoria
- caricamento dei dati
- creazione di checkpoint
- rilevamento e ripristino dai guasti
- sincronizzazione distribuita
- esecuzione dei kernel
- monitoraggio e telemetria
Un cluster può disporre di una potenza di calcolo teorica enorme e sprecarne comunque una parte significativa se gli acceleratori trascorrono troppo tempo in attesa della comunicazione, dei dati, della sincronizzazione o del ripristino.
Questo è il vero motivo per cui il nuovo stack C++ di Grok 4.8 è interessante. Il potenziale vantaggio non consiste semplicemente nel fatto che «il C++ è più veloce del Python». È che uno stack personalizzato di livello più basso potrebbe dare a xAI un controllo più preciso sulle parti costose dell'addestramento distribuito.
Lo stesso principio dei colli di bottiglia si applica, su scala molto più ridotta, all'IA locale. Un sistema può avere una GPU potente, ma dover comunque attendere l'accesso alla memoria, allo storage o alla rete. Capire se il vincolo riguarda il calcolo, la memoria, lo storage o la rete è più utile che presumere che ogni problema di prestazioni richieda una GPU più grande.
Il C++ rende automaticamente più veloce l'addestramento dell'IA?
No.
I moderni framework di IA eseguono già la maggior parte delle operazioni tensoriali pesanti tramite kernel GPU compilati, librerie per acceleratori e compilatori di grafi. Python spesso funge da interfaccia di alto livello, invece di eseguire direttamente la moltiplicazione matriciale.
| Assunzione comune | Ciò che conta di più |
|---|---|
| C++ è più veloce di Python | Se il nuovo stack elimina i veri colli di bottiglia a runtime |
| Una riscrittura accelera automaticamente l'addestramento | Quanto si riducono i tempi di inattività della GPU, l'overhead di memoria o i ritardi di comunicazione |
| Il linguaggio di programmazione determina la velocità di addestramento | L'intero stack di compilazione, kernel, comunicazione, memoria e orchestrazione è importante |
Un'implementazione in C++ potrebbe essere importante se migliorasse la pianificazione, la gestione della memoria, la comunicazione, i checkpoint, i kernel personalizzati o il ripristino dagli errori. Tuttavia, finché xAI non pubblicherà l'architettura del suo nuovo stack, affermare esattamente da dove derivino i miglioramenti sarebbe speculativo.
È inoltre troppo presto per affermare che xAI abbia completamente abbandonato JAX. Grok-1.5 è stato esplicitamente sviluppato su un framework di addestramento basato su JAX, Rust e Kubernetes. L'affermazione di Musk su Grok 4.8 conferma un nuovo stack C++, ma non quali componenti precedenti siano rimasti.
Che cosa significano davvero 2,5 trilioni di parametri?
Il numero grezzo sembra straordinario, ma i parametri totali e i parametri attivi non sono la stessa cosa.
Se Grok 4.8 utilizza un'architettura densa, la maggior parte o tutti quei parametri potrebbero partecipare all'inferenza. Se utilizza un'architettura Mixture-of-Experts, per ogni token potrebbe attivarsi solo un sottoinsieme.
xAI non ha rivelato quale architettura utilizzi Grok 4.8.
Grok-1 dimostra perché questa distinzione è importante. Secondo il repository ufficiale di Grok-1, il modello precedente aveva:
| Specifiche di Grok-1 | Valore |
|---|---|
| Parametri totali | 314B |
| Architettura | Mixture-of-Experts |
| Esperti | 8 |
| Esperti selezionati per token | 2 |
| Pesi attivi per token | Circa il 25% |
Questo non dimostra che Grok 4.8 utilizzi la stessa architettura. Dimostra perché “2.5T parametri” da solo non può dirci quale sia il suo costo di inferenza, il fabbisogno di memoria o il calcolo effettivo per token.
Finché xAI non pubblicherà l'architettura del modello, diverse domande resteranno aperte:
- Grok 4.8 è denso o MoE?
- Quanti esperti contiene?
- Quanti si attivano per ogni token?
- Qual è il suo numero di parametri attivi?
- Quanta parte della cifra di 2,5T appartiene ai componenti multimodali?
Questo è uno dei motivi più importanti per cui non bisogna confrontare i modelli frontier basandosi solo sul numero totale di parametri.
Un modello da 2,5T significa automaticamente un'intelligenza migliore?
No. Il numero di parametri misura la capacità del modello, non le capacità finali.
Le prestazioni nel mondo reale dipendono anche da:
- Architettura del modello
- Qualità dei dati di training
- Miscela di dati
- Stabilità dell'ottimizzazione
- Post-training
- Apprendimento per rinforzo
- Uso degli strumenti
- Calcolo al momento del test
- Progettazione del serving e dell'inferenza
I recenti rilasci di xAI mostrano già quanto sia diventato importante il post-training. Nell'annuncio di Grok 4.5, xAI ha sottolineato l'apprendimento per rinforzo su centinaia di migliaia di attività e rollout agentici di lunga durata, invece di presentare le dimensioni del modello come l'unica fonte di miglioramento.
Ciò significa che la domanda utile non è:
Quanto è grande Grok 4.8?
È:
Con quale efficacia xAI trasforma questa capacità in ragionamento, programmazione, uso degli strumenti e comportamento affidabile degli agenti?
Che cosa significa “iniziare l'RL” per Grok 4.8?
Passare all'apprendimento per rinforzo non significa che Grok 4.8 stia per essere lanciato immediatamente.
Un modello frontier può richiedere ancora molto lavoro dopo l'esecuzione principale del training, tra cui:
- Apprendimento per rinforzo e altro post-training
- Ottimizzazione del rispetto delle istruzioni
- Training degli agenti e dell'uso degli strumenti
- Valutazioni di sicurezza e capacità
- Ottimizzazione del serving
- Ottimizzazione di latenza e memoria
- Integrazione con API e prodotti
L'RL può avere un effetto significativo sul comportamento del modello anche quando il numero di parametri sottostante non cambia.
Un modello può contenere conoscenze sufficienti per risolvere un difficile problema di programmazione, ma avere comunque prestazioni scarse come agente se si ferma troppo presto, sceglie lo strumento sbagliato, spreca troppi passaggi o non riesce a verificare il proprio lavoro.
L'attuale direzione di xAI rende questo aspetto particolarmente rilevante. Grok 4.6 è presentato esplicitamente come un modello per agenti di lunga durata, programmazione e lavoro della conoscenza, e il suo rilascio ufficiale sottolinea la persistenza nelle attività composte da più passaggi.
Per Grok 4.8, la fase RL potrebbe quindi essere importante quasi quanto la scala di pretraining da 2,5T per ciò che gli utenti sperimenteranno alla fine.
Perché il software di training diventa un vantaggio competitivo su scala frontier
Quanto più grande diventa l'esecuzione di training, tanto più costose diventano le piccole inefficienze.
| Carico di lavoro IA più ridotto | Carico di lavoro di training frontier |
|---|---|
| Pochi acceleratori | Cluster di acceleratori di grandi dimensioni |
| Esecuzioni di training più brevi | Job distribuiti di lunga durata |
| Un riavvio può essere scomodo | Un riavvio può sprecare una quantità significativa di capacità di calcolo |
| Una certa quantità di hardware inattivo è tollerabile | Le piccole perdite di utilizzo si moltiplicano nell'intero cluster |
| Checkpoint semplici | Il checkpointing diventa un problema di storage distribuito |
| Overhead di comunicazione limitato | La comunicazione può diventare un collo di bottiglia importante |
L'infrastruttura originale di Grok di xAI si concentrava esplicitamente sulla massimizzazione del calcolo utile per watt e sul mantenimento di un'elevata Model FLOP Utilization anche in caso di guasti hardware.
Questo offre un'interpretazione più utile dello stack C++ di Grok 4.8:
I laboratori di IA frontier competono sempre più non solo sulla progettazione dei modelli, ma anche sulla quantità di intelligenza utile che riescono a estrarre dallo stesso hardware costoso.
Il principio è sorprendentemente simile a quello dell'IA locale, anche se la scala è completamente diversa. Anche i sistemi locali traggono vantaggio dall'abbinare ogni carico di lavoro alla risorsa giusta, invece di acquistare alla cieca hardware più potente.
Grok 4.8 può funzionare localmente?
Attualmente non esistono basi per affermare che Grok 4.8 possa funzionare localmente.
xAI non ha rilasciato:
- i pesi di Grok 4.8
- un'architettura del modello
- numero di parametri attivi
- checkpoint quantizzati
- requisiti hardware locali
- istruzioni per il self-hosting
Anche il dato di 2,5T non consente di stimare in modo significativo la VRAM senza sapere se il modello è denso o sparso.
Questo rende Grok 4.8 molto diverso dai modelli open source che possono essere quantizzati e trasferiti su hardware consumer. Per ora, appartiene al lato dell'IA basato sul calcolo frontier centralizzato.
Questo non rende irrilevante l'IA locale. Rende più importante la separazione dei carichi di lavoro.
Perché un modello frontier da 2,5T potrebbe rendere l'IA locale più preziosa
L'IA frontier e l'IA locale ottimizzano sempre più vincoli opposti.
| IA frontier | IA locale |
|---|---|
| Massimizzare le capacità | Utilizzare solo le capacità necessarie per l'attività |
| Enorme potenza di calcolo centralizzata | Hardware consumer o per server domestici |
| Ottimizzare l'utilizzo del cluster | Ottimizzare RAM, VRAM, spazio di archiviazione e consumi |
| Servire molti utenti | Servire un singolo utente, una famiglia o un piccolo team |
| Cloud come prima scelta | Locale come prima scelta o ibrido |
La domanda importante per un utente locale non è se un modello da 7B, 14B o 30B possa superare complessivamente Grok 4.8.
Il punto è capire se l'attività corrente abbia davvero bisogno di un'intelligenza del livello di Grok 4.8.
| Attività | Punto di partenza probabilmente migliore |
|---|---|
| Classificare i file privati | Piccolo modello locale o classificatore |
| Cercare nei documenti privati | Recupero locale ed embeddings |
| Riepilogo di routine | Modello locale di piccole o medie dimensioni |
| Monitoraggio continuo degli agenti | Sistema locale o ibrido |
| Ragionamento scientifico complesso | Modello cloud frontier |
| Ingegneria del software complessa | Modello frontier di ragionamento o programmazione |
Per questo motivo, l'IA ibrida e il routing dei modelli diventano più utili man mano che i sistemi frontier diventano più grandi. I carichi di lavoro di routine, privati e ripetitivi possono rimanere locali, mentre i casi difficili vengono inoltrati a un'API frontier.
Un assistente IA privato, ad esempio, può mantenere il recupero, l'accesso ai documenti, la memoria e l'inferenza leggera vicino ai file locali, senza richiedere il modello cloud più potente per ogni passaggio.
Anche il confine della privacy è importante. Un sistema non è veramente locale solo perché il suo LLM principale viene eseguito a casa. Embedding, autenticazione, routing o chiamate agli strumenti possono comunque dipendere da servizi remoti. Un flusso di lavoro IA realmente capace di funzionare offline deve rimanere locale lungo l'intera catena delle dipendenze.
Grok 4.8 è soprattutto una storia di infrastruttura
Quando Grok 4.8 verrà lanciato, la maggior parte dell'attenzione si sposterà probabilmente sui punteggi dei benchmark, sui risultati nella programmazione, sui test di ragionamento e sui confronti con altri modelli frontier.
Ma prima ancora che quei numeri esistano, la sua storia infrastrutturale è già visibile.
xAI ha iniziato con uno stack personalizzato basato su JAX, Rust e Kubernetes. Ha posto pubblicamente l'accento sui guasti delle GPU, sui checkpoint, sulla sincronizzazione, sulla potenza di calcolo utile per watt e sul Model FLOP Utilization. Ora Musk afferma che un modello da 2,5T viene addestrato con un nuovo stack software C++.
Ciò suggerisce che la frontiera competitiva si stia spostando sempre più verso l'infrastruttura.
Per xAI, la domanda è come estrarre un addestramento più utile da enormi quantità di potenza di calcolo.
Per gli utenti dell'IA locale, la domanda più utile è l'inversa: quanta potenza di calcolo possiamo evitare di utilizzare fin dall'inizio?
Il miglior sistema locale potrebbe non essere quello che cerca di riprodurre a casa un modello frontier da 2,5T. Potrebbe essere quello che mantiene localmente le attività di routine, utilizza modelli specializzati quando possibile e ricorre all'intelligenza frontier solo quando le capacità aggiuntive cambiano realmente il risultato.
Domande frequenti su Grok 4.8
Grok 4.8 è stato rilasciato?
No. Al 20 settembre 2026, xAI non ha annunciato un rilascio pubblico di Grok 4.8, un modello API o una data di rilascio. La documentazione pubblica dei modelli elenca attualmente Grok 4.6 come modello generalista di punta.
Quanti parametri ha Grok 4.8?
Elon Musk afferma che Grok 4.8 ha 2,5 trilioni di parametri. xAI non ha ancora pubblicato una model card che spieghi quanti di questi parametri siano attivi durante l'inferenza.
Grok 4.8 è un modello Mixture-of-Experts?
xAI non ha confermato pubblicamente se Grok 4.8 sia un modello denso o MoE. Grok-1 utilizzava un'architettura Mixture-of-Experts, ma ciò non dimostra che Grok 4.8 utilizzi lo stesso design.
Che cos'è lo stack di addestramento C++ di Grok 4.8?
Musk ha dichiarato che Grok 4.8 utilizza il nuovo stack software C++ di xAI, ma xAI non ne ha rilasciato una descrizione tecnica. La domanda più importante ancora senza risposta è quali componenti di addestramento, comunicazione, memoria e orchestrazione il nuovo stack sostituisca o ottimizzi.
Grok 4.8 può essere eseguito localmente?
Al momento non esiste una versione locale pubblica. xAI non ha rilasciato i pesi, le quantizzazioni, i dettagli sull'architettura o i requisiti hardware di Grok 4.8, quindi qualsiasi stima della VRAM necessaria per l'esecuzione locale sarebbe speculativa.
Hub Tecnologico e AI
Altro da leggere

Top 10 AI Agent Memory Tools for Local Deployments in 2026
Compare 10 AI agent memory tools for local deployment, persistent context, files, graphs, user profiles, and stateful agents.

10 Best MCP Servers for Web Search and Research in 2026
Top MCP servers for web search, page retrieval, crawling, structured data, and multi-source research in AI agent workflows.

I 10 migliori assistenti di programmazione IA open source nel 2026
Confronta 10 assistenti di programmazione AI open source per IDE, terminali, modelli locali, self-hosting, flussi di lavoro Git e sviluppo autonomo.

