Grok 4.8 est un modèle de 2,5 T - mais la nouvelle pile C++ est l’histoire la plus importante

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Grok 4.8 n'a pas été rendu public, mais Elon Musk a déjà révélé deux détails particulièrement importants : il s'agit d'un modèle de 2 500 milliards de paramètres, et xAI l'a entraîné à l'aide d'une nouvelle pile logicielle C++. Il a également indiqué que le modèle passerait à l'apprentissage par renforcement après sa phase d'entraînement actuelle.

Le chiffre de 2 500 milliards fera l'essentiel des gros titres. La pile C++ pourrait nous en apprendre davantage sur l'évolution de l'IA de pointe. À cette échelle, les meilleurs modèles dépendent non seulement de l'architecture et des données d'entraînement, mais aussi de l'efficacité avec laquelle des milliers d'accélérateurs communiquent, récupèrent après des défaillances, déplacent les données, enregistrent des points de contrôle et restent actifs pendant des semaines ou des mois.

Que savons-nous réellement de Grok 4.8 ?

Les informations publiques restent limitées, ce qui rend important de distinguer les détails confirmés des spéculations.

Détails de Grok 4.8 Ce qui est connu publiquement
Nom du modèle Grok 4.8
Nombre total de paramètres 2 500 milliards, selon Elon Musk
Pile d'entraînement Nouvelle pile logicielle C++, selon Musk
Étape d'entraînement Devrait passer à l'apprentissage par renforcement après sa phase principale d'entraînement
Dense ou MoE Non divulgué
Paramètres actifs Non divulgué
Fenêtre de contexte Non divulgué
Tarification de l'API Non annoncé
Date de sortie Non annoncé
Poids ouverts Non annoncé

Au 20 septembre 2026, la documentation publique sur les modèles de xAI répertorie toujours Grok 4.6 comme son modèle généraliste phare. Grok 4.8 ne dispose pas encore d'une page de modèle d'API publique ni de rapport technique.

Cette distinction est importante, car achever une étape majeure de l'entraînement ne revient pas à commercialiser un modèle finalisé.

Pourquoi la nouvelle pile d'entraînement C++ pourrait compter davantage que les 2 500 milliards de paramètres

Depuis ses débuts, xAI considère l'infrastructure comme une composante du développement des modèles. Le billet consacré à l'ingénierie de Grok de l'entreprise décrivait une pile personnalisée d'entraînement et d'inférence fondée sur JAX, Rust et Kubernetes, et soulignait la difficulté à maintenir la productivité de vastes clusters de GPU malgré les défaillances matérielles.

À l'échelle des modèles de pointe, les logiciels d'entraînement doivent gérer bien plus que le réseau neuronal lui-même.

  • utilisation des GPU et planification
  • communication entre les accélérateurs
  • partitionnement des paramètres et des activations
  • allocation de mémoire
  • chargement des données
  • création de points de contrôle
  • détection des pannes et récupération
  • synchronisation distribuée
  • exécution des noyaux
  • surveillance et télémétrie

Un cluster peut disposer d'une puissance de calcul théorique considérable tout en en gaspillant une part importante si les accélérateurs passent trop de temps à attendre les communications, les données, la synchronisation ou la récupération.

C'est la véritable raison pour laquelle la nouvelle pile C++ de Grok 4.8 est intéressante. Son avantage potentiel ne tient pas simplement au fait que « C++ est plus rapide que Python ». Il réside dans le fait qu'une pile personnalisée de plus bas niveau pourrait donner à xAI un contrôle plus précis sur les aspects coûteux de l'entraînement distribué.

Le même principe des goulots d'étranglement apparaît à une échelle bien plus réduite dans l'IA locale. Un système peut disposer d'un GPU puissant tout en attendant l'accès à la mémoire, au stockage ou au réseau. Comprendre si la contrainte vient du calcul, de la mémoire, du stockage ou du réseau est plus utile que de supposer que tout problème de performance nécessite un GPU plus puissant.

Le C++ accélère-t-il automatiquement l'entraînement de l'IA ?

Non.

Les frameworks d'IA modernes exécutent déjà la plupart des opérations lourdes sur les tenseurs via des noyaux GPU compilés, des bibliothèques d'accélérateurs et des compilateurs de graphes. Python sert souvent d'interface de haut niveau plutôt que d'effectuer lui-même la multiplication matricielle.

Hypothèse courante Ce qui compte le plus
Le C++ est plus rapide que Python La question de savoir si la nouvelle pile élimine les véritables goulots d'étranglement à l'exécution
Une réécriture accélère automatiquement l'entraînement La réduction du temps d'inactivité des GPU, de la surcharge mémoire ou des délais de communication
Le langage de programmation détermine la vitesse d'entraînement L'ensemble de la pile de compilation, des noyaux, des communications, de la mémoire et de l'orchestration est important

Une implémentation en C++ pourrait être importante si elle améliore la planification, la gestion de la mémoire, les communications, la création de points de contrôle, les noyaux personnalisés ou la récupération après défaillance. Mais tant que xAI n'aura pas publié l'architecture de sa nouvelle pile, toute affirmation sur l'origine exacte des gains resterait spéculative.

Il est également trop tôt pour dire que xAI a complètement abandonné JAX. Grok-1.5 a été explicitement conçu avec un framework d'entraînement basé sur JAX, Rust et Kubernetes. La déclaration de Musk concernant Grok 4.8 confirme une nouvelle pile C++, mais pas quels anciens composants sont conservés.

Que signifient réellement 2 500 milliards de paramètres ?

Le chiffre brut semble extraordinaire, mais le nombre total de paramètres et le nombre de paramètres actifs ne sont pas la même chose.

Si Grok 4.8 utilise une architecture dense, la plupart ou la totalité de ces paramètres peuvent participer à l'inférence. S'il utilise une architecture de mélange d'experts, seul un sous-ensemble peut être activé pour chaque jeton.

xAI n'a pas révélé quelle architecture utilise Grok 4.8.

Grok-1 montre pourquoi cette distinction est importante. Selon le dépôt officiel de Grok-1, le modèle précédent disposait de :

Spécifications de Grok-1 Valeur
Nombre total de paramètres 314B
Architecture Mélange d'experts
Experts 8
Experts sélectionnés par jeton 2
Poids actifs par jeton Environ 25 %

Cela ne prouve pas que Grok 4.8 utilise la même architecture. Cela montre pourquoi les « 2,5 T de paramètres » ne suffisent pas à déterminer son coût d'inférence, ses besoins en mémoire ou sa puissance de calcul effective par jeton.

Tant que xAI n'aura pas publié l'architecture du modèle, plusieurs questions restent ouvertes :

  • Grok 4.8 est-il dense ou de type MoE ?
  • Combien d'experts contient-il ?
  • Combien sont activés pour chaque jeton ?
  • Quel est son nombre de paramètres actifs ?
  • Quelle proportion du chiffre de 2,5 T revient aux composants multimodaux ?

C'est l'une des principales raisons pour lesquelles il ne faut pas comparer les modèles de pointe uniquement à partir du nombre total de paramètres.

Un modèle de 2,5 T signifie-t-il automatiquement une intelligence supérieure ?

Non. Le nombre de paramètres mesure la capacité du modèle, et non ses capacités finales.

Les performances dans le monde réel dépendent également de :

  • Architecture du modèle
  • Qualité des données d'entraînement
  • Mélange de données
  • Stabilité de l'optimisation
  • Post-entraînement
  • Apprentissage par renforcement
  • Utilisation des outils
  • Calcul au moment du test
  • Conception du service et de l'inférence

Les sorties récentes de xAI montrent déjà à quel point le post-entraînement est devenu important. Dans l'annonce de Grok 4.5, xAI a mis l'accent sur l'apprentissage par renforcement appliqué à des centaines de milliers de tâches et sur des déploiements agentiques de longue durée, plutôt que de présenter la taille du modèle comme l'unique source d'amélioration.

Cela signifie que la question utile n'est pas :

Quelle est la taille de Grok 4.8 ?

C'est :

Avec quelle efficacité xAI transforme-t-elle cette capacité en raisonnement, en codage, en utilisation d'outils et en comportement fiable d'agent ?

Que signifie « commencer le RL » pour Grok 4.8 ?

Passer à l'apprentissage par renforcement ne signifie pas que Grok 4.8 sera lancé immédiatement.

Un modèle de pointe peut encore nécessiter un travail considérable après son entraînement principal, notamment :

  • Apprentissage par renforcement et autres étapes de post-entraînement
  • Optimisation du suivi des instructions
  • Entraînement des agents et à l'utilisation des outils
  • Évaluations de la sécurité et des capacités
  • Optimisation du service
  • Réglage de la latence et de la mémoire
  • Intégration à l'API et aux produits

Le RL peut avoir un effet majeur sur le comportement du modèle, même lorsque le nombre de paramètres sous-jacents ne change pas.

Un modèle peut contenir suffisamment de connaissances pour résoudre un problème de codage difficile, tout en étant peu performant comme agent s'il s'arrête trop tôt, choisit le mauvais outil, gaspille trop d'étapes ou ne vérifie pas son propre travail.

L'orientation actuelle de xAI rend cela particulièrement pertinent. Grok 4.6 est explicitement présenté comme destiné aux agents de longue durée, au codage et au travail cognitif, et son communiqué officiel met l'accent sur la persistance dans les tâches en plusieurs étapes.

Pour Grok 4.8, la phase de RL pourrait donc compter presque autant que l'échelle de préentraînement de 2,5 T lorsqu'il s'agit de déterminer ce que les utilisateurs finiront par expérimenter.

Pourquoi les logiciels d'entraînement deviennent un avantage concurrentiel à l'échelle de pointe

Plus l'entraînement est long, plus les petites inefficacités deviennent coûteuses.

Charge de travail d'IA de moindre envergure Charge de travail d'entraînement de pointe
Quelques accélérateurs Grands clusters d'accélérateurs
Entraînements plus courts Tâches distribuées de longue durée
Un redémarrage peut être gênant Un redémarrage peut gaspiller une quantité importante de calcul
Un certain matériel inactif est tolérable Les petites pertes d'utilisation se multiplient à l'échelle du cluster
Points de contrôle simples La création de points de contrôle devient un problème de stockage distribué
Surcoût de communication limité La communication peut devenir un goulot d'étranglement majeur

L'infrastructure Grok d'origine de xAI mettait explicitement l'accent sur la maximisation du calcul utile par watt et le maintien d'une utilisation élevée des FLOPS du modèle, même en cas de défaillance du matériel.

Cela donne à la pile C++ de Grok 4.8 une interprétation plus utile :

les laboratoires d'IA de pointe se livrent de plus en plus concurrence non seulement sur la conception des modèles, mais aussi sur la quantité d'intelligence utile qu'ils peuvent extraire d'un même matériel coûteux.

Le principe est étonnamment similaire à celui de l'IA locale, même si l'échelle est complètement différente. Les systèmes locaux bénéficient eux aussi de l'adéquation de chaque charge de travail à la ressource appropriée, plutôt que de l'achat irréfléchi de matériel supplémentaire.

Grok 4.8 peut-il fonctionner localement ?

Il n'existe actuellement aucun fondement permettant d'affirmer que Grok 4.8 peut fonctionner localement.

xAI n'a pas publié :

  • poids de Grok 4.8
  • une architecture de modèle
  • nombre de paramètres actifs
  • points de contrôle quantifiés
  • configuration matérielle requise pour l'IA locale
  • instructions d'auto-hébergement

Même le chiffre de 2,5 T ne permet pas d'estimer de manière significative la VRAM sans savoir si le modèle est dense ou parcimonieux.

Cela rend Grok 4.8 très différent des modèles ouverts qui peuvent être quantifiés et déployés sur du matériel grand public. Pour l'instant, il appartient au domaine du calcul centralisé de pointe.

Cela ne rend pas l'IA locale obsolète. Cela rend la séparation des charges de travail plus importante.

Pourquoi un modèle de pointe de 2,5 T pourrait rendre l'IA locale encore plus précieuse

L'IA de pointe et l'IA locale optimisent de plus en plus des contraintes opposées.

IA de pointe IA locale
Maximiser les capacités Utiliser uniquement les capacités nécessaires à la tâche
Calcul centralisé massif Matériel grand public ou serveur domestique
Optimiser l'utilisation du cluster Optimiser la RAM, la VRAM, le stockage et la consommation électrique
Servir de nombreux utilisateurs Servir un utilisateur, un foyer ou une petite équipe
Priorité au cloud Priorité au local ou hybride

La question importante pour un utilisateur local n'est pas de savoir si un modèle de 7B, 14B ou 30B peut surpasser Grok 4.8 dans l'ensemble.

La question est de savoir si la tâche actuelle a réellement besoin d'une intelligence de niveau Grok 4.8.

Tâche Point de départ probablement optimal
Classifier des fichiers privés Petit modèle local ou classificateur
Rechercher dans des documents privés Récupération locale et plongements
Synthèse courante Petit ou moyen modèle local
Surveillance continue par un agent Système local ou hybride
Raisonnement scientifique complexe Modèle cloud de pointe
Ingénierie logicielle complexe Modèle de raisonnement ou de programmation de pointe

C'est pourquoi l'IA hybride et le routage des modèles deviennent plus utiles à mesure que les systèmes de pointe gagnent en taille. Les charges de travail courantes, privées et répétitives peuvent rester locales, tandis que les cas difficiles sont transférés vers une API de pointe.

Un assistant IA privé, par exemple, peut conserver la récupération, l'accès aux documents, la mémoire et l'inférence légère à proximité des fichiers locaux, sans nécessiter le modèle cloud le plus puissant à chaque étape.

La limite de confidentialité compte également. Un système n’est pas véritablement local simplement parce que son LLM principal fonctionne à domicile. Les embeddings, l’authentification, le routage ou les appels d’outils peuvent toujours dépendre de services distants. Un flux de travail d’IA véritablement capable de fonctionner hors ligne doit rester local sur l’ensemble de la chaîne de dépendances.

Grok 4.8 est avant tout une histoire d’infrastructure

Lorsque Grok 4.8 sera lancé, l’attention se portera probablement surtout sur les scores aux benchmarks, les résultats en programmation, les tests de raisonnement et les comparaisons avec d’autres modèles de pointe.

Mais avant même que ces chiffres existent, son infrastructure est déjà révélatrice.

xAI a commencé avec une pile personnalisée reposant sur JAX, Rust et Kubernetes. L’entreprise a publiquement mis l’accent sur les pannes de GPU, la création de points de contrôle, la synchronisation, le calcul utile par watt et le Model FLOP Utilization. Musk affirme désormais qu’un modèle de 2,5 T est entraîné avec une nouvelle pile logicielle C++.

Cela suggère que la frontière de la concurrence se déplace toujours plus vers l’infrastructure.

Pour xAI, la question est de savoir comment extraire davantage d’entraînement utile d’une quantité colossale de calcul.

Pour les utilisateurs d’IA locale, la question la plus utile est l’inverse : quelle quantité de calcul pouvons-nous éviter d’utiliser dès le départ ?

Le meilleur système local ne sera peut-être pas celui qui tente de reproduire chez soi un modèle de pointe de 2,5 T. Ce sera peut-être celui qui conserve les tâches courantes en local, utilise des modèles spécialisés lorsque c’est possible et ne fait appel à une intelligence de pointe que lorsque ses capacités supplémentaires changent réellement le résultat.

Foire aux questions sur Grok 4.8

Grok 4.8 est-il sorti ?

Non. Au 20 septembre 2026, xAI n’a annoncé ni sortie publique de Grok 4.8, ni modèle d’API, ni date de sortie. Sa documentation publique sur les modèles présente actuellement Grok 4.6 comme son modèle généraliste phare.

Combien de paramètres possède Grok 4.8 ?

Elon Musk affirme que Grok 4.8 possède 2,5 billions de paramètres. xAI n’a pas encore publié de fiche technique indiquant combien de ces paramètres sont actifs pendant l’inférence.

Grok 4.8 est-il un modèle Mixture-of-Experts ?

xAI n’a pas confirmé publiquement si Grok 4.8 est un modèle dense ou un modèle MoE. Grok-1 utilisait une architecture Mixture-of-Experts, mais cela ne prouve pas que Grok 4.8 repose sur la même conception.

Qu’est-ce que la pile d’entraînement C++ de Grok 4.8 ?

Musk a déclaré que Grok 4.8 utilise la nouvelle pile logicielle C++ de xAI, mais xAI n’en a pas publié de description technique. La principale question en suspens est de savoir quels composants d’entraînement, de communication, de mémoire et d’orchestration cette nouvelle pile remplace ou optimise.

Grok 4.8 peut-il fonctionner en local ?

Il n’existe actuellement aucune version locale publique. xAI n’a publié ni les poids de Grok 4.8, ni ses quantifications, ni les détails de son architecture, ni ses exigences matérielles ; toute estimation de la VRAM nécessaire en local serait donc spéculative.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.