Grok 4.8 nie został publicznie wydany, ale Elon Musk ujawnił już dwa wyjątkowo istotne szczegóły: jest to model z 2,5 bln parametrów, a xAI wytrenowała go przy użyciu nowego stosu oprogramowania C++. Powiedział również, że po obecnej fazie treningu model przejdzie do uczenia ze wzmocnieniem.
Liczba 2,5 bln przyciągnie większość uwagi mediów. Stos C++ może powiedzieć nam więcej o kierunku rozwoju czołowej sztucznej inteligencji. Przy tej skali lepsze modele zależą nie tylko od architektury i danych treningowych, lecz także od tego, jak wydajnie tysiące akceleratorów się komunikują, odzyskują sprawność po awariach, przesyłają dane, zapisują punkty kontrolne i pozostają aktywne przez tygodnie lub miesiące.
Co tak naprawdę wiemy o Groku 4.8?
Informacji publicznych nadal jest niewiele, dlatego ważne jest oddzielenie potwierdzonych szczegółów od spekulacji.
| Szczegóły dotyczące Groka 4.8 | Co wiadomo publicznie |
|---|---|
| Nazwa modelu | Grok 4.8 |
| Łączna liczba parametrów | 2,5 biliona, według Elona Muska |
| Stos treningowy | Nowy stos oprogramowania C++, według Muska |
| Etap treningu | Oczekuje się, że po zakończeniu głównej fazy treningu przejdzie do uczenia ze wzmocnieniem |
| Gęsty czy MoE | Nie ujawniono |
| Aktywne parametry | Nie ujawniono |
| Okno kontekstu | Nie ujawniono |
| Ceny API | Nie ogłoszono |
| Data wydania | Nie ogłoszono |
| Otwarte wagi | Nie ogłoszono |
Na dzień 20 września 2026 r. w publicznej dokumentacji modeli xAI Grok 4.6 nadal figuruje jako flagowy model ogólnego przeznaczenia. Grok 4.8 nie ma jeszcze publicznej strony modelu API ani raportu technicznego.
To rozróżnienie ma znaczenie, ponieważ ukończenie ważnego etapu treningu nie jest tym samym co wydanie gotowego modelu.
Dlaczego nowy stos treningowy C++ może mieć większe znaczenie niż 2,5 bln parametrów
Od początku xAI traktowała infrastrukturę jako część procesu tworzenia modeli. W pierwotnym wpisie inżynieryjnym o Groku opisano niestandardowy stos treningowy i inferencyjny oparty na JAX, Rust i Kubernetes, a także podkreślono trudność utrzymania produktywności dużych klastrów GPU mimo awarii sprzętu.
Przy tej skali oprogramowanie treningowe musi zarządzać znacznie większą liczbą elementów niż tylko samą siecią neuronową.
- wykorzystanie GPU i harmonogramowanie
- komunikacja między akceleratorami
- dzielenie parametrów i aktywacji
- alokacja pamięci
- ładowanie danych
- tworzenie punktów kontrolnych
- wykrywanie awarii i przywracanie działania
- synchronizacja rozproszona
- wykonywanie kerneli
- monitorowanie i telemetria
Klaster może dysponować ogromną teoretyczną mocą obliczeniową, a mimo to marnować jej znaczną część, jeśli akceleratory zbyt długo czekają na komunikację, dane, synchronizację lub przywrócenie działania.
Oto prawdziwy powód, dla którego nowy stos C++ Groka 4.8 jest interesujący. Potencjalna przewaga nie polega po prostu na tym, że „C++ jest szybszy niż Python”. Chodzi o to, że niestandardowy stos niższego poziomu może zapewnić xAI większą kontrolę nad kosztownymi elementami rozproszonego treningu.
Ta sama zasada dotycząca wąskich gardeł występuje na znacznie mniejszą skalę w lokalnej AI. System może mieć wydajny procesor graficzny, a mimo to czekać na dostęp do pamięci, pamięci masowej lub sieci. Zrozumienie, czy ograniczeniem jest moc obliczeniowa, pamięć, pamięć masowa czy sieć, jest bardziej przydatne niż zakładanie, że każdy problem z wydajnością wymaga większego GPU.
Czy C++ automatycznie przyspiesza trening AI?
Nie.
Nowoczesne frameworki AI już wykonują większość intensywnych operacji na tensorach za pośrednictwem skompilowanych kerneli GPU, bibliotek akceleratorów i kompilatorów grafów obliczeniowych. Python często pełni rolę interfejsu wysokiego poziomu, zamiast samodzielnie wykonywać właściwe mnożenie macierzy.
| Powszechne założenie | Co ma większe znaczenie |
|---|---|
| C++ jest szybszy niż Python | Czy nowy stos usuwa rzeczywiste wąskie gardła w czasie działania |
| Przepisanie kodu automatycznie przyspiesza trening | O ile zmniejsza się czas bezczynności GPU, narzut pamięci lub opóźnienie komunikacji |
| Język programowania decyduje o szybkości treningu | Znaczenie ma cały stos kompilatora, kerneli, komunikacji, pamięci i orkiestracji |
Implementacja w C++ może mieć znaczenie, jeśli usprawni harmonogramowanie, zarządzanie pamięcią, komunikację, tworzenie punktów kontrolnych, niestandardowe kernele lub odzyskiwanie po awariach. Dopóki jednak xAI nie opublikuje architektury nowego stosu, twierdzenia o dokładnych źródłach tych usprawnień pozostają spekulacjami.
Jest też zbyt wcześnie, by stwierdzić, że xAI całkowicie porzuciło JAX. Grok-1.5 został wyraźnie zbudowany na bazie frameworka treningowego JAX, Rust i Kubernetes. Wypowiedź Muska na temat Grok 4.8 potwierdza nowy stos C++, ale nie wskazuje, które starsze komponenty pozostały.
Co tak naprawdę oznacza 2,5 biliona parametrów?
Sama liczba brzmi niezwykle, ale łączna liczba parametrów i liczba parametrów aktywnych to nie to samo.
Jeśli Grok 4.8 korzysta z architektury gęstej, większość lub wszystkie te parametry mogą brać udział w procesie wnioskowania. Jeśli korzysta z architektury typu Mieszanka ekspertów, dla każdego tokenu może być aktywowany tylko podzbiór parametrów.
xAI nie ujawniło, z jakiej architektury korzysta Grok 4.8.
Grok-1 pokazuje, dlaczego to rozróżnienie ma znaczenie. Zgodnie z oficjalnym repozytorium Grok-1 wcześniejszy model miał:
| Specyfikacja Grok-1 | Wartość |
|---|---|
| Łączna liczba parametrów | 314B |
| Architektura | Mieszanka ekspertów |
| Eksperci | 8 |
| Eksperci wybierani na token | 2 |
| Wagi aktywne na token | Około 25% |
Nie dowodzi to, że Grok 4.8 korzysta z tej samej architektury. Pokazuje natomiast, dlaczego sama liczba „2,5 bln parametrów” nie pozwala określić kosztu wnioskowania, wymagań pamięci ani efektywnej mocy obliczeniowej na token.
Dopóki xAI nie opublikuje architektury modelu, kilka kwestii pozostaje otwartych:
- Czy Grok 4.8 jest modelem gęstym czy MoE?
- Ilu ekspertów zawiera?
- Ile z nich aktywuje się dla każdego tokena?
- Jaka jest liczba jego aktywnych parametrów?
- Jaka część wartości 2,5 bln parametrów przypada na komponenty multimodalne?
To jeden z najważniejszych powodów, dla których nie należy porównywać modeli z najwyższej półki wyłącznie na podstawie całkowitej liczby parametrów.
Czy model 2,5 bln parametrów automatycznie oznacza lepszą inteligencję?
Nie. Liczba parametrów mierzy możliwości modelu, a nie jego gotową funkcjonalność.
Na wydajność w świecie rzeczywistym wpływają również:
- architektura modelu
- jakość danych treningowych
- mieszanka danych
- stabilność optymalizacji
- posttrening
- uczenie ze wzmocnieniem
- korzystanie z narzędzi
- obliczenia w czasie testowania
- projekt obsługi i wnioskowania
Najnowsze premiery xAI już pokazują, jak ważny stał się posttrening. W ogłoszeniu Groka 4.5 xAI podkreśliło uczenie ze wzmocnieniem na setkach tysięcy zadań oraz długotrwałe przebiegi agentów, zamiast przedstawiać rozmiar modelu jako jedyne źródło poprawy.
Oznacza to, że właściwe pytanie nie brzmi:
Jak duży jest Grok 4.8?
To:
Jak skutecznie xAI przekłada tę moc na rozumowanie, programowanie, korzystanie z narzędzi i niezawodne zachowanie agenta?
Co oznacza „rozpoczęcie RL” w przypadku Groka 4.8?
Przejście do uczenia ze wzmocnieniem nie oznacza, że Grok 4.8 zostanie wkrótce uruchomiony.
Model z najwyższej półki może nadal wymagać znacznej pracy po zakończeniu głównego przebiegu treningowego, w tym:
- uczenie ze wzmocnieniem i inne etapy posttreningu
- optymalizacja wykonywania instrukcji
- trening agentów i korzystania z narzędzi
- oceny bezpieczeństwa i możliwości
- optymalizacja obsługi
- dostrajanie opóźnień i pamięci
- Integracja z API i produktami
RL może znacząco wpływać na zachowanie modelu, nawet gdy liczba jego parametrów bazowych się nie zmienia.
Model może zawierać wystarczającą wiedzę, aby rozwiązać trudny problem programistyczny, a mimo to działać słabo jako agent, jeśli zbyt wcześnie przerywa, wybiera niewłaściwe narzędzie, marnuje zbyt wiele kroków lub nie potrafi zweryfikować własnej pracy.
Obecny kierunek rozwoju xAI sprawia, że jest to szczególnie istotne. Grok 4.6 jest wyraźnie pozycjonowany jako model do długotrwałego działania agentów, programowania i pracy z wiedzą, a jego oficjalna premiera podkreśla zachowanie ciągłości podczas wieloetapowych zadań.
W przypadku Groka 4.8 faza RL może więc mieć niemal takie samo znaczenie jak skala pretreningu wynosząca 2,5 bln parametrów, jeśli chodzi o to, czego ostatecznie doświadczą użytkownicy.
Dlaczego oprogramowanie treningowe staje się przewagą konkurencyjną w skali modeli z najwyższej półki
Im większy staje się przebieg treningowy, tym droższe stają się nawet niewielkie nieefektywności.
| Mniejsze obciążenie AI | Obciążenie treningowe modelu z najwyższej półki |
|---|---|
| Kilka akceleratorów | Duże klastry akceleratorów |
| Krótsze przebiegi treningowe | Długotrwałe zadania rozproszone |
| Ponowne uruchomienie może być uciążliwe | Ponowne uruchomienie może zmarnować znaczną moc obliczeniową |
| Pewna ilość bezczynnego sprzętu jest akceptowalna | Niewielkie straty wykorzystania kumulują się w całym klastrze |
| Proste punkty kontrolne | Punkty kontrolne stają się problemem rozproszonego przechowywania danych |
| Ograniczony narzut komunikacyjny | Komunikacja może stać się głównym wąskim gardłem |
Pierwotna infrastruktura Grok firmy xAI wyraźnie koncentrowała się na maksymalizacji użytecznej mocy obliczeniowej na wat i utrzymywaniu wysokiego wykorzystania FLOP modelu nawet w przypadku awarii sprzętu.
To nadaje stosowi C++ Grok 4.8 bardziej użyteczną interpretację:
laboratoria frontier AI coraz częściej konkurują nie tylko w zakresie projektowania modeli, lecz także pod względem ilości użytecznej inteligencji, jaką potrafią wydobyć z tego samego drogiego sprzętu.
Zasada jest zaskakująco podobna do lokalnej AI, mimo że skala jest zupełnie inna. Systemy lokalne również korzystają na dopasowaniu każdego obciążenia do odpowiedniego zasobu, zamiast bezrefleksyjnego kupowania większej ilości sprzętu.
Czy Grok 4.8 może działać lokalnie?
Obecnie nie ma podstaw, by twierdzić, że Grok 4.8 może działać lokalnie.
xAI nie udostępniło:
- wagi Grok 4.8
- architektura modelu
- liczba aktywnych parametrów
- skwantyzowane checkpointy
- wymagania dotyczące lokalnego sprzętu
- instrukcje dotyczące self-hostingu
Nawet wartość 2,5T nie pozwala oszacować w sensowny sposób wymaganej pamięci VRAM bez wiedzy o tym, czy model jest gęsty, czy rzadki.
To sprawia, że Grok 4.8 znacznie różni się od otwartych modeli, które można kwantyzować i uruchamiać na sprzęcie konsumenckim. Na razie należy do scentralizowanej strony obliczeń frontier w AI.
Nie oznacza to, że lokalna AI staje się nieistotna. Sprawia to, że jeszcze ważniejsze staje się rozdzielanie obciążeń.
Dlaczego model frontier 2,5T może zwiększyć znaczenie lokalnej AI
AI frontier i lokalna AI coraz częściej optymalizują się pod kątem przeciwnych ograniczeń.
| AI frontier | Lokalna AI |
|---|---|
| Maksymalizacja możliwości | Wykorzystywanie wyłącznie możliwości potrzebnych do danego zadania |
| Ogromna scentralizowana moc obliczeniowa | Sprzęt konsumencki lub serwer domowy |
| Optymalizacja wykorzystania klastra | Optymalizacja pamięci RAM, VRAM, pamięci masowej i zużycia energii |
| Obsługa wielu użytkowników | Obsługa jednego użytkownika, gospodarstwa domowego lub małego zespołu |
| Podejście chmurowe | Podejście lokalne lub hybrydowe |
Ważne pytanie dla użytkownika lokalnego systemu nie brzmi, czy model 7B, 14B lub 30B może ogólnie przewyższyć Grok 4.8.
Chodzi o to, czy bieżące zadanie w ogóle wymaga inteligencji na poziomie Grok 4.8.
| Zadanie | Prawdopodobnie najlepszy punkt wyjścia |
|---|---|
| Klasyfikowanie prywatnych plików | Mały model lokalny lub klasyfikator |
| Wyszukiwanie prywatnych dokumentów | Lokalne wyszukiwanie i embeddingi |
| Rutynowe tworzenie podsumowań | Mały lub średni model lokalny |
| Monitorowanie agenta działającego stale | System lokalny lub hybrydowy |
| Trudne rozumowanie naukowe | Chmurowy model frontier |
| Trudna inżynieria oprogramowania | Model frontier do rozumowania lub programowania |
Dlatego hybrydowa AI i routing modeli stają się coraz bardziej przydatne w miarę powiększania się systemów frontier. Rutynowe, prywatne i powtarzalne zadania mogą pozostać lokalne, podczas gdy trudniejsze przypadki są przekazywane do API modelu frontier.
Na przykład prywatny asystent AI może przechowywać pobieranie danych, dostęp do dokumentów, pamięć i lekkie wnioskowanie blisko lokalnych plików, bez konieczności korzystania z najmocniejszego modelu chmurowego przy każdym kroku.
Liczy się także granica prywatności. System nie jest naprawdę lokalny tylko dlatego, że jego główny LLM działa w domu. Embeddingi, uwierzytelnianie, routing lub wywołania narzędzi nadal mogą zależeć od usług zdalnych. Naprawdę działający offline przepływ pracy AI musi pozostać lokalny w całym łańcuchu zależności.
Grok 4.8 to w rzeczywistości opowieść o infrastrukturze
Gdy Grok 4.8 zostanie uruchomiony, uwaga prawdopodobnie skupi się na wynikach benchmarków, rezultatach programowania, testach rozumowania i porównaniach z innymi przełomowymi modelami.
Jednak zanim te liczby staną się rzeczywistością, obraz jego infrastruktury już jest widoczny.
xAI zaczęło od niestandardowego stosu opartego na JAX, Ruście i Kubernetesie. Firma publicznie podkreślała awarie GPU, tworzenie punktów kontrolnych, synchronizację, ilość użytecznych obliczeń na wat oraz Model FLOP Utilization. Teraz Musk twierdzi, że model o wielkości 2,5 bln parametrów jest trenowany przy użyciu nowego stosu oprogramowania w języku C++.
Sugeruje to, że konkurencja na czołowym poziomie coraz bardziej przenosi się w obszar infrastruktury.
Dla xAI pytanie dotyczy tego, jak uzyskać więcej użytecznego treningu z ogromnych ilości mocy obliczeniowej.
Dla użytkowników lokalnej AI bardziej użyteczne jest pytanie odwrotne: ile mocy obliczeniowej możemy w ogóle uniknąć?
Najlepszy system lokalny nie musi być tym, który próbuje odtworzyć w domu przełomowy model o 2,5 bln parametrów. Może nim być system, który zachowuje rutynowe zadania lokalnie, w miarę możliwości korzysta z wyspecjalizowanych modeli, a z inteligencji przełomowych modeli korzysta tylko wtedy, gdy dodatkowe możliwości rzeczywiście zmieniają wynik.
Najczęściej zadawane pytania dotyczące Grok 4.8
Czy Grok 4.8 został wydany?
Nie. Według stanu na 20 września 2026 r. xAI nie ogłosiło publicznego wydania Grok 4.8, modelu API ani daty premiery. W publicznej dokumentacji modeli jako flagowy model ogólnego przeznaczenia nadal wymieniany jest Grok 4.6.
Ile parametrów ma Grok 4.8?
Elon Musk twierdzi, że Grok 4.8 ma 2,5 biliona parametrów. xAI nie opublikowało jeszcze karty modelu wyjaśniającej, ile z tych parametrów jest aktywnych podczas inferencji.
Czy Grok 4.8 jest modelem Mixture-of-Experts?
xAI nie potwierdziło publicznie, czy Grok 4.8 jest modelem gęstym, czy MoE. Grok-1 wykorzystywał architekturę Mixture-of-Experts, ale nie jest to dowód, że Grok 4.8 korzysta z tej samej konstrukcji.
Czym jest stos treningowy Grok 4.8 w języku C++?
Musk powiedział, że Grok 4.8 korzysta z nowego stosu oprogramowania xAI w języku C++, ale xAI nie opublikowało jego opisu technicznego. Najważniejszym pytaniem bez odpowiedzi jest to, które komponenty związane z trenowaniem, komunikacją, pamięcią i orkiestracją nowy stos zastępuje lub optymalizuje.
Czy Grok 4.8 może działać lokalnie?
Obecnie nie ma publicznie dostępnej wersji lokalnej. xAI nie udostępniło wag Grok 4.8, kwantyzacji, szczegółów architektury ani wymagań sprzętowych, więc wszelkie szacunki dotyczące lokalnego VRAM-u byłyby spekulacyjne.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Top 10 AI Agent Memory Tools for Local Deployments in 2026
Compare 10 AI agent memory tools for local deployment, persistent context, files, graphs, user profiles, and stateful agents.

10 Best MCP Servers for Web Search and Research in 2026
Top MCP servers for web search, page retrieval, crawling, structured data, and multi-source research in AI agent workflows.

10 najlepszych asystentów programowania AI typu open source w 2026 roku
Porównaj 10 asystentów programowania AI typu open source do IDE, terminali, modeli lokalnych, samodzielnego hostingu, przepływów pracy Git i autonomicznego tworzenia oprogramowania.

