GPT-6 Astra tworzy jednego z najbardziej przekonujących pelikanów w historii, ale test Pelikana na rowerze staje się ciekawszy, gdy porówna się go z Claude Fable 5.1, Gemini 3.8 Flash, Qwen 3.8, DeepSeek V4, Kimi K3 i GLM-5.3-Flash. Jednowierszowa prośba o wygenerowanie pelikana jadącego na rowerze w formacie SVG zmusza model językowy do przełożenia słów na kod, geometrię, anatomię, relacje między obiektami oraz scenę, w której błędy są natychmiast widoczne.
Najnowsze wyniki pokazują, że nie ma jednego wyraźnego zwycięzcy. GPT-6 Astra podnosi minimalny poziom jakości, Claude może poświęcić zdecydowanie więcej rozumowania na naprawę geometrii, Gemini zapewnia wyjątkowe dopracowanie wizualne, Qwen pokazuje, jak blisko mogą być modele lokalne, a DeepSeek demonstruje, jak bardzo ustawienia rozumowania mogą zmienić wynik jednego modelu. Animacje GLM i DeepSeek wspomagane narzędziami ujawniają jeszcze coś innego: gdy agent może samodzielnie analizować i iterować nad własnym artefaktem, test przestaje mierzyć wyłącznie model.
Wyniki testu Pelikan na rowerze w skrócie
| Model | Typ testu | Co się wyróżniało | Główne zastrzeżenie |
|---|---|---|---|
| GPT-6 Astra | Standardowy SVG, od poziomu Low do Max | Bardzo mocna baza; już poziom Low wizualnie przewyższał poprzednią rodzinę GPT-5.6 | Poniżej poziomu Max ułożenie nóg wokół ramy roweru nadal było niespójne |
| Claude Fable 5.1 | Standardowy SVG + osobny etap animacji | Poziom Max dał wysoce przemyślaną kompozycję z silną interakcją rowerzysty z rowerem | Poziom Max zajmował niemal 14 minut i kosztował zdecydowanie więcej niż Low |
| Gemini 3.8 Flash | Standardowy SVG, od niskiego do wysokiego poziomu | Wyjątkowo dopracowana wizualnie i spójna dekoracyjnie | Efektowność wizualna to nie to samo co poprawność fizyczna |
| Qwen 3.8 27B | Lokalny standardowy SVG | Jeden z najsilniejszych wygenerowanych pelikanów autorstwa lokalnego modelu o wielkości około 17 GB | Domyślny poziom rozumowania xhigh pochłonął ponad 22 000 tokenów rozumowania |
| Qwen 3.8 Flash-Next | Lokalny standardowy SVG | Mocna scena z modelem MoE o 125 mld parametrów, z około 6 mld aktywnych parametrów | Lokalny wynik w dużej mierze zależy od kwantyzacji i dostępnego sprzętu |
| Qwen 3.8 Max | Standardowy SVG / większy model | Czysta interakcja rowerzysty z rowerem i dopracowana kompozycja | Znacznie większy model, więc nie jest to uczciwe porównanie sprzętu lokalnego |
| Kimi K3 | Standardowy SVG | Spójny rezultat uzyskany z wyjątkowo krótkiego promptu | Wykorzystano ponad 13 000 tokenów rozumowania |
| DeepSeek V4 Pro 0813 | Standardowy SVG, od niskiego do wysokiego poziomu | Poziomy rozumowania prowadziły do radykalnie różnych strategii wizualnych | Duża zmienność sprawia, że pojedynczy zrzut ekranu słabo podsumowuje możliwości modelu |
| DeepSeek V4 Flash 0731 | Standardowy SVG | Wysoki poziom rozumowania naprawił domyślny, poważnie uszkodzony rower | Poprawa rozumowania była ogromna, ale nie była gwarantowana |
| GLM-5.3-Flash | Animowany HTML/SVG wspomagany przez agenta | Bogata animacja, pedały, elementy sterujące sceną i iteracyjna praca wizualna | Chrome MCP i środowisko agenta sprawiają, że wyników nie można porównywać z testami jednorazowymi |
To nie jest naukowa tabela wyników. Publiczne uruchomienia przeprowadzono w różnych momentach, z użyciem różnych interfejsów API, ustawień rozumowania, kwantyzacji, a w niektórych przypadkach także różnych środowisk narzędziowych.
Bardziej uzasadnione porównanie dotyczy zachowania. Czy rower ma spójną ramę? Czy stopy sięgają pedałów? Czy ptak rzeczywiście oddziałuje z kierownicą? Czy dodatkowe rozumowanie koryguje te relacje, czy tylko dodaje więcej ozdobników?
Co tak naprawdę mierzy test roweru z pelikanem?
Oryginalny prompt jest celowo minimalistyczny:
Wygeneruj SVG pelikana jadącego na rowerze.
Przygotowanie przekonującej odpowiedzi wymaga jednoczesnego działania kilku zdolności. Model musi napisać poprawny kod SVG, zbudować rozpoznawalny rower, przybliżyć anatomię pelikana, umieścić ptaka we właściwej części sceny i sprawić, by oddzielne obiekty oddziaływały na siebie w sposób wiarygodny wizualnie.
Dzięki temu test jest przydatny do obserwowania:
- generowanie kodu SVG i frontendu,
- geometrię obiektów,
- kompozycję przestrzenną,
- spójność anatomiczną,
- interakcję między obiektami,
- stosowanie się do instrukcji,
- oraz efektywności nakładu pracy na rozumowanie.
Nie mierzy on bezpośrednio dokładności faktograficznej, rozumowania naukowego, programowania na poziomie całych repozytoriów, niezawodności agentów, wiedzy specjalistycznej ani inteligencji ogólnej.
Simon Willison, który wielokrotnie stosował ten prompt w kolejnych generacjach modeli, również podchodzi do niego coraz ostrożniej. Obecnie traktuje go przede wszystkim jako szybki test zachowania i użyteczny sposób porównywania wydań w ramach tej samej rodziny modeli, a nie jako uniwersalny test inteligencji.
Analiza testu roweru z pelikanem autorstwa Simona Willisona dotycząca Kimi K3 wyraźnie ostrzega przed traktowaniem pojedynczych wyników testu roweru z pelikanem jako poważnego rankingu modeli.
To ograniczenie jest istotne, ponieważ współczesne modele są już wystarczająco dobre, by gust wizualny coraz bardziej wpływał na wynik. Gdy każdy rezultat zawiera rozpoznawalnego ptaka i rower, piękny zachód słońca lub koszyk na ryby może sprawić, że jeden obraz wyda się inteligentniejszy, nawet jeśli inny model ma dokładniejszą geometrię.
Jak GPT-6 Astra wypadła w teście roweru z pelikanem?
Najważniejszy wynik GPT-6 Astry nie polega po prostu na tym, że poziom Max robi imponujące wrażenie. Chodzi o to, że już poziom Low tworzy znacznie lepszego pelikana niż poprzednia rodzina GPT-5.6.
Willison przetestował Astrę na poziomach rozumowania Low, Medium, High, XHigh i Max. Odnotowana przez niego liczba tokenów wyjściowych wzrosła z 1906 przy poziomie Low do 12 638 przy poziomie Max.
| Rozumowanie Astry | Tokeny wyjściowe | Zarejestrowany koszt |
|---|---|---|
| Niski | 1,906 | $0.0955 |
| Średni | 2,560 | $0.1282 |
| Wysoki | 3,671 | $0.1837 |
| XHigh | 6,766 | $0.3385 |
| Max | 12,638 | $0.6321 |
Najmocniejszą obserwacją Willisona było to, że Astra Low wyglądała lepiej niż jakikolwiek wygenerowany przez niego Sol Pelican GPT-5.6 na dowolnym poziomie rozumowania. Oznacza to, że chodzi tu mniej o maksymalny poziom rozumowania, a bardziej o generacyjny wzrost bazowych zdolności kodowania wizualnego.
Rower staje się bardziej spójny, pelikan zostaje wyraźnie zintegrowany z pojazdem, a cała scena wymaga od widza mniej interpretacji.
Zadanie nadal nie zostało jednak rozwiązane idealnie. W porównaniu z Maxem Astra nie umieściła niezawodnie obu nóg po przeciwnych stronach ramy roweru.
Właśnie dlatego ten głupi benchmark pozostaje użyteczny. Dopracowany wynik może od razu sprawiać wrażenie kompetencji, podczas gdy niewielka zależność, taka jak położenie nóg, ujawnia, czy scena jest spójna strukturalnie.
Astra wydaje się lepiej rozumieć kompozycję, ale test Pelikana nie może potwierdzić, że utrzymuje przypominający ludzki model fizyczny jazdy na rowerze.
GPT-6 Astra również pojawił się w demonstracji dla deweloperów OpenAI
Prezentacja GPT-6 Astra dla deweloperów OpenAI zawiera kolejne odniesienie do Pelikana, pokazując jednocześnie bogatsze generowanie grafiki i obrazu 3D. Nie jest to ten sam kontrolowany przebieg SVG, dlatego należy traktować go jako uzupełniający dowód, a nie część porównania.
Dodatkowy przykład wizualny GPT-6 Astra z prezentacji dla deweloperów OpenAI. Nie należy go bezpośrednio porównywać z kontrolowaną siatką SVG.
Claude Fable 5.1: Czy intensywniejsze myślenie daje lepszego pelikana?
Claude Fable 5.1 pokazuje, że dodatkowe rozumowanie może poprawić relacje geometryczne, ale jednocześnie pokazuje, jak szybko koszt prostego zadania wizualnego może eksplodować.
Poziomy Low i Medium ukończono w około 23 sekundy, a każdy z nich kosztował mniej więcej dziesięć centów. High zajmował około 29,6 sekundy.
Następnie krzywa gwałtownie się zmieniła.
| Rozumowanie | Czas | Zarejestrowany koszt |
|---|---|---|
| Niski | 23,8 sekundy | ~0,10 USD |
| Średni | 23 sekundy | ~0,10 USD |
| Wysoki | 29,6 sekundy | ~0,13 USD |
| XHigh | 7 minut 51 sekund | $1.83 |
| Max | 13 minut 54 sekundy | $3.30 |
Wynik Maxa rzeczywiście poprawia istotne szczegóły. Obie nogi są wyraźnie umieszczone po obu stronach ramy roweru, stopy sięgają pedałów, skrzydło dosięga kierownicy, a geometrii roweru poświęcono znacznie więcej uwagi.
Ślad rozumowania jest szczególnie wymowny, ponieważ Fable aktywnie ponownie rozważał poszczególne elementy rysunku. Zauważył problemy z geometrią przedniego widelca, ponownie przeanalizował położenie kasku względem dzioba i wielokrotnie sprawdzał, czy elementy dekoracyjne nie będą kolidować z resztą sceny.
Daje nam to rzadko spotykany, widoczny związek między większą ilością rozumowania a bardziej wewnętrznie spójnym artefaktem.
Różnica w kosztach jest jednak ogromna.
Przydatne pytanie nie brzmi, czy Max jest lepszy. Chodzi o to, czy Pelikan trwający niemal 14 minut jest na tyle wartościowy, by uzasadniać koszt ponad 30 razy wyższy niż w przypadku Low.
Pelikan Claude'a został następnie animowany w drugim przejściu
Publiczna animacja nie została utworzona za pomocą oryginalnego promptu Pelican. Willison wziął plik SVG Max i przesłał go ponownie do Fable 5.1, dodając osobne polecenie animowania istniejącego artefaktu.
W drugim przebiegu wykorzystano 6 121 tokenów wejściowych i 26 201 tokenów wyjściowych, co wiązało się z dodatkowym odnotowanym kosztem około 1,37 USD.
Ponieważ animacja była drugim zadaniem, nie należy jej bezpośrednio porównywać ze statycznymi, jednorazowymi wynikami innych modeli. Nadal jest jednak przydatna, ponieważ pokazuje, co dzieje się, gdy model musi zachować geometrię, jednocześnie wprowadzając ruch.
Obejrzyj oryginalnego animowanego pelikana Claude Fable 5.1.
Gemini 3.8 Flash: Czy wizualny rozmach oznacza lepsze rozumienie?
Gemini 3.8 Flash wyróżnia się z innego powodu: sprawia, że test przypomina pracę ilustratorską, a nie ćwiczenie z geometrii.
Wynik High obejmuje turkusowy rower cruiser, czerwony szalik w kropki, koszyk na ryby, nadmorską promenadę oraz świecące tło nadmorskiego krajobrazu.
Od razu przyciąga wzrok.
To sprawia, że Gemini jest dobrym przykładem problemu z testami wizualnymi: ludzie w naturalny sposób nagradzają styl.
Bardziej dopracowana kompozycja może sprawiać wrażenie inteligentniejszej, zanim sprawdzimy, czy rama roweru prawidłowo się zamyka, czy stopa rzeczywiście dosięga pedału oraz czy ciało pelikana jest spójnie umieszczone względem siodełka.
Dopracowanie wizualne jest rzeczywistą umiejętnością, ale dopracowanie wizualne i spójność fizyczna to różne zdolności.
W miarę rozwoju modeli Test Pelikana coraz częściej mierzy oba te aspekty. Z tego powodu proste rankingi zwycięzców są mniej miarodajne niż analiza konkretnych sposobów, w jakie poszczególne modele odnoszą sukcesy lub ponoszą porażki.
Qwen 3.8 27B: Czy lokalny model o rozmiarze 17 GB może konkurować z pelikanami modeli czołowych?
Qwen 3.8 27B może być najważniejszym wynikiem dla użytkowników lokalnej AI, ponieważ nie był to ogromny model dostępny wyłącznie w chmurze.
Willison uruchomił lokalnie w LM Studio skwantyzowaną wersję Q4_K_M o rozmiarze około 17 GB, przeprowadzając również eksperymenty na lokalnym sprzęcie z dużą ilością pamięci.
Wynik jest wyjątkowo spójny jak na model, który można spakować do skwantyzowanego pliku o rozmiarze około 17 GB.
Rower ma oczekiwany kształt ramy. Dwie nogi znajdują się po przeciwnych stronach roweru, co w przypadku wielu modeli jest zaskakująco trudną relacją do odwzorowania. Pelikan ma wyraźną torbę dziobową, jego skrzydło sięga kierownicy, a linie ruchu umieszczono za sceną, zamiast przecinać jej elementy.
Willison opisał go w tamtym momencie jako najlepszy plik SVG z pelikanem, jaki lokalnie wygenerował.
Ale jest tu pewien istotny haczyk.
Qwen 3.8 27B zdecydowanie zbyt długo analizował to zadanie.
Przy domyślnym poziomie rozumowania xhigh model potrzebował około 21 minut. Wykorzystał 22 276 tokenów na rozumowanie, zanim wygenerował 3 223 tokeny końcowego wyniku.
Po wyłączeniu rozumowania generowanie skróciło się do nieco ponad dwóch minut, ale wynik stał się zauważalnie gorszy.
Kadr stał się słabszy, stopy minęły się z pedałami, a model nie podjął już poważnej próby połączenia skrzydła z kierownicą.
To niemal przeciwieństwo historii GPT-6 Astra.
Najbardziej imponującą cechą Astry jest to, że tryb Low już zapewnia wysoką jakość. Qwen 3.8 27B pokazuje, jak wiele jakości wizualnej można uzyskać ze stosunkowo kompaktowego lokalnego sprzętu, jeśli modelowi pozwoli się poświęcić dużo czasu na rozumowanie.
Nie jest to dowód na to, że model o rozmiarze 17 GB ogólnie dogonił GPT-6. Jest to dowód na to, że „wystarczająco mały, by uruchamiać go lokalnie” i „zdolny do tworzenia wyrafinowanych, ustrukturyzowanych wyników” nie wykluczają się już wzajemnie.
Qwen 3.8 Flash-Next: co może narysować model MoE z 6B aktywnych parametrów?
Qwen 3.8 Flash-Next dostarcza drugi punkt danych dotyczący lokalnej sztucznej inteligencji, pochodzący z zupełnie innej architektury.
Model ma łącznie 125 miliardów parametrów, ale dla każdego tokenu aktywuje około 6 miliardów parametrów. To rozróżnienie może zmniejszyć wymagania obliczeniowe, nawet jeśli pełny zestaw wag pozostaje znacznie większy niż 6B.
Wynik xhigh przedstawia dopracowaną scenę. Pelikan siedzi nad czerwonym rowerem, ryba zajmuje przedni koszyk, a sam rower zachowuje rozpoznawalną strukturę zamiast rozpadać się na niepołączone łuki i rury.
Tym, co czyni ten wynik interesującym, nie jest to, czy jest ładniejszy od Gemini lub Astry.
Chodzi o to, że rzadkie modele MoE sprawiają, iż proste porównania liczby parametrów stają się mniej przydatne.
Model 125B z około 6B aktywnych parametrów nie zachowuje się jak konwencjonalny, gęsty model 6B i nie ma też takich samych właściwości pod względem przechowywania i pamięci.
Pelikan pokazuje stronę związaną z możliwościami tego równania: stosunkowo niewielka aktywna moc obliczeniowa nadal może koordynować zaskakująco wyrafinowaną, ustrukturyzowaną scenę.
Qwen 3.8 Max: co się zmienia, gdy model staje się znacznie większy?
Qwen 3.8 Max zapewnia przydatne porównanie z wyższej półki w ramach tej samej szerzej rozumianej rodziny modeli.
Wynik jest przejrzysty i łatwy do analizy. Nogi sięgają pedałów, rower ma konwencjonalną formę, a cała scena pozostaje na tyle prosta, że geometria jest czytelna.
Jednak Qwen Max potwierdza jeszcze jeden wniosek z testu:
Większy model nie powinien automatycznie otrzymywać wyższej oceny tylko dlatego, że jest większy.
W praktyce lokalnej sztucznej inteligencji Qwen 3.8 27B może być w rzeczywistości ciekawszym pelikanem, ponieważ mówi nam coś o tym, co może działać na sprzęcie, który zaawansowany użytkownik domowy mógłby realnie posiadać.
Max pokazuje granicę możliwości modelu. Lokalny wynik 27B pokazuje postęp w zakresie wdrażania.
Kimi K3: Ile rozumowania potrzebuje jeden pelikan?
Kimi K3 stworzył kolejnego spójnego pelikana, ale jego ukryte zużycie mocy obliczeniowej może być ciekawsze niż sam obraz.
Prompt liczył zaledwie kilka słów, a mimo to odnotowane uruchomienie wykorzystało 95 tokenów wejściowych i 16 658 tokenów wyjściowych.
Spośród tych tokenów wyjściowych 13 241 stanowiły tokeny rozumowania.
Odnotowany koszt tego uruchomienia wyniósł około 0,25 USD.
Końcowa scena jest udana: rozpoznawalny rower, rozpoznawalny pelikan, rozsądne umiejscowienie jeźdźca, szczegóły tła, droga i elementy sugerujące ruch.
Jednak liczby ujawniają coś, czego nie widać na obrazie.
Wizualnie prosty wynik może skrywać ogrom pracy wykonanej po stronie modelu.
Ma to znaczenie w rzeczywistych zastosowaniach. Model może wydawać się niedrogi, gdy oceniamy go na podstawie pojedynczego udanego wyniku, ale może okazać się kosztowny lub powolny, gdy ten sam schemat rozumowania jest powtarzany setki razy w ramach przepływu pracy agenta.
W przypadku Kimi pelikan staje się niemal w równym stopniu testem efektywności rozumowania, co testem rysowania.
DeepSeek V4 Pro: Dlaczego różne poziomy rozumowania wyglądają jak różne modele?
DeepSeek V4 Pro 0813 dał jeden z najdziwniejszych eksperymentów porównujących rozumowanie w archiwum.
Niski, średni i wysoki poziom nie wyglądały po prostu jak coraz bardziej dopracowane wersje tego samego projektu. Wydawało się, że stosują różne strategie wizualne.
DeepSeek V4 Pro 0813 przy niskim, średnim i wysokim poziomie rozumowania. Źródło: Test DeepSeek V4 Pro autorstwa Simona Willisona.
Niski poziom jest stosunkowo czysty i minimalistyczny. Średni staje się znacznie bardziej abstrakcyjny: w kompozycji dominują urwane łuki koła, swobodne kreski i dziwnie wydłużony kształt. Wysoki ponownie zmienia kierunek, wracając do bardziej konwencjonalnego czerwonego roweru i dodając koszyk, proporzec oraz nuty.
Wniosek nie brzmi po prostu: „Wysoki jest lepszy”.
Wysiłek włożony w rozumowanie wydaje się wpływać na wybór strategii wizualnej przez model, a nie tylko na staranność wykonania jednej, z góry ustalonej kompozycji.
To sprawia, że DeepSeek V4 Pro jest doskonałym przypomnieniem, że pojedynczy zrzut ekranu to bardzo słaba podstawa do twierdzenia, że model dobrze lub źle radzi sobie z kodowaniem wizualnym.
Liczy się wariancja próbkowania. Ustawienia rozumowania mają znaczenie. Znaczenie może mieć także API lub uprząż testowa. Pelikan uwidacznia te różnice, ponieważ możemy od razu sprawdzić wynik.
DeepSeek V4 Flash: Czy większa liczba etapów rozumowania może naprawić zepsuty rower?
DeepSeek V4 Flash 0731 stanowi jeszcze wyraźniejszy przykład wpływu rozumowania na geometrię.
Wynik domyślny przedstawiał poważnie zniekształcony rower. Koła wyglądały jak niepełne łuki, rury ramy unosiły się bez połączenia, a pelikan zawisł nad sceną zamiast przekonująco jechać na rowerze.
Willison następnie zwiększył poziom wysiłku związanego z rozumowaniem do High, korzystając z tego samego podstawowego zadania.
Wynik zmienił się diametralnie.
Wynik High zawiera kompletne koła, rozpoznawalną ramę, obszar korby, pelikana trzymającego kierownicę oraz stopę umieszczoną w pobliżu pedału.
Nie dowodzi to, że większy wysiłek związany z rozumowaniem zawsze naprawia generowanie grafiki.
Sugeruje to, że niektóre nieudane wyniki SVG są problemami z koordynacją, a nie dowodem na całkowity brak reprezentacji geometrii roweru w modelu.
Poszczególne elementy mogą już istnieć wewnątrz modelu; dodatkowe rozumowanie czasami pomaga prawidłowo je połączyć.
Dlaczego DeepSeek V4 Flash pokonał kiedyś V4 Pro w tym samym prompcie z pelikanem
Wcześniejsze porównanie DeepSeek V4 przyniosło kolejny nieintuicyjny rezultat.
Źródło: Porównanie DeepSeek V4 autorstwa Simona Willisona.
Wersja Flash miała znakomity rower według standardów testu pelikana: rozpoznawalną ramę, widoczny łańcuch, odblask, skrzydła sięgające kierownicy i stopy na pedałach.
Model Pro zachował rozsądnie wyglądający rower, ale wygenerował znacznie dziwniejszego pelikana o przerośniętym ciele i niespójnej anatomii.
Nie należy tego interpretować jako dowodu, że Flash jest ogólnie inteligentniejszy od Pro.
Pokazuje to coś węższego, ale bardziej użytecznego:
Rozmiar modelu i reputacja w benchmarkach nie gwarantują najlepszego wyniku w przypadku pojedynczego stochastycznego promptu dotyczącego kodowania grafiki.
GLM-5.3-Flash kontra DeepSeek V4 Flash: co się dzieje, gdy modele otrzymują narzędzia?
GLM-5.3-Flash wprowadza inny rodzaj eksperymentu z pelikanem.
W porównaniu społecznościowym wykorzystano środowisko agentowe zamiast prostego testu jednolinijkowego. Zarówno GLM-5.3-Flash, jak i eksperymentalna konfiguracja DeepSeek V4 Flash z obsługą wizji działały z OpenCode, Trellis, Chrome MCP i maksymalnym poziomem rozumowania.
Instrukcja wymagała od modeli utworzenia kompletnej strony HTML zawierającej dwuwymiarową animację SVG i wyraźnie informowała je, że zadanie ma charakter konkursu.
To zmienia to, co jest mierzone.
Model nie ogranicza się już do generowania jednego pliku SVG na podstawie jednego promptu. Może poświęcić więcej czasu, korzystać z narzędzi, analizować środowisko przeglądarki i działać bardziej jak agent programistyczny.
Animowany pelikan GLM-5.3-Flash
Animacja GLM-5.3-Flash utworzona przy użyciu OpenCode, Trellis, Chrome MCP i maksymalnego poziomu rozumowania. Źródło: oryginalne porównanie społeczności.
Wynik GLM jest znacznie bardziej ambitny niż przedstawione wyżej statyczne pelikany. Zawiera kompletną scenę, wyraźnie zdefiniowane elementy roweru, ruch, pedały i bogatszą prezentację na poziomie strony.
Komentujący ze społeczności generalnie preferowali wynik GLM, wskazując na bardziej kompletną pracę nad pedałami i animacją.
Nadal widoczne są błędy. Część ruchów nóg wygląda mechanicznie nienaturalnie, a dodanie większej liczby animacji stwarza więcej okazji do zerwania wzajemnych zależności.
Tworzy to użyteczne rozróżnienie:
Wynik bogatszy w funkcje nie jest automatycznie wynikiem bardziej poprawnym pod względem fizycznym.
Animowany pelikan DeepSeek V4 Flash Vision
Eksperyment wizyjny DeepSeek V4 Flash wygenerowany w tym samym środowisku wspomaganym narzędziami. Źródło: metodyka i dyskusja społeczności dotyczące testu.
Wersja DeepSeek przyjmuje inne podejście, wykorzystując kompozycję zachodu słońca i czytelniejszą responsywną prezentację.
Społeczność generalnie lepiej oceniała mechaniczną kompletność GLM, jednocześnie doceniając kompozycję wizualną i prezentację mobilną DeepSeek.
Co ważniejsze, oba wyniki pokazują, jak szybko zmienia się znaczenie testu porównawczego AI po wprowadzeniu narzędzi.
Testowany system obejmuje teraz:
- model bazowy,
- konfiguracja rozumowania,
- środowisko agenta,
- narzędzia przeglądarkowe,
- informacje zwrotne dotyczące obrazu,
- czas wykonania,
- oraz strategia iteracji.
Nazywanie wyniku po prostu „GLM kontra DeepSeek” ukrywa znaczną część tego, co faktycznie doprowadziło do powstania artefaktu.
Dlaczego jednorazowe pelikanie i animacje wspomagane przez agentów nie powinny dzielić jednego rankingu
To rozróżnienie jest na tyle istotne, że warto wyrazić je wprost.
| Test | Co to głównie mierzy |
|---|---|
| Jednolinijkowy prompt do SVG | Rozumowanie modelu, generowanie SVG i koordynacja przestrzenna w jednej odpowiedzi |
| Większy wysiłek związany z rozumowaniem | Czy dodatkowe wnioskowanie pomaga naprawić geometrię i wzajemne zależności |
| Animacja w drugim przebiegu | Czy model potrafi zachować istniejącą kompozycję, wprowadzając jednocześnie ruch |
| Agent + Chrome MCP | Model, środowisko testowe, narzędzia, pętla informacji zwrotnych i iteracyjne programowanie razem |
Silna animacja wspomagana przez agenta jest prawdopodobnie bardziej istotna dla współczesnych przepływów pracy związanych z programowaniem niż jednorazowy plik SVG.
Ale to inny test.
Jeśli GPT-6 Astra otrzymuje jedną odpowiedź, a GLM dostaje dwadzieścia minut, przeglądarkę i wizualne informacje zwrotne, nie możemy odpowiedzialnie twierdzić, że końcowa animacja dowodzi, iż GLM jest lepszy w pierwotnym teście porównawczym.
Dowodzi to, że modele stają się znacznie bardziej zdolne, gdy zostają umieszczone w systemach, które mogą analizować, wykonywać i korygować własną pracę.
Który model AI faktycznie wygrał test pelikana na rowerze?
Nie ma jednego zwycięzcy, którego można naukowo uzasadnić, ale obecne wyniki ujawniają kilku liderów w poszczególnych kategoriach.
| Kategoria | Wyróżniający się model | Dlaczego |
|---|---|---|
| Największa poprawa względem wersji bazowej | GPT-6 Astra | Niskie rozumowanie już zapewnia znaczną poprawę w porównaniu z rodziną GPT-5.6 |
| Najbardziej przemyślana geometria wymagająca dużego nakładu pracy | Claude Fable 5.1 Max | Jawne rozumowanie naprawiło relacje między jeźdźcem, widelcem i obiektem |
| Najbardziej efektowna oprawa wizualna | Gemini 3.8 Flash | Przekształca minimalistyczny prompt w starannie zaprojektowaną ilustrację |
| Najbardziej imponujący wynik lokalny | Qwen 3.8 27B | Lokalny model po kwantyzacji o rozmiarze około 17 GB tworzy niezwykle spójną geometrię |
| Najciekawszy wynik modelu sparse-MoE | Qwen 3.8 Flash-Next | Mocna kompozycja mimo około 6 mld aktywnych parametrów na token |
| Najbardziej skrajny przypadek rozumowania | Kimi K3 | Ponad 13 000 tokenów rozumowania dla krótkiego promptu |
| Najlepszy przykład naprawy dzięki rozumowaniu | DeepSeek V4 Flash | Wysoki poziom rozumowania znacznie poprawia domyślnie zepsuty rower |
| Największa zmienność wyników | DeepSeek V4 Pro | Niskie, średnie i wysokie ustawienia tworzą radykalnie różne strategie wizualne |
| Najbardziej ambitna animacja wspomagana narzędziami | GLM-5.3-Flash | Tworzy bogatszy animowany artefakt HTML po udostępnieniu środowiska agenta i narzędzi przeglądarki |
Jeśli pytanie brzmi po prostu, który obecny model tworzy najlepszego Pelikana w jednym podejściu i przy minimalnym rozumowaniu, trudno zignorować GPT-6 Astra.
Jeśli pytanie brzmi, który wynik jest najbardziej zaskakujący w przypadku sprzętu, który rzeczywiście może stać na biurku i działać lokalnie, Qwen 3.8 27B staje się znacznie ważniejszy.
Jeśli test przejdzie od generowania w jednym podejściu do przepływu pracy agenta kodującego z narzędziami i iteracją, GLM-5.3-Flash pokazuje, jak wysoko może wzrosnąć poprzeczka.
To trzy różne pytania — właśnie dlatego jeden zwycięzca wyłoniony na podstawie liczby ukryłby więcej, niż wyjaśnił.
Czy te modele AI naprawdę rozumieją to, co rysują?
Test roweru Pelikana nie może dowieść prawdziwego rozumienia fizyki.
Model może wygenerować rower wyglądający poprawnie, ponieważ jego trening zapewnił mu potężne reprezentacje rowerów, ptaków, kodu SVG i typowych kompozycji wizualnych.
Skuteczna koordynacja tych reprezentacji jest dowodem użytecznych kompetencji przestrzennych.
Nie dowodzi to, że model rozumie równowagę, grawitację, obciążenia mechaniczne, ruch pedałów ani lokomocję w taki sam sposób jak człowiek.
Pozostałe błędy szczególnie wyraźnie to pokazują.
Astra potrafi stworzyć atrakcyjny rower, jednocześnie nieprawidłowo umieszczając obie nogi wokół ramy. Animowane koła Claude'a mogą ujawnić problemy z ruchem, które były niewidoczne w statycznym SVG. Qwen może poświęcić 22 000 tokenów na rozumowanie i budowanie sceny, którą inny model tworzy znacznie szybciej. DeepSeek może wygenerować zepsuty rower na jednym poziomie rozumowania, a spójny na innym.
Modele te stają się znakomite w konstruowaniu struktur wizualnych na podstawie języka.
To, czy należy to opisywać jako „rozumienie”, zależy od tego, jakiego poziomu wewnętrznej reprezentacji wymagamy od tego słowa.
Dlaczego chińskie modele open source są najciekawszą częścią tego testu
Najważniejszą zmianą od wcześniejszych wersji testu Pelikana może nie być to, że GPT-6 tworzy lepszego ptaka.
Chodzi o to, że otwarte modele możliwe do wdrożenia lokalnie generują teraz wyniki, które jeszcze niedawno zaskakująco wyglądałyby na rezultaty modeli z czołówki.
Qwen 3.8 27B może lokalnie wygenerować spójnego pelikana z użyciem skwantyzowanego modelu o rozmiarze około 17 GB. Qwen 3.8 Flash-Next łączy dużą całkowitą pojemność architektury MoE ze znacznie mniejszą aktywną mocą obliczeniową. DeepSeek V4 Flash potrafi naprawić nieudany wynik wizualny po włączeniu dodatkowego rozumowania. GLM-5.3-Flash może działać w pętli agenta programistycznego wyposażonego w przeglądarkę i tworzyć zaawansowany animowany artefakt.
Nie oznacza to, że pod każdym względem dorównały GPT-6 Astra lub Claude Fable 5.1.
Oznacza to, że różnica staje się zależna od rodzaju zadania.
W przypadku najtrudniejszych problemów związanych z rozumowaniem czołowe modele chmurowe nadal mogą mieć wyraźną przewagę.
W przypadku ustrukturyzowanego generowania, programowania, prywatnych przepływów pracy i coraz bardziej zaawansowanych lokalnych agentów pytanie staje się mniej oczywiste.
Test Pelikana przypadkowo unaocznia ten sam trend zachodzący w lokalnej AI: granica możliwości wciąż się przesuwa, ale poziom możliwości dostępny poza nią przesuwa się niemal równie szybko.
Czego powinniśmy się nauczyć od pelikanów?
Najwyraźniejszym wnioskiem nie jest to, że jedna AI wreszcie nauczyła się, jak pelikan powinien jeździć na rowerze.
Chodzi o to, że jakość bazowa artefaktów wizualnych generowanych za pomocą kodu szybko rośnie, a różnice między modelami stają się coraz subtelniejsze.
GPT-6 Astra pokazuje, że wysokiej jakości, ustrukturyzowane generowanie wizualne może być teraz dostępne nawet przy niskim poziomie rozumowania. Claude Fable 5.1 demonstruje, ile dodatkowych zasobów obliczeniowych można przeznaczyć na naprawę geometrii. Gemini 3.8 Flash pokazuje, jak silna kompozycja estetyczna może wpływać na ludzką ocenę. Qwen 3.8 27B pokazuje, co jest możliwe dzięki kompaktowemu wdrożeniu lokalnemu. Kimi K3 ujawnia ukryty koszt intensywnego rozumowania, podczas gdy DeepSeek pokazuje, jak niestabilne mogą pozostać poszczególne generacje wizualne.
GLM-5.3-Flash dodaje ostatni element układanki: gdy model otrzymuje narzędzia przeglądarkowe, informacje zwrotne w formie wizualnej i możliwość iteracji, benchmark zaczyna mierzyć system AI, a nie odizolowany model.
To sprawia, że test Pelikana na rowerze jest mniej przydatny jako ranking, a bardziej jako mikroskop.
Ujawnia różnicę między:
- model, który potrafi pisać poprawny kod SVG,
- model, który potrafi zachowywać relacje przestrzenne,
- model, który może przeznaczyć więcej mocy obliczeniowej na rozumowanie, aby naprawiać błędy,
- model lokalny, który potrafi zbliżyć się do wyników wyglądających jak rezultaty modeli czołowych,
- oraz system agenta, który potrafi sprawdzać i ulepszać własny artefakt.
GPT-6 Astra może obecnie tworzyć jednego z najlepszych pelikanów, ale ważniejsze jest to, że Claude, Gemini, Qwen, DeepSeek, Kimi i GLM ponoszą porażki — i odnoszą sukcesy — na coraz bardziej wyrafinowane sposoby.
Ptak wciąż jest absurdalny. Benchmark jest niedoskonały. Jednak jako wizualny obraz tego, jak szybko zmienia się zachowanie modeli, test Pelikana na rowerze pozostaje zaskakująco wymowny.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego Immich ponownie przetwarza istniejące dane po aktualizacji?
Immich może ponownie przetwarzać zasoby, gdy aktualizacja unieważni wcześniejsze wersje pochodne, metadane, modele lub stan zadań; powtarzająca się, niekończąca praca to osobna usterka.

Które zależności najczęściej wyznaczają rzeczywistą granicę wydajności Immich?
Immich jest ograniczony przez najwolniejszą zależność na każdej mierzonej ścieżce, dlatego przesyłanie, wyszukiwanie, przeglądanie i odtwarzanie mogą mieć różne limity.

Sieciowanie Immich: jak wykrywanie, DNS i routing zapewniają dostępność
Immich jest dostępny tylko wtedy, gdy wybór punktu końcowego, DNS, routing, NAT lub obsługa serwera proxy, TLS oraz odpowiedź aplikacji tworzą jedną prawidłową ścieżkę.

