GPT-6 Astra contre Claude, Gemini, Qwen et DeepSeek : qui remporte le test du vélo-pélican ?

Lauren Pan est le fondateur de ZimaSpace et le architecte derrière la célèbre série ZimaBoard. Alliant design industriel et ingénierie embarquée, Lauren a lancé ZimaSpace avec une mission claire : démocratiser l'informatique en nuage personnelle. Il croit que le matériel doit être à la fois "hackable" et esthétique—réduisant le fossé entre les serveurs industriels et les gadgets grand public. Aujourd'hui, il dirige l'équipe d'ingénierie qui crée des outils offrant aux créateurs un contrôle total sur leur vie numérique.

GPT-6 Astra produit l’un des pélicans les plus convaincants à ce jour, mais le test du vélo-pélican devient plus intéressant lorsqu’on le compare à Claude Fable 5.1, Gemini 3.8 Flash, Qwen 3.8, DeepSeek V4, Kimi K3 et GLM-5.3-Flash. Une demande d’une seule ligne visant à générer un SVG d’un pélican à vélo oblige un modèle de langage à traduire des mots en code, en géométrie, en anatomie, en relations entre les objets et en une scène dont les erreurs sont immédiatement visibles.

Les derniers résultats montrent qu’il n’y a pas de vainqueur évident. GPT-6 Astra relève le niveau de qualité minimal, Claude peut consacrer beaucoup plus de raisonnement à la réparation de la géométrie, Gemini apporte une finition visuelle exceptionnelle, Qwen montre à quel point les modèles locaux peuvent s’en approcher, et DeepSeek démontre à quel point les paramètres de raisonnement peuvent modifier la sortie d’un même modèle. Les animations de GLM et de DeepSeek assistées par des outils révèlent encore autre chose : dès qu’un agent peut inspecter et améliorer lui-même son artefact, le test ne mesure plus uniquement le modèle.

Résultats du test du vélo-pélican en un coup d’œil

Modèle Type de test Points marquants Principale réserve
GPT-6 Astra SVG standard, de Low à Max Très bonne base ; Low surpassait déjà visuellement la famille GPT-5.6 précédente En dessous de Max, le placement des jambes autour du cadre du vélo restait incohérent
Claude Fable 5.1 SVG standard + passe d’animation distincte Max a produit une composition très réfléchie, avec une interaction forte entre le cavalier et le vélo Max a pris près de 14 minutes et a coûté beaucoup plus cher que Low
Gemini 3.8 Flash SVG standard, de faible à élevé Finition visuelle et cohérence décorative exceptionnelles L’effet visuel n’est pas synonyme de correction physique
Qwen 3.8 27B SVG standard local L’un des pélicans les plus réussis générés par un modèle local d’environ 17 Go Le raisonnement xhigh par défaut a consommé plus de 22 000 jetons de raisonnement
Qwen 3.8 Flash-Next SVG standard local Scène réussie produite par un MoE de 125 milliards de paramètres, dont environ 6 milliards de paramètres actifs Le résultat local dépend fortement de la quantification et du matériel disponible
Qwen 3.8 Max SVG standard / modèle plus grand Interaction nette entre le cavalier et le vélo, et composition soignée Modèle beaucoup plus grand, donc comparaison injuste avec du matériel local
Kimi K3 SVG standard Résultat cohérent à partir d’une invite extrêmement courte A utilisé plus de 13 000 jetons de raisonnement
DeepSeek V4 Pro 0813 SVG standard, de faible à élevé Les niveaux de raisonnement ont produit des stratégies visuelles radicalement différentes Une forte variance fait d’une seule capture d’écran un mauvais résumé du modèle
DeepSeek V4 Flash 0731 SVG standard Un raisonnement élevé a réparé un vélo par défaut gravement défectueux L’amélioration du raisonnement a été spectaculaire, mais pas garantie
GLM-5.3-Flash HTML/SVG animé avec assistance d’agent Animation riche, pédales, contrôles de scène et travail visuel itératif Chrome MCP et un environnement d’agent rendent la comparaison impossible avec des tests en une seule passe

Il ne s’agit pas d’un classement scientifique. Les exécutions publiques ont été réalisées à des moments différents, avec des API, des paramètres de raisonnement, des quantifications et, dans certains cas, des environnements d’outils différents.

La comparaison la plus défendable est comportementale. Le vélo possède-t-il un cadre cohérent ? Les pattes atteignent-elles les pédales ? L’oiseau interagit-il réellement avec le guidon ? Un raisonnement supplémentaire corrige-t-il ces relations ou ajoute-t-il simplement davantage de décoration ?

Que mesure réellement le test du vélo et du pélican ?

L’invite originale est délibérément minimale :

Générez un SVG représentant un pélican à vélo.

Produire une réponse convaincante nécessite la mise en œuvre simultanée de plusieurs capacités. Le modèle doit écrire un SVG valide, construire un vélo reconnaissable, reproduire approximativement l’anatomie d’un pélican, placer l’oiseau dans la bonne partie de la scène et faire interagir des objets distincts de manière visuellement plausible.

Cela rend le test utile pour observer :

  • la génération de code SVG et frontend,
  • la géométrie des objets,
  • la composition spatiale,
  • la cohérence anatomique,
  • l’interaction entre les objets,
  • le respect des instructions,
  • et l’efficacité de l’effort de raisonnement.

Il ne mesure pas directement l’exactitude factuelle, le raisonnement scientifique, le codage à l’échelle d’un dépôt, la fiabilité des agents, les connaissances professionnelles ou l’intelligence générale.

Simon Willison, qui a utilisé à plusieurs reprises cette invite avec différentes générations de modèles, est lui aussi devenu plus prudent à son sujet. Il la considère désormais principalement comme un test comportemental rapide et un moyen utile de comparer les versions au sein d’une même famille de modèles, plutôt que comme une mesure universelle de l’intelligence.

Son analyse du pélican de Kimi K3 met explicitement en garde contre l’utilisation de sorties individuelles du test du pélican comme classement sérieux des modèles.

Cette limite est importante, car les modèles modernes sont désormais suffisamment performants pour que le goût visuel influence de plus en plus le résultat. Dès lors que chaque sortie contient un oiseau et un vélo reconnaissables, un magnifique coucher de soleil ou un panier à poissons peut donner l’impression qu’une image est plus intelligente, même si un autre modèle respecte mieux la géométrie.

Comment GPT-6 Astra s’est-il comporté lors du test du vélo et du pélican ?

Le résultat le plus important de GPT-6 Astra n’est pas simplement que le mode Max est impressionnant. C’est que le mode Low produit déjà un pélican bien plus réussi que l’ancienne famille GPT-5.6.

Résultats du test du vélo et du pélican avec GPT-6 Astra et GPT-5.6 Pelican à plusieurs niveaux de raisonnement
GPT-6 Astra comparé à GPT-5.6 Sol, Terra et Luna à plusieurs niveaux de raisonnement. Source : Comparaison d’Astra par Simon Willison.

Willison a testé Astra avec les niveaux de raisonnement Low, Medium, High, XHigh et Max. Le nombre de jetons de sortie enregistré est passé de 1 906 en Low à 12 638 en Max.

Raisonnement d’Astra Jetons de sortie Temps
Faible 1,906 $0.0955
Moyen 2,560 $0.1282
Élevé 3,671 $0.1837
~0,13 $ 6,766 $0.3385
Max 12,638 $0.6321

L’observation la plus marquante de Willison est qu’Astra en mode Low était plus réussi que n’importe quel Sol Pelican avec GPT-5.6 qu’il avait généré, quel que soit le niveau de raisonnement. Cela signifie que le sujet relève moins du raisonnement Max que d’une amélioration générationnelle des capacités de base en codage visuel.

The bicycle becomes more coherent, the pelican becomes recognizably integrated with the vehicle, and the whole scene requires less interpretation from the viewer.

Le vélo devient plus cohérent, le pélican s’intègre de manière reconnaissable au véhicule et l’ensemble de la scène demande moins d’interprétation de la part du spectateur.

Mais la tâche n’est toujours pas parfaitement résolue. Sous Max, Astra n’a pas positionné de manière fiable les deux pattes de part et d’autre du cadre du vélo.

C’est précisément pour cela que ce benchmark absurde reste utile. Un résultat soigné peut donner une impression immédiate de compétence, tandis qu’une petite relation, comme le placement des pattes, révèle si la scène est cohérente sur le plan structurel.

Astra semble mieux comprendre la composition, mais le test du pélican ne permet pas d’établir qu’il conserve un modèle physique humain de la conduite à vélo.

GPT-6 Astra est également apparu dans la démonstration destinée aux développeurs d’OpenAI

La présentation destinée aux développeurs de GPT-6 Astra d’OpenAI contient une autre référence au pélican, tout en montrant une génération visuelle et 3D plus riche. Il ne s’agit pas du même test SVG contrôlé ; cet exemple doit donc être considéré comme un élément de preuve supplémentaire plutôt que comme faisant partie de la comparaison.

Exemple visuel supplémentaire de GPT-6 Astra tiré de la présentation destinée aux développeurs d’OpenAI. Il ne doit pas être comparé directement à la grille SVG contrôlée.

Claude Fable 5.1 : réfléchir davantage produit-il un meilleur pélican ?

Claude Fable 5.1 montre qu’un raisonnement supplémentaire peut améliorer les relations géométriques, mais aussi à quelle vitesse le coût d’une tâche visuelle simple peut exploser.
Résultat du test du pélican à vélo Max de Claude Fable 5.1 Résultat Max de Claude Fable 5.1. Source :.

Test de Fable 5.1 de Simon Willison

Low et Medium ont terminé en environ 23 secondes et ont coûté environ dix centimes chacun. High a pris environ 29,6 secondes.

Puis la courbe a changé radicalement. Raisonnement Temps
Faible Coût enregistré 23 secondes
Moyen 23,8 secondes 23 secondes
Élevé ~0,10 $ 29,6 secondes
~0,13 $ 7 minutes 51 secondes $1.83
Max 13 minutes 54 secondes $3.30

Le résultat de Max améliore effectivement des détails importants. Les deux pattes sont visiblement placées de part et d’autre du cadre du vélo, les pieds atteignent les pédales, une aile atteint le guidon et la géométrie du vélo fait l’objet d’une attention bien plus délibérée.

La trace de raisonnement est particulièrement révélatrice, car Fable a activement réévalué certains éléments du dessin. Il a repéré des problèmes dans la géométrie de la fourche avant, repensé le placement du casque autour du bec et vérifié à plusieurs reprises si les éléments décoratifs entreraient en collision avec le reste de la scène.

Cela nous donne un lien visuel rare entre un raisonnement plus approfondi et un artefact plus cohérent sur le plan interne.

Mais la différence de coût est énorme.

La question pertinente n’est pas de savoir si Max est meilleur. C’est de savoir si un pélican de près de 14 minutes est suffisamment utile pour justifier un coût plus de 30 fois supérieur à celui de Low.

Le pélican de Claude a ensuite été animé en seconde passe

L’animation publique n’a pas été créée par le prompt Pelican original. Willison a repris le SVG de Max et l’a renvoyé à Fable 5.1 avec une instruction distincte pour animer l’artefact existant.

Cette seconde passe a utilisé 6 121 jetons d’entrée et 26 201 jetons de sortie, et a ajouté un autre coût enregistré d’environ 1,37 $.

Comme l’animation constituait une deuxième tâche, elle ne devrait pas être classée directement face aux résultats statiques obtenus en une seule passe par les autres modèles. Elle reste néanmoins utile pour montrer ce qui se passe lorsque le modèle doit préserver la géométrie tout en introduisant du mouvement.

Regardez le pélican animé original de Claude Fable 5.1.

Gemini 3.8 Flash : le style visuel est-il synonyme d’une meilleure compréhension ?

Gemini 3.8 Flash se distingue pour une autre raison : il donne au benchmark l’apparence d’un travail d’illustration plutôt que d’un exercice de géométrie.

Test Pelican Bicycle de Gemini 3.8 Flash avec un raisonnement High, au bord de la mer
Gemini 3.8 Flash avec un raisonnement High. Source : Test de Gemini réalisé par Simon Willison en septembre 2026.

Le résultat High comprend un vélo de ville bleu sarcelle, une écharpe rouge à pois, un panier à poissons, une promenade en bord de mer et un arrière-plan côtier lumineux.

Le résultat est immédiatement séduisant.

Gemini constitue ainsi un bon exemple d’un problème propre aux benchmarks visuels : les humains récompensent naturellement le style.

Une composition plus soignée peut sembler plus intelligente avant que nous vérifiions si le cadre du vélo se ferme correctement, si le pied atteint réellement la pédale ou si le corps du pélican est positionné de manière cohérente par rapport à la selle.

La finition visuelle est une véritable capacité, mais la finition visuelle et la cohérence physique sont deux capacités différentes.

À mesure que les modèles progressent, le Pelican Test mesure de plus en plus ces deux aspects. Les classements simples des gagnants sont donc moins pertinents que l’examen des façons précises dont chaque modèle réussit ou échoue.

Qwen 3.8 27B : un modèle local de 17 Go peut-il rivaliser avec les pélicans de pointe ?

Qwen 3.8 27B pourrait être le résultat le plus important pour les utilisateurs d’IA locale, car il ne s’agissait pas d’un immense modèle exclusivement disponible dans le cloud.

Willison a exécuté localement, via LM Studio, une version quantifiée Q4_K_M d’environ 17 Go, notamment lors d’expériences sur du matériel local doté d’une grande quantité de mémoire.

SVG localement généré par Qwen 3.8 27B représentant un pélican à vélo avec un raisonnement xhigh
Qwen 3.8 27B exécuté localement avec un raisonnement xhigh. Source : Test local de Qwen 3.8 27B par Simon Willison.

Le résultat est exceptionnellement cohérent pour un modèle pouvant être conditionné dans un fichier quantifié d’environ 17 Go.

Le vélo a la forme de cadre attendue. Les deux pattes apparaissent de part et d’autre du vélo, une relation étonnamment difficile à obtenir pour de nombreux modèles. Le pélican a une poche bien visible, son aile atteint le guidon et les lignes de mouvement sont placées derrière plutôt que de traverser la scène.

Willison l’a décrit comme le meilleur SVG de pélican qu’il avait généré localement jusque-là.

Mais il y a un piège majeur.

Qwen 3.8 27B a énormément réfléchi à la tâche.

À son niveau de raisonnement xhigh par défaut, le modèle a pris environ 21 minutes. Il a utilisé 22 276 jetons de raisonnement avant de produire 3 223 jetons de sortie finale.

Lorsque le raisonnement a été désactivé, la génération est passée à un peu plus de deux minutes, mais la sortie est devenue sensiblement moins bonne.

Résultat de Qwen 3.8 27B Pelican Bicycle avec le raisonnement désactivé
Même invite pour Qwen 3.8 27B avec le raisonnement désactivé. La géométrie du vélo et l’interaction avec le cycliste se sont fortement dégradées.

Le cadrage est devenu moins bon, les pieds ont manqué les pédales et le modèle n’a plus vraiment tenté de relier l’aile au guidon.

Cela crée une histoire presque opposée à celle de GPT-6 Astra.

La caractéristique la plus impressionnante d’Astra est que le niveau Low est déjà performant. Qwen 3.8 27B montre quelle qualité visuelle il est possible d’extraire d’un matériel local relativement compact si le modèle est autorisé à consacrer beaucoup de temps au raisonnement.

Ce n’est pas la preuve qu’un modèle de 17 Go a rattrapé GPT-6 dans son ensemble. C’est la preuve que « suffisamment petit pour fonctionner localement » et « capable de produire une sortie structurée sophistiquée » ne sont plus mutuellement exclusifs.

Qwen 3.8 Flash-Next : que peut dessiner un modèle MoE avec 6 milliards de paramètres actifs ?

Qwen 3.8 Flash-Next fournit un deuxième point de données sur l’IA locale, issu d’une architecture très différente.

Le modèle possède au total 125 milliards de paramètres, mais en active environ 6 milliards pour chaque jeton. Cette distinction peut réduire les besoins en calcul, même si l’ensemble complet des poids reste bien supérieur à 6 milliards.

SVG de Qwen 3.8 Flash-Next montrant un pélican faisant du vélo dans un paysage
Qwen 3.8 Flash-Next utilisant une version UD-Q2_K_XL quantifiée sur DGX Spark. Source : Tests de Qwen 3.8 Flash-Next par Simon Willison.

Le résultat xhigh présente une scène soignée. Le pélican est perché au-dessus d’un vélo rouge, un poisson occupe le panier avant et le vélo lui-même conserve une structure reconnaissable au lieu de s’effondrer en arcs et tubes disjoints.

Ce qui rend ce résultat intéressant, ce n’est pas de savoir s’il est plus esthétique que Gemini ou Astra.

Les modèles MoE clairsemés rendent les comparaisons simples fondées sur le nombre de paramètres moins pertinentes.

Un modèle de 125 milliards de paramètres, dont environ 6 milliards sont actifs, ne se comporte pas comme un modèle dense classique de 6 milliards de paramètres et n’a pas non plus les mêmes caractéristiques en matière de stockage et de mémoire.

Le Pélican illustre l’aspect lié aux capacités de cette équation : une quantité relativement faible de calcul actif peut tout de même coordonner une scène structurée étonnamment sophistiquée.

Qwen 3.8 Max : qu’est-ce qui change lorsque le modèle devient beaucoup plus grand ?

Qwen 3.8 Max fournit une comparaison utile dans le haut de gamme au sein de la même grande famille de modèles.

Résultat du test Qwen 3.8 Max Pelican Bicycle
Résultat de Qwen 3.8 Max Pelican. Source : Exemple de Qwen 3.8 Max par Simon Willison.

Le résultat est propre et facile à analyser. Les pattes atteignent la zone des pédales, le vélo a une forme conventionnelle et la scène globale reste suffisamment simple pour que la géométrie demeure lisible.

Mais Qwen Max renforce une autre leçon de ce test :

Un modèle plus grand ne devrait pas automatiquement obtenir une meilleure note simplement parce qu’il est plus grand.

Pour l’IA locale pratique, Qwen 3.8 27B est peut-être en réalité le Pélican le plus intéressant, car il nous renseigne sur ce qui peut fonctionner sur un matériel qu’un utilisateur avancé pourrait raisonnablement posséder chez lui.

Max illustre un plafond de performance du modèle. Le résultat local avec 27B illustre les progrès du déploiement.

Kimi K3 : de quelle quantité de raisonnement un seul Pélican a-t-il besoin ?

Kimi K3 a produit un autre Pélican cohérent, mais l’utilisation de ses ressources de calcul cachées est peut-être plus intéressante que l’image.

Résultat du test de la bicyclette avec pélican de Kimi K3, montrant un pélican chevauchant une bicyclette rouge
Résultat de Kimi K3 avec le prompt standard du Pélican. Source : Test de Kimi K3 par Simon Willison.

Le prompt ne comportait que quelques mots, mais l’exécution enregistrée a utilisé 95 jetons d’entrée et 16 658 jetons de sortie.

Parmi ces jetons de sortie, 13 241 étaient des jetons de raisonnement.

Le coût enregistré était d’environ 0,25 $ pour cette exécution.

La scène finale est convaincante : une bicyclette reconnaissable, un pélican reconnaissable, une position raisonnable du cycliste, des détails d’arrière-plan, une route et des éléments suggérant le mouvement.

Mais les chiffres révèlent quelque chose que l’image ne montre pas.

Un résultat visuellement simple peut dissimuler une quantité considérable de travail effectué par le modèle.

Cela compte pour les applications réelles. Un modèle peut sembler peu coûteux lorsqu’il est évalué sur la base d’un seul résultat réussi, mais devenir coûteux ou lent lorsque le même schéma de raisonnement est répété des centaines de fois dans un flux de travail agentique.

Pour Kimi, le Pélican devient presque autant un test d’efficacité du raisonnement qu’un test de dessin.

DeepSeek V4 Pro : pourquoi les différents niveaux de raisonnement ressemblent-ils à des modèles différents ?

DeepSeek V4 Pro 0813 a produit l’une des comparaisons de raisonnement les plus étranges de l’archive.

Les niveaux Faible, Moyen et Élevé ne ressemblaient pas simplement à des versions de plus en plus soignées d’un même design. Ils semblaient suivre des stratégies visuelles différentes.

Test de la bicyclette avec pélican de DeepSeek V4 Pro et un raisonnement Faible
Faible
Test de la bicyclette avec pélican de DeepSeek V4 Pro et un raisonnement Moyen
Moyen
Test de la bicyclette avec pélican de DeepSeek V4 Pro et un raisonnement Élevé
Élevé

DeepSeek V4 Pro 0813 avec un raisonnement Faible, Moyen et Élevé. Source : Test de DeepSeek V4 Pro par Simon Willison.

Le niveau Faible est relativement épuré et minimaliste. Le niveau Moyen devient nettement plus abstrait : des arcs de roue brisés, un tracé lâche et une étrange forme allongée dominent la composition. Le niveau Élevé change à nouveau de direction, revenant à une bicyclette rouge plus conventionnelle et ajoutant un panier, un fanion et des notes de musique.

La leçon n’est pas simplement : « Élevé est meilleur. »

L’effort de raisonnement semble influencer la stratégie visuelle choisie par le modèle, et pas seulement la minutie avec laquelle il exécute une composition fixe.

Cela fait de DeepSeek V4 Pro un excellent rappel : une seule capture d’écran est une base très fragile pour affirmer qu’un modèle est bon ou mauvais en codage visuel.

La variance de l’échantillonnage compte. Les paramètres de raisonnement comptent. L’API ou le banc de test peuvent aussi compter. Le Pélican rend ces différences visibles, car nous pouvons inspecter immédiatement le résultat.

DeepSeek V4 Flash : Plus de raisonnement peut-il réparer une bicyclette cassée ?

DeepSeek V4 Flash 0731 offre un exemple encore plus clair de l’influence du raisonnement sur la géométrie.

L’exécution par défaut a produit un vélo gravement déformé. Les roues apparaissaient sous forme d’arcs incomplets, les tubes du cadre flottaient sans se rejoindre et le pélican planait au-dessus de la scène au lieu de donner l’impression convaincante de rouler.

Résultat de DeepSeek V4 Flash avec raisonnement par défaut : pélican à vélo et géométrie malformée
DeepSeek V4 Flash 0731 avec son niveau de raisonnement par défaut.

Willison a ensuite augmenté l’intensité du raisonnement à High en conservant la même tâche de base.

Le résultat a radicalement changé.

Résultat de DeepSeek V4 Flash avec raisonnement élevé : pélican à vélo et géométrie cohérente
DeepSeek V4 Flash 0731 avec un niveau de raisonnement élevé. Source : Test du raisonnement de DeepSeek V4 Flash par Simon Willison.

La sortie High comporte des roues complètes, un cadre reconnaissable, une zone de pédalier, un pélican agrippé au guidon et une patte positionnée près de la pédale.

Cela ne prouve pas qu’un raisonnement plus approfondi améliore toujours la génération visuelle.

Cela laisse penser que certains mauvais résultats SVG sont des échecs de coordination plutôt que la preuve que le modèle ne possède aucune représentation de la géométrie d’un vélo.

Les éléments existent peut-être déjà à l’intérieur du modèle ; un raisonnement supplémentaire peut parfois aider à les assembler correctement.

Pourquoi DeepSeek V4 Flash a déjà surpassé V4 Pro avec le même prompt de pélican

Une comparaison antérieure de DeepSeek V4 avait produit un autre résultat contre-intuitif.

Résultat de DeepSeek V4 Flash : vélo avec pélican et géométrie cohérente
DeepSeek V4 Flash
Résultat de DeepSeek V4 Pro : vélo avec pélican à l’anatomie inhabituelle
DeepSeek V4 Pro

Source : La comparaison de DeepSeek V4 par Simon Willison.

La version Flash a produit un excellent vélo selon les critères du Pelican-Test : un cadre reconnaissable, une chaîne visible, un réflecteur, des ailes atteignant le guidon et des pattes posées sur les pédales.

Le modèle Pro a conservé un vélo raisonnable, mais a généré un pélican bien plus étrange, au corps surdimensionné et à l’anatomie incohérente.

Il ne faut pas y voir la preuve que Flash est généralement plus intelligent que Pro.

Cela démontre quelque chose de plus précis et de plus utile :

La taille du modèle et sa réputation dans les benchmarks ne garantissent pas le meilleur résultat pour un prompt de programmation visuelle stochastique.

GLM-5.3-Flash contre DeepSeek V4 Flash : que se passe-t-il lorsque les modèles disposent d’outils ?

GLM-5.3-Flash propose un autre type d’expérience Pelican.

Une comparaison réalisée par la communauté a utilisé un environnement d’agent plutôt que le simple test en une ligne. GLM-5.3-Flash et une configuration expérimentale de DeepSeek V4 Flash Vision ont tous deux été exécutés avec OpenCode, Trellis, Chrome MCP et le raisonnement maximal.

L’instruction demandait aux modèles de créer une page HTML complète contenant une animation SVG en 2D et leur indiquait explicitement de traiter la tâche comme une compétition.

Cela change ce qui est mesuré.

Le modèle ne se contente plus de produire un seul SVG à partir d’un seul prompt. Il peut prendre davantage de temps, utiliser des outils, inspecter un environnement de navigateur et se comporter davantage comme un agent de programmation.

Pélican animé par GLM-5.3-Flash

Animation GLM-5.3-Flash produite avec OpenCode, Trellis, Chrome MCP et un raisonnement maximal. Source : comparaison communautaire d’origine.

Le résultat de GLM est nettement plus ambitieux que les pélicans statiques ci-dessus. Il contient une scène complète, des composants de vélo explicites, du mouvement, des pédales et une présentation plus riche à l’échelle de la page.

Les commentateurs de la communauté ont généralement préféré le résultat de GLM, plusieurs soulignant le travail plus abouti sur les pédales et l’animation.

Des erreurs restent visibles. Certains mouvements des pieds semblent mécaniquement peu naturels, et l’ajout d’animations multiplie les occasions de rupture des relations entre les éléments.

Cela crée une distinction utile :

Un résultat plus riche en fonctionnalités n’est pas automatiquement un résultat plus correct sur le plan physique.

Pélican animé avec DeepSeek V4 Flash Vision

Expérience de vision de DeepSeek V4 Flash générée dans le même environnement assisté par des outils. Source : méthodologie et discussion du test communautaire.

La version de DeepSeek adopte une approche différente, avec une composition au coucher du soleil et une présentation responsive plus épurée.

Les retours de la communauté ont généralement privilégié l’exhaustivité mécanique de GLM, tout en reconnaissant à DeepSeek le mérite de sa composition visuelle et de sa présentation mobile.

Plus important encore, les deux résultats montrent à quelle vitesse la signification d’un benchmark d’IA évolue dès que des outils sont introduits.

Le système évalué est désormais :

  • le modèle de base,
  • configuration du raisonnement,
  • banc de test de l’agent,
  • outils de navigation,
  • retour visuel,
  • temps d’exécution,
  • et stratégie d’itération.

Résumer le résultat par « GLM contre DeepSeek » masque une grande partie de ce qui a réellement permis de produire cet artefact.

Pourquoi les pélicans générés en une fois et les animations assistées par un agent ne devraient pas figurer dans un même classement

Cette distinction est suffisamment importante pour être explicitée.

Test Ce que cela mesure principalement
Invite SVG sur une seule ligne Raisonnement du modèle, génération de SVG et coordination spatiale en une seule réponse
Effort de raisonnement accru La question de savoir si des inférences supplémentaires permettent de corriger la géométrie et les relations
Animation au deuxième passage La capacité d’un modèle à préserver une composition existante tout en y introduisant du mouvement
Agent + Chrome MCP Modèle, banc de test, outils, boucle de rétroaction et codage itératif réunis

Une animation assistée par un agent est sans doute plus pertinente pour les flux de développement modernes qu’un SVG généré en une seule fois.

Mais c’est un test différent.

Si GPT-6 Astra reçoit une réponse tandis que GLM dispose de vingt minutes, d’un navigateur et d’un retour visuel, nous ne pouvons pas affirmer raisonnablement que l’animation finale prouve que GLM est meilleur lors du benchmark d’origine.

Ce que cela prouve, c’est que les modèles deviennent nettement plus performants lorsqu’ils sont intégrés à des systèmes capables d’inspecter, d’exécuter et de réviser leur propre travail.

Quel modèle d’IA a réellement remporté le test du pélican à vélo ?

Il n’existe pas de vainqueur unique scientifiquement défendable, mais les résultats actuels révèlent effectivement plusieurs modèles qui se démarquent dans différentes catégories.

Catégorie Point fort Pourquoi
Amélioration de référence la plus marquée GPT-6 Astra Un raisonnement faible produit déjà une amélioration majeure par rapport à la famille GPT-5.6
Géométrie haute définition la plus réfléchie Claude Fable 5.1 Max Le raisonnement explicite a corrigé les relations entre le cycliste, la fourche et les objets
Style visuel le plus affirmé Gemini 3.8 Flash Transforme l’invite minimale en une illustration très travaillée
Résultat local le plus impressionnant Qwen 3.8 27B Un modèle local quantifié d’environ 17 Go produit une géométrie exceptionnellement cohérente
Résultat de MoE parcimonieux le plus intéressant Qwen 3.8 Flash-Next Composition remarquable malgré environ 6 milliards de paramètres actifs par jeton
Cas de raisonnement le plus extrême Kimi K3 Plus de 13 000 jetons de raisonnement pour une invite minuscule
Meilleur exemple de réparation par le raisonnement DeepSeek V4 Flash Un raisonnement élevé améliore considérablement un vélo défectueux par défaut
Plus grande variabilité des résultats DeepSeek V4 Pro Les niveaux Faible, Moyen et Élevé produisent des stratégies visuelles radicalement différentes
Animation assistée par outils la plus ambitieuse GLM-5.3-Flash Produit un artefact HTML animé plus riche lorsqu’il dispose d’un environnement d’agent et d’outils de navigateur

Si la question est simplement de savoir quel modèle actuel produit le meilleur Pelican en une seule passe avec un raisonnement minimal, GPT-6 Astra est difficile à ignorer.

Si la question est de savoir quel résultat est le plus surprenant pour un matériel pouvant réellement tenir sur un bureau et fonctionner localement, Qwen 3.8 27B devient bien plus important.

Si le test évolue de la génération en une seule passe vers un flux de travail d’agent de codage doté d’outils et de capacités d’itération, GLM-5.3-Flash montre à quel point le plafond peut être différent.

Ce sont trois questions différentes, et c’est précisément pourquoi un unique vainqueur numérique dissimulerait davantage de choses qu’il n’en expliquerait.

Ces modèles d’IA comprennent-ils réellement ce qu’ils dessinent ?

Le Pelican Bicycle Test ne peut pas prouver une véritable compréhension physique.

Un modèle peut générer un vélo d’apparence correcte parce que son entraînement lui a fourni de puissantes représentations des vélos, des oiseaux, du code SVG et des compositions visuelles courantes.

La coordination réussie de ces représentations constitue une preuve de compétence spatiale utile.

Cela ne prouve pas que le modèle comprend l’équilibre, la gravité, les contraintes mécaniques, le mouvement des pédales ou la locomotion de la même manière qu’un humain.

Les échecs persistants le montrent particulièrement clairement.

Astra peut créer un vélo attrayant tout en positionnant incorrectement les deux jambes autour du cadre. Les roues animées de Claude peuvent révéler des problèmes de mouvement invisibles dans le SVG statique. Qwen peut consacrer 22 000 jetons de raisonnement à la construction d’une scène qu’un autre modèle produit bien plus rapidement. DeepSeek peut produire un vélo défectueux à un niveau de raisonnement et un vélo cohérent à un autre.

Ces modèles deviennent excellents pour construire des structures visuelles à partir du langage.

La question de savoir si cela doit être décrit comme une « compréhension » dépend du niveau de représentation interne que nous exigeons du terme.

Pourquoi les modèles ouverts chinois constituent la partie la plus intéressante de ce test

Le changement le plus important depuis les versions précédentes du Pelican Test n’est peut-être pas que GPT-6 produise un meilleur oiseau.

C’est que les modèles ouverts et déployables localement produisent désormais des résultats qui auraient semblé relever des modèles de pointe il y a encore peu de temps.

Qwen 3.8 27B peut générer localement un pélican cohérent à partir d’un modèle quantifié d’environ 17 Go. Qwen 3.8 Flash-Next combine une grande capacité totale de type MoE avec un calcul actif bien moindre. DeepSeek V4 Flash peut se remettre d’un résultat visuel défectueux lorsqu’un raisonnement supplémentaire est activé. GLM-5.3-Flash peut fonctionner dans une boucle d’agent de codage équipée d’un navigateur et produire un artefact animé sophistiqué.

Cela ne signifie nullement qu’ils ont universellement rattrapé GPT-6 Astra ou Claude Fable 5.1.

Cela signifie que l’écart dépend de plus en plus de la charge de travail.

Pour les problèmes de raisonnement les plus difficiles, les modèles cloud de pointe peuvent encore disposer d’un avantage net.

Pour la génération structurée, le codage, les flux de travail privés et les agents locaux toujours plus sophistiqués, la question devient moins évidente.

Le test du pélican visualise accidentellement la même tendance à l’œuvre dans l’IA locale : la frontière continue d’avancer, mais le niveau de capacité disponible en dehors de cette frontière progresse presque aussi vite.

Que devons-nous apprendre des pélicans ?

Le résultat le plus clair n’est pas qu’une IA a enfin appris comment un pélican devrait faire du vélo.

C’est que la qualité de base des artefacts visuels générés par du code progresse rapidement, tandis que les différences entre les modèles deviennent plus subtiles.

GPT-6 Astra montre qu’une génération visuelle structurée de qualité peut désormais apparaître même avec un niveau de raisonnement faible. Claude Fable 5.1 démontre la quantité de calcul supplémentaire pouvant être consacrée à la réparation de la géométrie. Gemini 3.8 Flash montre à quel point une composition esthétique réussie peut influencer le jugement humain. Qwen 3.8 27B montre ce qu’il est possible d’obtenir avec un déploiement local compact. Kimi K3 révèle le coût caché d’un raisonnement intensif, tandis que DeepSeek montre à quel point les générations visuelles individuelles peuvent rester instables.

GLM-5.3-Flash apporte la dernière pièce : dès qu’un modèle dispose d’outils de navigation, d’un retour visuel et de l’autorisation d’itérer, le benchmark commence à mesurer un système d’IA plutôt qu’un modèle isolé.

Cela rend le test du pélican à bicyclette moins utile comme classement que comme microscope.

Il met en évidence la différence entre :

  • un modèle capable d’écrire du SVG valide,
  • un modèle capable de maintenir les relations spatiales,
  • un modèle capable de consacrer davantage de raisonnement à la correction de ses erreurs,
  • un modèle local capable de s’approcher d’un résultat digne des modèles de pointe,
  • et un système agentique capable d’inspecter et d’améliorer son propre artefact.

GPT-6 Astra produit peut-être actuellement l’un des pélicans les plus réussis, mais l’histoire la plus importante est que Claude, Gemini, Qwen, DeepSeek, Kimi et GLM échouent désormais — et réussissent — de manière toujours plus sophistiquée.

L’oiseau reste ridicule. Le benchmark est imparfait. Mais en tant qu’instantané visuel de la rapidité avec laquelle le comportement des modèles évolue, le test du pélican à bicyclette demeure étonnamment révélateur.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.