GPT-6 Astra 対 Claude、Gemini、Qwen、DeepSeek:ペリカン自転車テストの勝者は?

ローレン・パンZimaSpaceの創設者です そして 高く評価されているZimaBoardシリーズの設計者です。産業デザインと組み込みエンジニアリングを融合させ、 Laurenは明確な使命を持ってZimaSpaceを立ち上げました:パーソナルクラウドコンピューティングを民主化することです 。彼はハードウェアは「ハック可能」であり美しくあるべきだと信じています—産業用サーバーと消費者向けガジェットのギャップを埋めること。現在、彼はエンジニアリングチームを率いて、クリエイターが デジタルライフを完全にコントロールできるツールを構築していますfull control over their digital lives.

GPT-6 Astraは、これまでで最も説得力のあるペリカンの一つを生み出しますが、Pelican Bicycle TestはClaude Fable 5.1、Gemini 3.8 Flash、Qwen 3.8、DeepSeek V4、Kimi K3、GLM-5.3-Flashと比較すると、さらに興味深いものになります。ペリカンが自転車に乗るSVGを生成するという1行のリクエストは、言語モデルに対して、言葉をコード、ジオメトリ、解剖学、オブジェクト間の関係、そして誤りがすぐに目に見えるシーンへと変換することを求めます。

最新の結果から、単純な勝者はいないことがわかります。GPT-6 Astraは品質の最低水準を引き上げ、Claudeは推論に大幅に多くの計算を割いてジオメトリを修復でき、Geminiは卓越したビジュアルの洗練を加え、Qwenはローカルモデルがどこまで迫れるかを示し、DeepSeekは推論設定によって同じモデルの出力がどれほど変わるかを実証しています。ツール支援型のGLMとDeepSeekによるアニメーションは、さらに異なる点を明らかにします。エージェントが自分の成果物を検査して反復改善できるようになると、テストはモデルだけを測定するものではなくなります。

ペリカン自転車テスト結果の概要

モデル テストの種類 際立っていた点 主な注意点
GPT-6 Astra 標準SVG、LowからMax 非常に強力なベースラインで、Lowでも以前のGPT-5.6ファミリーをビジュアル面ですでに上回りました Max未満では、自転車のフレーム周辺の脚の配置に依然として一貫性がありませんでした
Claude Fable 5.1 標準SVG+個別のアニメーション工程 Maxは、ライダーと自転車の相互作用が強く、非常に意図的に構成されたシーンを生成しました Maxは完了までに約14分かかり、Lowより大幅に高コストでした
Gemini 3.8 Flash 標準SVG、LowからHigh 卓越したビジュアルの洗練と装飾の一貫性 ビジュアルの華やかさは、物理的な正確さと同じではありません
Qwen 3.8 27B ローカル標準SVG およそ17GBのローカルモデルによって生成された、最も優れたペリカンの一つ デフォルトのxhigh推論では、22,000個を超える推論トークンを消費
Qwen 3.8 Flash-Next ローカル標準SVG アクティブなパラメータがおよそ6Bの125B MoEによる力強いシーン ローカルでの結果は、量子化と利用可能なハードウェアに大きく左右されます
Qwen 3.8 Max 標準SVG/より大きなモデル ライダーと自転車の相互作用が自然で、構図も洗練されています はるかに大きなモデルであるため、ローカルハードウェアとの比較としては公平ではありません
Kimi K3 標準SVG 極めて短いプロンプトから一貫性のある結果を生成 13,000個を超える推論トークンを使用
DeepSeek V4 Pro 0813 標準SVG、LowからHigh 推論レベルによって、ビジュアル戦略が根本的に異なりました ばらつきが大きいため、1枚のスクリーンショットではモデルの概要を適切に示せません
DeepSeek V4 Flash 0731 標準SVG 高い推論設定により、ひどく壊れていたデフォルトの自転車が修復されました 推論による改善は劇的でしたが、保証されたものではありません
GLM-5.3-Flash エージェント支援によるアニメーションHTML/SVG 豊かなアニメーション、ペダル、シーン制御、反復的なビジュアル作業 Chrome MCPとエージェント環境を使用しているため、ワンショットテストとは比較できません

これは科学的なリーダーボードではありません。公開実行は、異なる時間、異なるAPI、推論設定、量子化、そして場合によっては異なるツール環境で行われました。

より妥当な比較は、動作に基づくものです。自転車のフレームには一貫性があるか。足はペダルに届いているか。鳥は実際にハンドルバーと相互作用しているか。追加の推論によってこうした関係が修正されるのか、それとも単に装飾が増えるだけなのか。

Pelican Bicycle Testは実際に何を測定しているのか?

元のプロンプトは意図的に最小限です。

自転車に乗るペリカンのSVGを生成してください。

説得力のある回答を生成するには、複数の能力が同時に機能する必要があります。モデルは有効なSVGを書き、認識可能な自転車を構成し、ペリカンの解剖学的特徴を近似し、鳥をシーンの正しい位置に配置し、別々の物体を視覚的に自然な形で相互作用させなければなりません。

このテストは、次の点を観察するのに役立ちます。

  • SVGおよびフロントエンドコードの生成、
  • 物体の幾何学、
  • 空間構成、
  • 解剖学的な一貫性、
  • 物体同士の相互作用、
  • 指示への従属、
  • そして推論負荷の効率性。

これは、事実の正確性、科学的推論、リポジトリ規模のコーディング、エージェントの信頼性、専門知識、または一般知能を直接測定するものではありません

複数のモデル世代にわたってこのプロンプトを繰り返し使用してきたSimon Willisonも、これに対してより慎重になっています。現在は主に、手早い動作テストや、同じモデルファミリー内でリリースを比較する有用な方法として捉えており、普遍的な知能ベンチマークとは考えていません。

彼のKimi K3 Pelican分析では、個々のPelican出力を本格的なモデルランキングとして扱わないよう明確に警告しています。

この限界は重要です。現代のモデルは、視覚的なセンスが結果にますます影響するほど十分に優秀になっているからです。どの出力にも認識可能な鳥と自転車が含まれるようになると、美しい夕焼けや魚籠によって、別のモデルのほうが幾何学的には正確であっても、ある画像のほうが賢く感じられることがあります。

GPT-6 AstraはPelican Bicycle Testでどのような性能を示したのか?

GPT-6 Astraの最も重要な成果は、単にMaxの見栄えがよいということではありません。以前のGPT-5.6ファミリーよりもはるかに優れたPelicanを、Lowですでに生成できることです。

複数の推論レベルにおけるGPT-6 AstraとGPT-5.6 Pelican Bicycle Testの結果
複数の推論レベルにおけるGPT-6 AstraとGPT-5.6 Sol、Terra、Lunaの比較。出典: Simon WillisonによるAstraの比較.

WillisonはAstraをLow、Medium、High、XHigh、Maxの推論レベルでテストしました。記録された出力トークン数は、Lowの1,906からMaxの12,638へと増加しました。

Astraの推論 出力トークン 記録コスト
Low 1,906 $0.0955
Medium 2,560 $0.1282
High 3,671 $0.1837
XHigh 6,766 $0.3385
Max 12,638 $0.6321

Willisonの最も注目すべき所見は、Astra Lowのほうが、どの推論レベルで生成したGPT-5.6 Sol Pelicanよりも見栄えが良かったという点です。これは、Maxの推論性能というより、視覚的なコーディング能力のベースラインが世代単位で向上したことを示しています。

自転車はより一貫性を増し、ペリカンは乗り物に統合されていることがはっきり分かるようになり、シーン全体を閲覧者が解釈する必要も減っています。

しかし、このタスクはまだ完全には解決されていません。Maxの下にあるAstraでは、2本の脚を自転車のフレームの反対側に確実に配置できていませんでした。

だからこそ、この一見ばかげたベンチマークは依然として有用です。洗練された出力は能力があるという即座の印象を与えられますが、脚の配置のような小さな関係性によって、シーンが構造的に整合しているかどうかが明らかになります。

Astraは構図をよりよく理解しているように見えますが、Pelican Testだけでは、自転車走行に関する人間のような物理モデルを維持していることまでは立証できません。

GPT-6 AstraもOpenAIの開発者向けデモに登場

OpenAIのGPT-6 Astra開発者向けプレゼンテーションには、より豊かなビジュアル生成と3D生成を示す中で、別のPelicanへの言及が含まれていました。これは同じ管理されたSVG実行ではないため、比較の一部ではなく、補足的な証拠として扱うべきです。

OpenAIの開発者向けプレゼンテーションにおけるGPT-6 Astraの補足的なビジュアル例。管理されたSVGグリッドと直接比較すべきではありません。

Claude Fable 5.1:より深く考えれば、より良いPelicanが生まれるのか?

Claude Fable 5.1は、追加の推論によって幾何学的な関係性を改善できることを示していますが、同時に、単純なビジュアルタスクのコストがいかに急速に膨れ上がるかも示しています。

Claude Fable 5.1 Max Pelican Bicycleテストの結果
Claude Fable 5.1 Maxの結果。出典: Simon WillisonによるFable 5.1のテスト.

LowとMediumはそれぞれ約23秒で完了し、コストは約10セントでした。Highは約29.6秒かかりました。

そして、曲線は劇的に変化しました。

推論 時間 記録コスト
Low 23.8秒 約0.10ドル
Medium 23秒 約0.10ドル
High 29.6秒 約0.13ドル
XHigh 7分51秒 $1.83
Max 13分54秒 $3.30

Maxの結果は、重要な細部を改善しています。2本の脚は自転車のフレームを挟むように目に見えて配置され、足はペダルに届き、翼の1本はハンドルバーに届いており、自転車の形状にもはるかに意図的な注意が払われています。

推論の記録は特に示唆的です。Fableは描画の一部を積極的に再検討しているからです。前輪フォークの形状の問題に気づき、くちばし周辺のヘルメットの配置を見直し、装飾要素がシーンの他の部分と衝突しないかを何度も確認しました。

これにより、より多くの推論と、より内部整合性の高い成果物との間にある、目に見える珍しいつながりが得られます。

しかし、コストの差は桁違いです。

重要なのは、Maxのほうが優れているかどうかではありません。約14分のPelicanに、Lowの30倍を超えるコストをかける価値があるかどうかです。

ClaudeのPelicanはその後、2回目のパスでアニメーション化された

公開アニメーションは、元のPelicanプロンプトによって作成されたものではありません。WillisonはMaxのSVGを取得し、既存の成果物をアニメーション化するための別の指示とともにFable 5.1へ送り返しました。

その2回目の処理では、入力トークン6,121個と出力トークン26,201個が使われ、記録されたコストが約1.37ドル追加で発生しました。

アニメーションは2つ目の課題だったため、他のモデルによる静止画のワンショット結果と直接比較して順位付けすべきではありません。それでも、モデルが動きを取り入れながらジオメトリを維持しなければならない場合に何が起こるかを示すうえで有用です。

オリジナルのClaude Fable 5.1によるアニメーション版Pelicanを見る.

Gemini 3.8 Flash:視覚的な華やかさは理解力の向上を意味するのか?

Gemini 3.8 Flashが際立つ理由は別にあります。ベンチマークを幾何学の課題ではなく、イラスト制作のように見せるのです。

海辺で行ったGemini 3.8 Flash High推論Pelican Bicycle Test
High推論でのGemini 3.8 Flash。出典: Simon Willisonによる2026年9月のGeminiテスト.

Highの結果には、青緑色のクルーザー自転車、赤い水玉模様のスカーフ、魚かご、海辺の遊歩道、そして光り輝く海辺の背景が含まれています。

見た瞬間に魅力的です。

そのため、Geminiは視覚的ベンチマークの問題を示す好例です。人間は自然にスタイルを高く評価します。

より洗練された構図は、自転車のフレームが正しく閉じているか、足が本当にペダルに届いているか、ペリカンの体がサドルに対して一貫した位置にあるかを確認する前には、より知的に感じられることがあります。

視覚的な洗練は確かな能力ですが、視覚的な洗練と物理的な一貫性は異なる能力です。

モデルが進歩するにつれて、Pelican Testはその両方をますます測定するようになっています。そのため、各モデルが成功または失敗する具体的な点を調べるほうが、単純な勝者ランキングよりも意味があります。

Qwen 3.8 27B:17GBのローカルモデルは最先端のPelicanに対抗できるか?

Qwen 3.8 27Bは、ローカルAIユーザーにとって最も重要な成果かもしれません。これは巨大なクラウド専用モデルではなかったからです。

Willisonは、約17GBのQ4_K_M量子化版を、LM Studioを通じてローカルで実行し、高メモリのローカルハードウェアを使った実験も行いました。

xhigh推論でローカル生成したQwen 3.8 27BのPelican Bicycle SVG
xhigh推論でローカル実行したQwen 3.8 27B。出典: Simon WillisonによるローカルQwen 3.8 27Bテスト.

約17GBの量子化ファイルにパッケージ化できるモデルとしては、結果は異例なほど一貫しています。

自転車は期待どおりのフレーム形状をしています。2本の脚は自転車の反対側に現れており、これは多くのモデルにとって驚くほど難しい関係です。ペリカンには明確な袋があり、翼はハンドルバーに届いていて、動きを示す線はシーンを横切るのではなく背後に配置されています。

Willisonは、その時点で自分がローカルで生成した中では最高のPelican SVGだと説明しました。

しかし、大きな落とし穴があります。

Qwen 3.8 27Bは、このタスクを考えすぎました。

デフォルトのxhigh推論レベルでは、モデルは約21分かかりました。最終出力3,223トークンを生成する前に、22,276個の推論トークンを使用しました。

推論を無効にすると、生成時間は2分強まで短縮されましたが、出力は明らかに悪化しました。

推論を無効にしたQwen 3.8 27Bによるペリカンと自転車の結果
推論を無効にした同じQwen 3.8 27Bのプロンプト。自転車の形状と乗り手との相互作用が大幅に悪化しています。

フレームは弱くなり、足はペダルを外し、モデルは翼をハンドルバーにつなごうとする真剣な試みすらしなくなりました。

これは、GPT-6 Astraとはほぼ正反対の展開です。

Astraの最も印象的な特徴は、Lowでもすでに強力であることです。Qwen 3.8 27Bは、モデルに長時間推論させれば、比較的コンパクトなローカルハードウェアからどれほど高い視覚品質を引き出せるかを示しています。

これは、17GBのモデルが全体としてGPT-6に追いついたという証拠ではありません。「ローカルで実行できるほど小さいこと」と「洗練された構造化出力を生成できること」が、もはや相反しないという証拠です。

Qwen 3.8 Flash-Next:アクティブパラメータ60億のMoEは何を描けるのか?

Qwen 3.8 Flash-Nextは、まったく異なるアーキテクチャによる、ローカルAIの二つ目のデータポイントを提供します。

このモデルは総計1,250億のパラメータを持ちますが、各トークンでアクティブになるのはおよそ60億のパラメータです。この違いにより、完全な重みセットは6Bよりはるかに大きいままでも、計算要件を抑えられます。

風景の中でペリカンが自転車に乗っている様子を示すQwen 3.8 Flash-NextのSVG
DGX Spark上で量子化UD-Q2_K_XLビルドを使用したQwen 3.8 Flash-Next。出典: Simon WillisonによるQwen 3.8 Flash-Nextのテスト.

xhighの結果は、洗練されたシーンになっています。ペリカンは赤い自転車の上に乗り、魚が前かごに収まり、自転車自体も、ばらばらの弧やチューブに崩れることなく、認識可能な構造を維持しています。

この結果が興味深いのは、GeminiやAstraより美しいかどうかではありません。

つまり、スパースMoEモデルによって、単純なパラメータ数の比較はあまり有用ではなくなっています。

およそ60億のアクティブパラメータを持つ1,250億パラメータのモデルは、従来型の密な60億パラメータモデルのようには動作せず、ストレージやメモリの特性も同じではありません。

ペリカンは、この方程式における能力の側面を示しています。アクティブな計算量が比較的少なくても、驚くほど洗練された構造化シーンを調整できるのです。

Qwen 3.8 Max:モデルが大幅に大型化すると何が変わるのか?

Qwen 3.8 Maxは、同じ大きなモデルファミリー内で、上位帯を比較するための有用な指標となります。

Qwen 3.8 Maxによるペリカンと自転車のテスト結果
Qwen 3.8 Maxによるペリカンの結果。出典: Simon WillisonによるQwen 3.8 Maxの例.

結果は整理されていて解析しやすいものです。脚はペダル付近まで届き、自転車は従来型の形状を保ち、全体のシーンも十分にシンプルなので、形状を読み取りやすくなっています。

しかし、Qwen Maxはテストから得られるもう一つの教訓をさらに強く示しています。

モデルが大きいからといって、自動的に高いスコアを与えるべきではありません。

実用的なローカルAIという観点では、Qwen 3.8 27Bのほうが、現実的に所有できる高性能なホームユーザー向けハードウェアで何が動かせるのかを教えてくれるため、実際にはより興味深いPelicanかもしれません。

Maxはモデルの上限を示します。ローカル環境での27Bの結果は、デプロイの進展を示しています。

Kimi K3:1羽のペリカンに必要な推論量はどれくらいか?

Kimi K3は、もう1つ首尾一貫したPelicanを生成しましたが、その画像以上に、隠れた計算資源の使用量のほうが興味深いかもしれません。

赤い自転車に乗るペリカンを示したKimi K3のPelican Bicycleテスト結果
標準のPelicanプロンプトによるKimi K3の結果。出典: Simon WillisonによるKimi K3のテスト.

プロンプトはわずか数語でしたが、記録上の実行では入力トークン95個、出力トークン16,658個が使われました。

その出力トークンのうち、13,241トークンが推論トークンでした。

その実行にかかった記録上のコストは約0.25ドルでした。

最終的なシーンは十分に成立しています。自転車とペリカンは認識でき、ライダーの配置も妥当で、背景の細部、道路、動きの要素も描かれています。

しかし、画像からは分からないことも、数値が明らかにします。

視覚的にシンプルな結果の裏に、膨大なモデル側の処理が隠れていることがあります。

これは実際のアプリケーションにおいて重要です。単一の成功例だけを見れば安価に見えるモデルでも、同じ推論パターンをエージェントのワークフロー内で何百回も繰り返すと、高コストになったり、処理が遅くなったりする可能性があります。

Kimiにとって、Pelicanは描画テストであると同時に、推論効率のテストにもなります。

DeepSeek V4 Pro:異なる推論レベルでは、なぜ別のモデルのように見えるのか?

DeepSeek V4 Pro 0813は、アーカイブ内でも特に奇妙な推論比較の1つを生み出しました。

Low、Medium、Highは、同じデザインを徐々に洗練したものには見えませんでした。それぞれ異なるビジュアル戦略を追求しているように見えました。

DeepSeek V4 Pro Low推論のPelican Bicycleテスト
Low
DeepSeek V4 Pro Medium推論のPelican Bicycleテスト
Medium
DeepSeek V4 Pro High推論のPelican Bicycleテスト
High

Low、Medium、Highの各推論設定でのDeepSeek V4 Pro 0813。出典: Simon WillisonによるDeepSeek V4 Proのテスト.

Lowは比較的すっきりしていてミニマルです。Mediumでは、壊れた車輪の弧、粗い線、そして奇妙に細長い形状が構図を支配し、抽象性が大幅に高まります。Highでは再び方向性が変わり、より典型的な赤い自転車に戻りつつ、かご、ペナント、音符が加わります。

教訓は、単純に「Highのほうが優れている」ということではありません。

推論の強度は、モデルが選択するビジュアル戦略に影響するようです。単一の構図をどれだけ丁寧に実行するかだけではありません。

このことから、DeepSeek V4 Proは、モデルのビジュアルコーディングが得意か不得意かを判断する根拠として、1枚のスクリーンショットは非常に弱いということを思い出させてくれます。

サンプリングの分散は重要です。推論設定も重要です。APIやハーネスも影響する可能性があります。結果をすぐに確認できるため、Pelicanはこうした違いを可視化してくれます。

DeepSeek V4 Flash:より多く推論すれば壊れた自転車を修復できるのか?

DeepSeek V4 Flash 0731は、推論が形状に与える影響をさらに明確に示す例です。

デフォルト実行では、ひどく崩れた自転車が生成されました。車輪は不完全な弧として現れ、フレームのチューブは接続されないまま浮かび、ペリカンは説得力をもって自転車に乗るのではなく、シーンの上に浮かんでいました。

不正な自転車形状を持つ、デフォルト推論時のDeepSeek V4 Flashペリカン自転車結果
デフォルトの推論設定でのDeepSeek V4 Flash 0731。

Willisonはその後、同じ基本タスクを使って推論の強度をHighに引き上げました。

結果は劇的に変わりました。

一貫した自転車の形状を持つ、High推論時のDeepSeek V4 Flashペリカン自転車結果
High推論でのDeepSeek V4 Flash 0731。出典: Simon WillisonによるDeepSeek V4 Flashの推論テスト.

High出力には、完全な車輪、認識可能なフレーム、クランク部分、ハンドルバーをつかむペリカン、そしてペダルの近くに置かれた足が含まれています。

ただし、推論を増やせばビジュアル生成が必ず改善することを証明するものではありません。

これは、質の低いSVG結果の一部が、自転車の形状に関する表現をモデルがまったく持っていないことの証拠ではなく、調整の失敗である可能性を示しています。

部品はすでにモデル内に存在しているのかもしれません。追加の推論によって、それらを正しく組み立てられる場合があります。

同じペリカンプロンプトでDeepSeek V4 FlashがV4 Proに勝った理由

以前のDeepSeek V4比較でも、直感に反する結果が得られました。

一貫した自転車の形状を持つDeepSeek V4 Flashのペリカン自転車結果
DeepSeek V4 Flash
異様なペリカンの解剖学的表現を持つDeepSeek V4 Proのペリカン自転車結果
DeepSeek V4 Pro

出典: Simon WillisonによるDeepSeek V4比較.

Flash版は、ペリカンテストの基準では非常に優れた自転車を生成しました。認識可能なフレーム、見えるチェーン、リフレクター、ハンドルバーまで届く翼、そしてペダルに乗った足が備わっていました。

Proモデルは妥当な自転車を維持しましたが、体が大きすぎ、解剖学的整合性に欠ける、はるかに奇妙なペリカンを生成しました。

これは、Flashが一般的にProより賢い証拠だと解釈すべきではありません。

これは、より限定的ですが有用なことを示しています。

モデルのサイズやベンチマークでの評判が、1つの確率的なビジュアルコーディングプロンプトで最高の出力を保証するわけではありません。

GLM-5.3-Flash対DeepSeek V4 Flash:モデルにツールを与えると何が起こるのか?

GLM-5.3-Flashは、別種のペリカン実験をもたらします。

あるコミュニティ比較では、単純な1行テストではなくエージェント環境が使われました。GLM-5.3-Flashと、実験的なDeepSeek V4 Flashのビジョン構成の両方を、OpenCode、Trellis、Chrome MCP、Max推論とともに実行しました。

この指示では、2D SVGアニメーションを含む完全なHTMLページを作成するようモデルに求め、さらにそのタスクを競技として扱うよう明示的に伝えました。

それによって、測定対象が変わります。

このモデルは、もはや1つのプロンプトから1つのSVGを生成するだけではありません。より多くの時間をかけ、ツールを使い、ブラウザー環境を調べ、コーディングエージェントに近い振る舞いができます。

GLM-5.3-Flashのアニメーションするペリカン

OpenCode、Trellis、Chrome MCP、Max推論を使用して生成されたGLM-5.3-Flashのアニメーション。出典: 元のコミュニティ比較.

GLMの結果は、上記の静止画のペリカンよりも大幅に意欲的です。完全なシーン、自転車の各部品、動き、ペダル、そしてより豊かなページ全体のプレゼンテーションが含まれています。

コミュニティのコメント投稿者は概ねGLMの結果を好み、より完成度の高いペダルとアニメーションの作り込みを評価する声も複数ありました。

目に見えるミスはまだあります。足の動きには機械的で不自然に見える部分があり、アニメーションを増やすほど、要素間の関係が崩れる可能性も高まります。

ここで、次のような有用な区別が生まれます。

機能がより豊富な結果が、必ずしも物理的により正確な結果とは限りません。

DeepSeek V4 Flash Visionによるアニメーション化されたペリカン

同じツール支援環境で生成されたDeepSeek V4 Flash Visionの実験。出典: コミュニティによるテスト手法と議論.

DeepSeek版は異なるアプローチを取り、夕焼けの構図と、より洗練されたレスポンシブ表示を採用しています。

コミュニティからのフィードバックでは、GLMの機械的な完成度が概ね評価される一方、DeepSeekには視覚的な構図とモバイル表示が評価されました。

さらに重要なのは、ツールが導入されるとAIベンチマークの意味がどれほど急速に変わるかを、どちらの結果も示していることです。

現在テストされているシステムは次のとおりです。

  • ベースモデル、
  • 推論設定、
  • エージェントハーネス、
  • ブラウザツール、
  • 視覚的なフィードバック、
  • 実行時間、
  • そして反復戦略。

結果を単に「GLM対DeepSeek」と呼ぶと、アーティファクトを実際に生み出した要素の多くが隠れてしまいます。

一度きりのペリカンとエージェント支援アニメーションを同じランキングに載せるべきでない理由

この違いは、明確にしておくほど重要です。

テスト 主に測定しているもの
1行のSVGプロンプト 1回の応答におけるモデルの推論、SVG生成、空間的な調整
より高い推論レベル 追加の推論によってジオメトリや要素間の関係を修正できるかどうか
2回目のアニメーション 動きを加えながら既存の構図を維持できるかどうか
エージェント+Chrome MCP モデル、ハーネス、ツール、フィードバックループ、反復的なコーディングの組み合わせ

エージェントの支援による優れたアニメーションは、一度きりのSVGよりも現代のコーディングワークフローに関連性が高いとも言えます。

しかし、それは別のテストです。

GPT-6 Astraが1回だけ応答し、GLMが20分間、ブラウザー、そして視覚的なフィードバックを利用した場合、最終的なアニメーションを根拠に、GLMの元のベンチマーク性能が優れているとは責任を持って主張できません。

この結果が示すのは、自分の作業を検査・実行・修正できるシステムの中にモデルを置くと、モデルの能力が大幅に向上するということです。

ペリカン自転車テストで実際に勝ったAIモデルは?

科学的に妥当な単一の勝者は存在しませんが、現在の結果からは各カテゴリーで際立つモデルがいくつか見えてきます。

カテゴリー 際立ったモデル 理由
最も顕著なベースライン改善 GPT-6 Astra 低い推論レベルでもGPT-5.6シリーズから大幅に改善
最も綿密で高負荷なジオメトリ Claude Fable 5.1 Max 明示的な推論により、乗り手、フォーク、物体間の関係を修復
視覚的な華やかさが最も強い Gemini 3.8 Flash 最小限のプロンプトを、非常にデザイン性の高いイラストへと変える
最も印象的なローカル実行結果 Qwen 3.8 27B 約17GBの量子化ローカルモデルが、非常に一貫性のあるジオメトリを生成
最も興味深いスパースMoEの結果 Qwen 3.8 Flash-Next トークンあたり約6Bのアクティブパラメータにもかかわらず、優れた構図
最も極端な推論例 Kimi K3 小さなプロンプトに対して13,000個を超える推論トークンを使用
推論による修復の最良例 DeepSeek V4 Flash High推論により、壊れたデフォルトの自転車が大幅に改善される
出力のばらつきが最大 DeepSeek V4 Pro Low、Medium、Highで視覚的なアプローチが大きく異なる
最も意欲的なツール支援アニメーション GLM-5.3-Flash エージェント環境とブラウザツールを与えると、より豊かなアニメーション付きHTML成果物を構築する

最小限の推論で、現在のどのモデルが最も強力な一発生成のペリカンを作るかが単純に問われるなら、GPT-6 Astraは無視しがたい存在です。

実際に机上に置いてローカルで実行できるハードウェアにとって、どの結果が最も驚くべきかが問われるなら、Qwen 3.8 27Bははるかに重要になります。

テストが一発生成から、ツールと反復作業を伴うコーディングエージェントのワークフローへ移行するなら、GLM-5.3-Flashは到達可能な水準がどれほど変わり得るかを示します。

これらは3つの異なる問いです。だからこそ、数値上の勝者を1つに決めると、説明できることよりも多くを隠してしまいます。

これらのAIモデルは、自分が描くものを本当に理解しているのか?

ペリカン自転車テストで、本物の物理的理解を証明することはできません。

モデルが正しく見える自転車を生成できるのは、学習によって自転車、鳥、SVGコード、一般的な視覚的構成について強力な表現を獲得しているからかもしれません。

これらの表現をうまく連携させられることは、有用な空間的能力の証拠です。

これは、モデルが人間と同じように、バランス、重力、機械的負荷、ペダルの動き、または移動を理解していることを示すものではありません。

残っている失敗は、この点を特に明確に示しています。

Astraは魅力的な自転車を作成できますが、フレームの周囲に配置する両脚の位置を誤ったままにすることがあります。Claudeのアニメーションする車輪は、静的なSVGでは見えなかった動きの問題を明らかにできます。Qwenは、別のモデルならはるかに速く生成するシーンの構築に、22,000個の推論トークンを費やすことがあります。DeepSeekは、ある推論レベルでは壊れた自転車を生成し、別のレベルでは整合性のある自転車を生成できます。

これらのモデルは、言語から視覚的な構造を構築する能力において、非常に優れたものになりつつあります。

それを「理解」と表現すべきかどうかは、その言葉にどの程度の内部表現を求めるかによって決まります。

なぜ中国製オープンモデルがこのテストで最も興味深い存在なのか

以前のペリカン・テスト以降で最も重要な変化は、GPT-6がより優れた鳥を生成するようになったことではないのかもしれません。

オープンでローカルに導入可能なモデルが、つい最近までならフロンティアクラスに見えたであろう結果を、今や生成しているということだ。

Qwen 3.8 27Bは、約17GBの量子化モデルから、筋の通ったペリカンをローカルで生成できる。Qwen 3.8 Flash-Nextは、大規模な総MoE容量と、はるかに少ないアクティブ計算量を組み合わせている。DeepSeek V4 Flashは、追加の推論を有効にすると、壊れたビジュアル結果から回復できる。GLM-5.3-Flashは、ブラウザを備えたコーディングエージェントのループ内で動作し、洗練されたアニメーション成果物を生成できる。

だからといって、いずれもGPT-6 AstraやClaude Fable 5.1にあらゆる面で追いついたという意味ではない。

つまり、その差はワークロード固有のものになりつつある。

最も難しい推論の問題では、フロンティアのクラウドモデルが依然として明確な優位性を持つ場合がある。

構造化生成、コーディング、プライベートなワークフロー、そしてますます洗練されるローカルエージェントにおいて、その問いは以前ほど明白ではなくなっている。

ペリカンテストは、ローカルAI全体で起きている同じ傾向を偶然にも可視化している。フロンティアは動き続けているが、フロンティアの外で利用できる能力の水準も、ほぼ同じ速さで向上している。

ペリカンから何を学ぶべきか?

最も明確な結果は、あるAIがついにペリカンの自転車の乗り方を学習したことではない。

コード生成によるビジュアル成果物のベースライン品質が急速に向上する一方で、モデル間の違いはより微妙になっているということだ。

GPT-6 Astraは、Low推論でも強力な構造化ビジュアル生成が現れ得ることを示している。Claude Fable 5.1は、ジオメトリの修正にどれほど多くの追加計算を費やせるかを実証する。Gemini 3.8 Flashは、力強い美的構成が人間の判断にどれほど影響を与え得るかを示している。Qwen 3.8 27Bは、コンパクトなローカル環境で可能なことを示す。Kimi K3は重い推論に隠れたコストがあることを明らかにし、DeepSeekは個々のビジュアル生成が依然としてどれほど不安定であり得るかを示している。

GLM-5.3-Flashが最後のピースを加える。つまり、モデルがブラウザツールと視覚的フィードバックを受け取り、反復する権限を持つと、ベンチマークは孤立したモデルではなくAIシステムを測定し始める。

そのため、ペリカン自転車テストは、リーダーボードとしての有用性が下がる一方で、顕微鏡としての有用性が高まっている。

これは次の違いを明らかにする。

  • 有効なSVGを書けるモデル。
  • 空間的な関係を維持できるモデル。
  • より多くの推論を行って誤りを修正できるモデル。
  • フロンティアモデルを思わせる出力に近づけるローカルモデル。
  • そして、自らの成果物を検査して改善できるエージェントシステム。

GPT-6 Astraは現在、最も優れたペリカンの一つを生成する可能性がある。しかし、より大きな意味を持つのは、Claude、Gemini、Qwen、DeepSeek、Kimi、GLMが、ますます洗練された形で失敗し、成功するようになっていることだ。

鳥は相変わらず滑稽だ。ベンチマークは完璧ではない。しかし、モデルの挙動がどれほど急速に変化しているかを示す視覚的なスナップショットとして、ペリカン自転車テストは依然として驚くほど多くを明らかにしている。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.