GPT-6 Astra produce uno dei pellicani più convincenti di sempre, ma il Pelican Bicycle Test diventa più interessante quando viene confrontato con Claude Fable 5.1, Gemini 3.8 Flash, Qwen 3.8, DeepSeek V4, Kimi K3 e GLM-5.3-Flash. Una richiesta di una sola riga per generare un SVG di un pellicano in bicicletta costringe un modello linguistico a tradurre le parole in codice, geometria, anatomia, relazioni tra oggetti e una scena i cui errori sono immediatamente visibili.
Gli ultimi risultati mostrano che non esiste un vincitore assoluto. GPT-6 Astra alza il livello minimo della qualità, Claude può dedicare molto più ragionamento alla correzione della geometria, Gemini offre una cura visiva eccezionale, Qwen dimostra quanto i modelli locali possano avvicinarsi e DeepSeek mostra quanto le impostazioni di ragionamento possano modificare l'output di uno stesso modello. Le animazioni di GLM e DeepSeek assistite da strumenti rivelano ancora un altro aspetto: quando un agente può esaminare e perfezionare autonomamente il proprio artefatto, il test non misura più soltanto il modello.
Risultati del test Pelican Bicycle a colpo d'occhio
| Modello | Tipo di test | Elementi distintivi | Avvertenza principale |
|---|---|---|---|
| GPT-6 Astra | SVG standard, da Low a Max | Base di riferimento molto solida; Low superava già visivamente la precedente famiglia GPT-5.6 | Al di sotto di Max, la posizione delle gambe intorno al telaio della bicicletta era ancora incoerente |
| Claude Fable 5.1 | SVG standard + passaggio di animazione separato | Max ha prodotto una composizione altamente studiata, con una forte interazione tra ciclista e bicicletta | Max ha richiesto quasi 14 minuti ed è costato molto più di Low |
| Gemini 3.8 Flash | SVG standard, da Basso ad Alto | Eccezionale cura visiva e coerenza decorativa | L'impatto visivo non equivale alla correttezza fisica |
| Qwen 3.8 27B | SVG standard locale | Uno dei Pellicani più riusciti generati da un modello locale di circa 17 GB | Il ragionamento xhigh predefinito ha consumato più di 22.000 token di ragionamento |
| Qwen 3.8 Flash-Next | SVG standard locale | Scena convincente da un MoE da 125B con circa 6B di parametri attivi | Il risultato locale dipende fortemente dalla quantizzazione e dall'hardware disponibile |
| Qwen 3.8 Max | SVG standard / modello più grande | Interazione ciclista-bicicletta pulita e composizione curata | Modello molto più grande, quindi non è un confronto equo con l'hardware locale |
| Kimi K3 | SVG standard | Risultato coerente a partire da un prompt estremamente breve | Ha utilizzato più di 13.000 token di ragionamento |
| DeepSeek V4 Pro 0813 | SVG standard, da Basso ad Alto | I livelli di ragionamento hanno prodotto strategie visive radicalmente diverse | L'elevata variabilità rende un singolo screenshot una sintesi inadeguata del modello |
| DeepSeek V4 Flash 0731 | SVG standard | Un ragionamento elevato ha corretto una bicicletta predefinita gravemente danneggiata | Il miglioramento del ragionamento è stato notevole, ma non garantito |
| GLM-5.3-Flash | HTML/SVG animato con assistenza di un agente | Animazioni ricche, pedali, controlli della scena e lavoro visivo iterativo | Chrome MCP e un ambiente agentico la rendono non comparabile con i test one-shot |
Questa non è una classifica scientifica. Le esecuzioni pubbliche sono state effettuate in momenti diversi, con API, impostazioni di ragionamento, quantizzazioni e, in alcuni casi, ambienti con strumenti differenti.
Il confronto più difendibile è quello comportamentale. La bicicletta ha un telaio coerente? I piedi raggiungono i pedali? L'uccello interagisce davvero con il manubrio? Un ragionamento aggiuntivo corregge queste relazioni o aggiunge semplicemente più decorazioni?
Che cosa misura realmente il test della bicicletta con il pellicano?
Il prompt originale è volutamente minimale:
Genera un SVG di un pellicano che va in bicicletta.
Produrre una risposta convincente richiede il funzionamento simultaneo di diverse capacità. Il modello deve scrivere SVG valido, costruire una bicicletta riconoscibile, approssimare l'anatomia di un pellicano, posizionare l'uccello nella parte corretta della scena e far interagire oggetti distinti in modo visivamente plausibile.
Questo rende il test utile per osservare:
- la generazione di codice SVG e frontend,
- la geometria degli oggetti,
- la composizione spaziale,
- la coerenza anatomica,
- l'interazione tra oggetti,
- il rispetto delle istruzioni,
- e l'efficienza dello sforzo di ragionamento.
non misura direttamente l'accuratezza fattuale, il ragionamento scientifico, la programmazione su scala di repository, l'affidabilità degli agenti, le conoscenze professionali o l'intelligenza generale.
Simon Willison, che ha utilizzato ripetutamente il prompt attraverso diverse generazioni di modelli, è diventato anch'egli più prudente nei suoi confronti. Ora lo considera principalmente un rapido test comportamentale e un modo utile per confrontare le versioni all'interno della stessa famiglia di modelli, anziché un benchmark universale dell'intelligenza.
La sua analisi del pellicano di Kimi K3 mette esplicitamente in guardia dal considerare i singoli output del pellicano come una classifica seria dei modelli.
Questa limitazione è importante perché i modelli moderni sono ormai abbastanza validi da far influire sempre più il gusto visivo sul risultato. Quando ogni output contiene un uccello e una bicicletta riconoscibili, un bel tramonto o un cesto per pesci può far sembrare un'immagine più intelligente, anche se un altro modello ha una geometria più accurata.
Come si è comportato GPT-6 Astra nel test della bicicletta con il pellicano?
Il risultato più importante di GPT-6 Astra non è semplicemente che Max sia impressionante. È che Low produce già un pellicano molto più convincente rispetto alla precedente famiglia GPT-5.6.
Willison ha testato Astra con i livelli di ragionamento Low, Medium, High, XHigh e Max. Il numero di token di output da lui registrato è aumentato da 1.906 con Low a 12.638 con Max.
| Ragionamento di Astra | Token di output | Tempo |
|---|---|---|
| Basso | 1,906 | $0.0955 |
| Medio | 2,560 | $0.1282 |
| Alto | 3,671 | $0.1837 |
| ~$0,13 | 6,766 | $0.3385 |
| Max | 12,638 | $0.6321 |
L'osservazione più significativa di Willison è stata che Astra Low appariva migliore di qualsiasi Sol Pelican di GPT-5.6 che avesse generato, a qualunque livello di ragionamento. Questo rende il risultato meno legato al ragionamento Max e più a un incremento generazionale delle capacità visive di programmazione di base.
The bicycle becomes more coherent, the pelican becomes recognizably integrated with the vehicle, and the whole scene requires less interpretation from the viewer.
La bicicletta diventa più coerente, il pellicano si integra in modo riconoscibile con il veicolo e l'intera scena richiede meno interpretazione da parte dell'osservatore.
Ma l'attività non è ancora stata risolta perfettamente. Subito sotto Max, Astra non ha posizionato in modo affidabile le due zampe ai lati opposti del telaio della bicicletta.
Ed è esattamente per questo che questo sciocco benchmark rimane utile. Un output rifinito può dare un'impressione immediata di competenza, mentre una piccola relazione, come la posizione delle zampe, rivela se la scena sia strutturalmente coerente.
Astra sembra comprendere meglio la composizione, ma il Test del Pellicano non può stabilire se mantenga un modello fisico umanoide dell'andare in bicicletta.
GPT-6 Astra è apparso anche nella demo per sviluppatori di OpenAI
La presentazione per sviluppatori di GPT-6 Astra di OpenAI contiene un altro riferimento al Pellicano, mostrando al contempo una generazione visiva e 3D più ricca. Non si tratta della stessa esecuzione SVG controllata, quindi dovrebbe essere considerata una prova supplementare anziché parte del confronto.
Esempio visivo supplementare di GPT-6 Astra tratto dalla presentazione per sviluppatori di OpenAI. Non dovrebbe essere confrontato direttamente con la griglia SVG controllata.
Claude Fable 5.1: pensare di più produce un Pellicano migliore?
Il test Fable 5.1 di Simon Willison
Low e Medium hanno completato l'operazione in circa 23 secondi, con un costo di circa dieci centesimi ciascuno. High ha impiegato circa 29,6 secondi.
| Poi la curva è cambiata drasticamente. | Ragionamento | Tempo |
|---|---|---|
| Basso | Costo registrato | 23 secondi |
| Medio | 23,8 secondi | 23 secondi |
| Alto | ~$0,10 | 29,6 secondi |
| ~$0,13 | 7 minuti e 51 secondi | $1.83 |
| Max | 13 minuti e 54 secondi | $3.30 |
Il risultato di Max migliora effettivamente dettagli importanti. Le due zampe sono posizionate visibilmente ai lati del telaio della bicicletta, i piedi raggiungono i pedali, un'ala arriva al manubrio e la geometria della bicicletta riceve molta più attenzione intenzionale.
La traccia del ragionamento è particolarmente rivelatrice perché Fable ha riconsiderato attivamente alcune parti del disegno. Ha notato problemi nella geometria della forcella anteriore, ha rivalutato la posizione del casco intorno al becco e ha verificato ripetutamente se gli elementi decorativi potessero entrare in collisione con il resto della scena.
Questo ci offre una rara connessione visibile tra un ragionamento più approfondito e un artefatto più coerente al suo interno.
Ma la differenza di costo è enorme.
La domanda utile non è se Max sia migliore. È se un Pellicano di quasi 14 minuti abbia un valore sufficiente a giustificare un costo superiore di oltre 30 volte rispetto a Low.
Il Pellicano di Claude è stato poi animato in un secondo passaggio
L'animazione pubblica non è stata creata dal prompt Pelican originale. Willison ha preso l'SVG di Max e lo ha inviato di nuovo a Fable 5.1 con un'istruzione separata per animare l'artefatto esistente.
Quel secondo passaggio ha utilizzato 6.121 token di input e 26.201 token di output, aggiungendo un ulteriore costo registrato di circa 1,37 $.
Poiché l'animazione era un secondo compito, non dovrebbe essere classificata direttamente insieme ai risultati statici ottenuti in un singolo passaggio dagli altri modelli. È comunque utile per mostrare cosa accade quando il modello deve preservare la geometria introducendo al contempo il movimento.
Guarda il Pellicano animato originale di Claude Fable 5.1.
Gemini 3.8 Flash: l'estro visivo equivale a una comprensione migliore?
Gemini 3.8 Flash si distingue per un motivo diverso: fa sembrare il benchmark un lavoro di illustrazione invece di un esercizio di geometria.
Il risultato High include una bicicletta cruiser color verde acqua, una sciarpa rossa a pois, un cestino per i pesci, una passerella sul lungomare e uno sfondo marino luminoso.
È immediatamente attraente.
Questo rende Gemini un esempio utile di un problema dei benchmark visivi: gli esseri umani premiano naturalmente lo stile.
Una composizione più raffinata può sembrare più intelligente prima di verificare se il telaio della bicicletta si chiude correttamente, se il piede raggiunge davvero il pedale o se il corpo del pellicano è posizionato in modo coerente rispetto alla sella.
La raffinatezza visiva è una capacità reale, ma la raffinatezza visiva e la coerenza fisica sono capacità diverse.
Con il miglioramento dei modelli, il Pelican Test misura sempre più entrambe le cose. Per questo le semplici classifiche dei vincitori sono meno significative dell'analisi dei modi specifici in cui ciascun modello riesce o fallisce.
Qwen 3.8 27B: un modello locale da 17 GB può competere con i modelli Pellicano all'avanguardia?
Qwen 3.8 27B potrebbe essere il risultato più importante per gli utenti dell'IA locale, perché non si trattava di un enorme modello disponibile esclusivamente nel cloud.
Willison ha eseguito localmente tramite LM Studio una versione quantizzata Q4_K_M di circa 17 GB, effettuando anche esperimenti su hardware locale con molta memoria.
Il risultato è insolitamente coerente per un modello che può essere distribuito in un file quantizzato di circa 17 GB.
La bicicletta ha la forma del telaio prevista. Le due gambe appaiono sui lati opposti della bicicletta, una relazione sorprendentemente difficile da ottenere per molti modelli. Il pellicano ha una sacca ben definita, la sua ala raggiunge il manubrio e le linee di movimento sono posizionate dietro la scena invece di attraversarla.
Willison lo ha descritto come il miglior SVG del Pellicano che avesse generato localmente fino a quel momento.
Ma c'è un'importante controindicazione.
Qwen 3.8 27B ha riflettuto eccessivamente sul compito.
Al livello di ragionamento xhigh predefinito, il modello ha impiegato circa 21 minuti. Ha utilizzato 22.276 token di ragionamento prima di produrre 3.223 token di output finale.
Quando il ragionamento è stato disattivato, la generazione è scesa a poco più di due minuti, ma l'output è diventato sensibilmente peggiore.
L'inquadratura è diventata più debole, i piedi hanno mancato i pedali e il modello non ha più fatto un tentativo serio di collegare l'ala al manubrio.
Questo racconta una storia quasi opposta rispetto a GPT-6 Astra.
La caratteristica più impressionante di Astra è che Low è già potente. Qwen 3.8 27B dimostra quanta qualità visiva si possa ottenere da un hardware locale relativamente compatto se il modello ha il permesso di dedicare molto tempo al ragionamento.
Non è una prova che un modello da 17 GB abbia raggiunto complessivamente GPT-6. È la prova che “abbastanza piccolo da funzionare localmente” e “capace di produrre output strutturati sofisticati” non sono più concetti reciprocamente esclusivi.
Qwen 3.8 Flash-Next: cosa può disegnare un modello MoE con 6B di parametri attivi?
Qwen 3.8 Flash-Next offre un secondo punto dati sull'IA locale basato su un'architettura molto diversa.
Il modello ha 125 miliardi di parametri totali, ma ne attiva circa 6 miliardi per ogni token. Questa distinzione può ridurre i requisiti di calcolo, anche se l'insieme completo dei pesi rimane molto più grande di 6B.
Il risultato xhigh mostra una scena rifinita. Il pellicano si trova sopra una bicicletta rossa, un pesce occupa il cestino anteriore e la bicicletta stessa mantiene una struttura riconoscibile invece di collassare in archi e tubi scollegati.
Ciò che rende interessante questo risultato non è se sia più bello di Gemini o Astra.
Il punto è che i modelli MoE sparsi stanno rendendo meno utili i semplici confronti basati sul numero di parametri.
Un modello da 125B con circa 6B di parametri attivi non si comporta come un convenzionale modello denso da 6B, né presenta le stesse caratteristiche di archiviazione e memoria.
Il pellicano dimostra il lato della capacità di quell'equazione: una quantità di calcolo attiva relativamente ridotta può comunque coordinare una scena strutturata sorprendentemente sofisticata.
Qwen 3.8 Max: cosa cambia quando il modello diventa molto più grande?
Qwen 3.8 Max offre un utile confronto di fascia alta all'interno della stessa più ampia famiglia di modelli.
Il risultato è pulito e facile da analizzare. Le gambe arrivano all'area dei pedali, la bicicletta ha una forma convenzionale e la scena complessiva rimane abbastanza semplice da mantenere leggibile la geometria.
Tuttavia, Qwen Max ribadisce un'altra lezione del test:
Un modello più grande non dovrebbe ricevere automaticamente un punteggio più alto solo perché è più grande.
Per l’IA locale pratica, Qwen 3.8 27B potrebbe essere il Pellicano più interessante, perché ci dice qualcosa su ciò che può funzionare su hardware che un utente domestico esperto potrebbe realisticamente possedere.
Max dimostra il limite massimo di un modello. Il risultato locale con 27B dimostra i progressi nella distribuzione.
Kimi K3: quanto ragionamento serve a un solo pellicano?
Kimi K3 ha prodotto un altro Pellicano coerente, ma il consumo nascosto di risorse di calcolo potrebbe essere più interessante dell’immagine.
Il prompt conteneva solo poche parole, eppure l’esecuzione registrata ha utilizzato 95 token di input e 16.658 token di output.
Di questi token di output, 13.241 erano token di ragionamento.
Il costo registrato per quella esecuzione è stato di circa 0,25 $.
La scena finale è valida: bicicletta riconoscibile, pellicano riconoscibile, posizione ragionevole del ciclista, dettagli dello sfondo, strada ed elementi di movimento.
Ma i numeri rivelano qualcosa che l’immagine non può mostrare.
Un risultato visivamente semplice può nascondere un’enorme quantità di lavoro svolto dal modello.
Questo è importante per le applicazioni reali. Un modello può sembrare economico se valutato sulla base di un singolo risultato riuscito, ma diventare costoso o lento quando lo stesso schema di ragionamento viene ripetuto centinaia di volte all’interno del flusso di lavoro di un agente.
Per Kimi, il Pellicano diventa quasi tanto un test dell’efficienza del ragionamento quanto un test di disegno.
DeepSeek V4 Pro: perché diversi livelli di ragionamento sembrano modelli diversi?
DeepSeek V4 Pro 0813 ha prodotto uno dei confronti tra ragionamenti più strani dell’archivio.
Basso, Medio e Alto non sembravano semplicemente versioni sempre più rifinite dello stesso design. Sembravano perseguire strategie visive diverse.
DeepSeek V4 Pro 0813 con ragionamento Basso, Medio e Alto. Fonte: Il test DeepSeek V4 Pro di Simon Willison.
Basso è relativamente pulito e minimalista. Medio diventa molto più astratto: archi di ruote spezzati, tratti disinvolti e una strana forma allungata dominano la composizione. Alto cambia di nuovo direzione, tornando a una bicicletta rossa più convenzionale e aggiungendo un cestino, un pennoncino e note musicali.
La lezione non è semplicemente «Alto è meglio».
Lo sforzo di ragionamento sembra influenzare la strategia visiva scelta dal modello, non solo la cura con cui esegue una composizione fissa.
Questo rende DeepSeek V4 Pro un eccellente promemoria del fatto che un solo screenshot è una base molto debole per sostenere che un modello sia bravo o scarso nel coding visivo.
La varianza del campionamento è importante. Anche le impostazioni di ragionamento contano. L’API o l’harness possono fare la differenza. Il Pellicano rende visibili queste differenze perché possiamo ispezionare subito il risultato.
DeepSeek V4 Flash: Più ragionamento può riparare una bicicletta rotta?
DeepSeek V4 Flash 0731 offre un esempio ancora più chiaro di come il ragionamento influenzi la geometria.
L'esecuzione predefinita ha prodotto una bicicletta gravemente deformata. Le ruote apparivano come archi incompleti, i tubi del telaio fluttuavano senza collegarsi e il pellicano sembrava sospeso sulla scena anziché cavalcarla in modo convincente.
Willison ha quindi aumentato lo sforzo di ragionamento a High utilizzando la stessa attività di base.
Il risultato è cambiato drasticamente.
L'output High presenta ruote complete, un telaio riconoscibile, una zona della guarnitura, un pellicano che afferra il manubrio e una zampa posizionata vicino al pedale.
Questo non dimostra che un ragionamento più approfondito risolva sempre la generazione visiva.
Questo suggerisce che alcuni risultati SVG scadenti siano fallimenti di coordinamento, anziché la prova che il modello non disponga affatto di una rappresentazione della geometria delle biciclette.
Gli elementi potrebbero essere già presenti nel modello; un ragionamento aggiuntivo può talvolta aiutare ad assemblarli correttamente.
Perché DeepSeek V4 Flash ha battuto V4 Pro una volta con lo stesso prompt del Pellicano
Un confronto precedente di DeepSeek V4 aveva prodotto un altro risultato controintuitivo.
Fonte: Il confronto di DeepSeek V4 di Simon Willison.
La versione Flash ha prodotto una bicicletta eccellente secondo gli standard del Pelican-Test: un telaio riconoscibile, una catena visibile, un catarifrangente, ali che raggiungono il manubrio e zampe sui pedali.
Il modello Pro ha mantenuto una bicicletta ragionevole, ma ha generato un pellicano molto più strano, con un corpo sovradimensionato e un'anatomia incoerente.
Questo non dovrebbe essere interpretato come una prova del fatto che Flash sia generalmente più intelligente di Pro.
Dimostra qualcosa di più circoscritto e utile:
Le dimensioni del modello e la reputazione nei benchmark non garantiscono il risultato migliore con un singolo prompt di programmazione visiva stocastico.
GLM-5.3-Flash vs DeepSeek V4 Flash: cosa succede quando i modelli ricevono degli strumenti?
GLM-5.3-Flash introduce un tipo diverso di esperimento del Pellicano.
Un confronto della community ha utilizzato un ambiente agentico anziché il semplice test su una riga. Sia GLM-5.3-Flash sia una configurazione sperimentale di DeepSeek V4 Flash con visione sono stati eseguiti con OpenCode, Trellis, Chrome MCP e il ragionamento Max.
L'istruzione chiedeva ai modelli di creare una pagina HTML completa contenente un'animazione SVG 2D e diceva esplicitamente di trattare l'attività come una competizione.
Questo cambia ciò che viene misurato.
Il modello non si limita più a produrre un solo SVG da un singolo prompt. Può dedicare più tempo, utilizzare strumenti, esaminare un ambiente browser e comportarsi più come un agente di programmazione.
GLM-5.3-Flash Pellicano animato
Animazione GLM-5.3-Flash prodotta utilizzando OpenCode, Trellis, Chrome MCP e il ragionamento massimo. Fonte: confronto originale della community.
Il risultato di GLM è notevolmente più ambizioso rispetto ai pellicani statici mostrati sopra. Contiene una scena completa, componenti espliciti della bicicletta, movimento, pedali e una presentazione più ricca a livello di pagina.
I commentatori della community hanno generalmente preferito il risultato di GLM, indicando in diversi casi il lavoro più completo sui pedali e sull'animazione.
Sono ancora visibili degli errori. Alcuni movimenti delle zampe sembrano innaturali dal punto di vista meccanico, e aggiungere più animazioni aumenta le possibilità che le relazioni tra gli elementi si spezzino.
Questo introduce una distinzione utile:
Un risultato più ricco di funzionalità non è automaticamente un risultato fisicamente più corretto.
Pellicano animato con DeepSeek V4 Flash Vision
Esperimento visivo di DeepSeek V4 Flash generato nello stesso ambiente assistito da strumenti. Fonte: metodologia e discussione del test della community.
La versione di DeepSeek adotta un approccio diverso, utilizzando una composizione al tramonto e una presentazione responsive più pulita.
Il feedback della community ha generalmente favorito la completezza meccanica di GLM, riconoscendo a DeepSeek il merito della composizione visiva e della presentazione su dispositivi mobili.
Ancora più importante, entrambi i risultati dimostrano quanto rapidamente cambi il significato di un benchmark di IA quando vengono introdotti degli strumenti.
Il sistema sottoposto al test è ora:
- il modello di base,
- configurazione del ragionamento,
- ambiente dell'agente,
- strumenti del browser,
- feedback visivo,
- tempo di esecuzione,
- e strategia di iterazione.
Definire semplicemente il risultato come «GLM contro DeepSeek» nasconde gran parte di ciò che ha effettivamente prodotto l'artefatto.
Perché i pellicani generati in un'unica risposta e le animazioni assistite da agenti non dovrebbero condividere una sola classifica
Questa distinzione è abbastanza importante da dover essere esplicitata.
| Test | Cosa misura principalmente |
|---|---|
| Prompt SVG di una sola riga | Ragionamento del modello, generazione SVG e coordinamento spaziale in un'unica risposta |
| Maggiore impegno di ragionamento | Se un'inferenza aggiuntiva contribuisce a correggere geometria e relazioni |
| Animazione al secondo passaggio | Se un modello è in grado di preservare una composizione esistente introducendo al contempo il movimento |
| Agente + Chrome MCP | Modello, ambiente di test, strumenti, ciclo di feedback e programmazione iterativa insieme |
Un'animazione assistita da un agente è probabilmente più rilevante per i moderni flussi di lavoro di programmazione rispetto a un SVG generato in un'unica risposta.
Ma è un test diverso.
Se GPT-6 Astra riceve una risposta mentre GLM ha a disposizione venti minuti, un browser e un feedback visivo, non possiamo affermare responsabilmente che l'animazione finale dimostri che GLM sia migliore nel benchmark originale.
Ciò che dimostra è che i modelli diventano sostanzialmente più capaci quando vengono inseriti in sistemi in grado di ispezionare, eseguire e rivedere il proprio lavoro.
Quale modello di IA ha davvero superato il test della bicicletta con il pellicano?
Non esiste un vincitore unico scientificamente difendibile, ma i risultati attuali rivelano diversi punti di forza per categoria.
| Categoria | Punto di forza | Perché |
|---|---|---|
| Miglioramento di base più significativo | GPT-6 Astra | Un ragionamento ridotto produce già un notevole miglioramento rispetto alla famiglia GPT-5.6 |
| Geometria ad alto impegno più intenzionale | Claude Fable 5.1 Max | Il ragionamento esplicito ha corretto il pilota, la forcella e le relazioni tra gli oggetti |
| Stile visivo più marcato | Gemini 3.8 Flash | Trasforma il prompt minimale in un'illustrazione altamente elaborata |
| Risultato locale più impressionante | Qwen 3.8 27B | Un modello locale quantizzato di circa 17 GB produce una geometria insolitamente coerente |
| Risultato sparse-MoE più interessante | Qwen 3.8 Flash-Next | Composizione solida nonostante circa 6 miliardi di parametri attivi per token |
| Caso di ragionamento più estremo | Kimi K3 | Più di 13.000 token di ragionamento per un prompt minuscolo |
| Miglior esempio di riparazione tramite ragionamento | DeepSeek V4 Flash | Un ragionamento elevato migliora drasticamente una bicicletta predefinita difettosa |
| Maggiore variabilità dell'output | DeepSeek V4 Pro | Low, Medium e High producono strategie visive radicalmente diverse |
| Animazione assistita da strumenti più ambiziosa | GLM-5.3-Flash | Crea un artefatto HTML animato più ricco quando gli vengono forniti un ambiente da agente e strumenti per il browser |
Se la domanda è semplicemente quale modello attuale produca il Pelican più convincente in un solo passaggio con un ragionamento minimo, GPT-6 Astra è difficile da ignorare.
Se la domanda è quale risultato sia più sorprendente per un hardware che può stare davvero su una scrivania ed eseguire il modello localmente, Qwen 3.8 27B diventa molto più importante.
Se il test passa dalla generazione in un solo passaggio a un flusso di lavoro da agente di coding con strumenti e iterazioni, GLM-5.3-Flash dimostra quanto possa diventare diverso il limite massimo.
Sono tre domande diverse, ed è proprio per questo che un unico vincitore numerico nasconderebbe più di quanto spiegherebbe.
Questi modelli di IA capiscono davvero ciò che disegnano?
Il Pelican Bicycle Test non può dimostrare una genuina comprensione fisica.
Un modello può generare una bicicletta dall'aspetto corretto perché il suo addestramento gli ha fornito rappresentazioni potenti di biciclette, uccelli, codice SVG e composizioni visive comuni.
Coordinare con successo queste rappresentazioni è una prova di competenza spaziale utile.
Ciò non dimostra che il modello comprenda equilibrio, gravità, carico meccanico, movimento dei pedali o locomozione nello stesso modo di un essere umano.
I difetti rimanenti lo rendono particolarmente evidente.
Astra può creare una bicicletta attraente pur continuando a posizionare entrambe le gambe in modo errato attorno al telaio. Le ruote animate di Claude possono rivelare problemi di movimento invisibili nell'SVG statico. Qwen può impiegare 22.000 token di ragionamento per costruire una scena che un altro modello produce molto più velocemente. DeepSeek può produrre una bicicletta difettosa a un livello di ragionamento e una coerente a un altro.
Questi modelli stanno diventando eccellenti nel costruire strutture visive a partire dal linguaggio.
Che ciò debba essere descritto come «comprensione» dipende dal livello di rappresentazione interna che richiediamo alla parola.
Perché i modelli cinesi open sono la parte più interessante di questo test
Il cambiamento più importante rispetto alle versioni precedenti del Pelican Test potrebbe non essere che GPT-6 produca un uccello migliore.
È che i modelli aperti e implementabili localmente stanno ora producendo risultati che, fino a tempi sorprendentemente recenti, sarebbero sembrati di livello frontier.
Qwen 3.8 27B può generare localmente un pellicano coerente a partire da un modello quantizzato di circa 17 GB. Qwen 3.8 Flash-Next combina un'ampia capacità MoE complessiva con un calcolo attivo molto inferiore. DeepSeek V4 Flash può riprendersi da un risultato visivo errato quando viene abilitato un ragionamento aggiuntivo. GLM-5.3-Flash può operare all'interno di un ciclo di agente di programmazione dotato di browser e produrre un sofisticato artefatto animato.
Niente di tutto questo significa che abbiano universalmente raggiunto GPT-6 Astra o Claude Fable 5.1.
Significa che il divario sta diventando specifico del carico di lavoro.
Per i problemi di ragionamento più difficili, i modelli cloud di frontiera possono ancora avere un vantaggio netto.
Per la generazione strutturata, la programmazione, i flussi di lavoro privati e gli agenti locali sempre più sofisticati, la domanda sta diventando meno scontata.
Il Pelican Test visualizza accidentalmente la stessa tendenza in atto nell'IA locale: la frontiera continua ad avanzare, ma il livello di capacità disponibile al di fuori della frontiera avanza quasi altrettanto rapidamente.
Cosa dovremmo imparare dai pellicani?
Il risultato più evidente non è che una IA abbia finalmente imparato come dovrebbe andare in bicicletta un pellicano.
È che la qualità di base degli artefatti visivi generati dal codice sta crescendo rapidamente, mentre le differenze tra i modelli diventano sempre più sottili.
GPT-6 Astra dimostra che una solida generazione visiva strutturata può ora emergere anche con un livello di ragionamento Basso. Claude Fable 5.1 dimostra quanto calcolo aggiuntivo si possa dedicare alla correzione della geometria. Gemini 3.8 Flash mostra quanto una composizione estetica efficace possa influenzare il giudizio umano. Qwen 3.8 27B mostra ciò che è possibile con un'implementazione locale compatta. Kimi K3 mette in luce il costo nascosto del ragionamento intensivo, mentre DeepSeek dimostra quanto le singole generazioni visive possano ancora rimanere instabili.
GLM-5.3-Flash aggiunge l'ultimo tassello: quando un modello riceve strumenti per il browser, feedback visivo e il permesso di iterare, il benchmark inizia a misurare un sistema di IA anziché un modello isolato.
Questo rende il Pelican Bicycle Test meno utile come classifica e più utile come microscopio.
Mette in luce la differenza tra:
- un modello in grado di scrivere SVG validi,
- un modello in grado di mantenere le relazioni spaziali,
- un modello in grado di dedicare più ragionamento alla correzione degli errori,
- un modello locale in grado di avvicinarsi a un risultato dall'aspetto di frontiera,
- e un sistema ad agenti in grado di ispezionare e migliorare il proprio artefatto.
GPT-6 Astra potrebbe attualmente produrre uno dei migliori pellicani, ma la storia più importante è che Claude, Gemini, Qwen, DeepSeek, Kimi e GLM ora falliscono — e riescono — in modi sempre più sofisticati.
L'uccello è ancora ridicolo. Il benchmark è imperfetto. Ma, come istantanea visiva della rapidità con cui sta cambiando il comportamento dei modelli, il Pelican Bicycle Test rimane sorprendentemente rivelatore.
Hub Tecnologico e AI
Altro da leggere

Perché Immich rielabora i dati esistenti dopo un aggiornamento?
Immich potrebbe rielaborare gli asset quando un aggiornamento rende non più validi derivati, metadati, modelli o lo stato dei processi precedenti; un’elaborazione ripetuta e...

Quali dipendenze determinano più spesso il reale limite delle prestazioni di Immich?
Immich è limitato dalla dipendenza più lenta di ogni percorso misurato, quindi caricamento, ricerca, navigazione e riproduzione possono avere limiti diversi.

Rete di Immich: come rilevamento, DNS e routing garantiscono la raggiungibilità
Immich è raggiungibile solo quando la selezione dell’endpoint, il DNS, il routing, il NAT o la gestione del proxy, il TLS e la risposta...

