GPT-6 Astra produce uno de los Pelícanos más convincentes hasta ahora, pero la prueba de la bicicleta del Pelícano se vuelve más interesante al compararla con Claude Fable 5.1, Gemini 3.8 Flash, Qwen 3.8, DeepSeek V4, Kimi K3 y GLM-5.3-Flash. Una solicitud de una sola línea para generar un SVG de un pelícano montando en bicicleta obliga a un modelo de lenguaje a traducir palabras en código, geometría, anatomía, relaciones entre objetos y una escena cuyos errores resultan inmediatamente visibles.
Los resultados más recientes muestran que no hay un ganador claro. GPT-6 Astra eleva el nivel mínimo de calidad, Claude puede dedicar mucho más razonamiento a reparar la geometría, Gemini aporta un pulido visual excepcional, Qwen demuestra hasta dónde pueden llegar los modelos locales, y DeepSeek demuestra cuánto pueden cambiar los ajustes de razonamiento la salida de un mismo modelo. Las animaciones de GLM y DeepSeek asistidas por herramientas revelan algo diferente: cuando un agente puede inspeccionar e iterar sobre su propio artefacto, la prueba deja de medir únicamente el modelo.
Resultados de un vistazo de la prueba de la bicicleta del Pelícano
| Modelo | Tipo de prueba | Lo más destacable | Principal inconveniente |
|---|---|---|---|
| GPT-6 Astra | SVG estándar, de Low a Max | Base de referencia muy sólida; Low ya superaba visualmente a la anterior familia GPT-5.6 | Por debajo de Max, la colocación de las piernas alrededor del cuadro de la bicicleta seguía siendo incoherente |
| Claude Fable 5.1 | SVG estándar + pasada de animación independiente | Max produjo una composición muy deliberada, con una interacción sólida entre el ciclista y la bicicleta | Max tardó casi 14 minutos y costó mucho más que Low |
| Gemini 3.8 Flash | SVG estándar, de bajo a alto | Pulido visual excepcional y coherencia decorativa | El atractivo visual no equivale a corrección física |
| Qwen 3.8 27B | SVG estándar local | Uno de los Pelícanos más logrados generados por un modelo local de aproximadamente 17 GB | El razonamiento xhigh predeterminado consumió más de 22.000 tokens de razonamiento |
| Qwen 3.8 Flash-Next | SVG estándar local | Escena impactante de un MoE de 125B con aproximadamente 6B de parámetros activos | El resultado local depende en gran medida de la cuantización y del hardware disponible |
| Qwen 3.8 Max | SVG estándar / modelo más grande | Interacción limpia entre el ciclista y la bicicleta, con una composición pulida | Es un modelo mucho más grande, por lo que no es una comparación justa de hardware local |
| Kimi K3 | SVG estándar | Resultado coherente a partir de un prompt extremadamente corto | Usó más de 13.000 tokens de razonamiento |
| DeepSeek V4 Pro 0813 | SVG estándar, de bajo a alto | Los niveles de razonamiento produjeron estrategias visuales radicalmente diferentes | La alta variabilidad hace que una sola captura de pantalla sea un resumen deficiente del modelo |
| DeepSeek V4 Flash 0731 | SVG estándar | Un razonamiento intenso reparó una bicicleta predeterminada muy defectuosa | La mejora del razonamiento fue drástica, pero no garantizada |
| GLM-5.3-Flash | HTML/SVG animado con asistencia de un agente | Animación detallada, pedales, controles de escena y trabajo visual iterativo | Chrome MCP y un entorno de agente hacen que no sea comparable con las pruebas de una sola ejecución |
Esto no es una clasificación científica. Las ejecuciones públicas se realizaron en momentos distintos, con API, configuraciones de razonamiento, cuantizaciones y, en algunos casos, entornos de herramientas diferentes.
La comparación más defendible es conductual. ¿Tiene la bicicleta un cuadro coherente? ¿Llegan los pies a los pedales? ¿Interactúa realmente el ave con el manillar? ¿El razonamiento adicional corrige esas relaciones o simplemente añade más decoración?
¿Qué mide realmente la prueba de la bicicleta con pelícano?
El mensaje original es deliberadamente minimalista:
Genera un SVG de un pelícano montando en bicicleta.
Producir una respuesta convincente requiere que varias capacidades funcionen simultáneamente. El modelo debe escribir SVG válido, construir una bicicleta reconocible, aproximar la anatomía de un pelícano, colocar el ave en la parte correcta de la escena y hacer que los objetos independientes interactúen de forma visualmente plausible.
Esto hace que la prueba sea útil para observar:
- generación de código SVG y frontend,
- geometría de los objetos,
- composición espacial,
- coherencia anatómica,
- interacción entre objetos,
- seguimiento de instrucciones,
- y la eficiencia del esfuerzo de razonamiento.
No mide directamente la precisión factual, el razonamiento científico, la programación a escala de repositorio, la fiabilidad de los agentes, los conocimientos profesionales ni la inteligencia general.
Simon Willison, que ha utilizado repetidamente el mensaje en distintas generaciones de modelos, también se ha vuelto más cauteloso al respecto. Ahora lo considera principalmente una prueba conductual rápida y una forma útil de comparar versiones dentro de la misma familia de modelos, más que una referencia universal de inteligencia.
Su análisis de Kimi K3 sobre Pelican advierte explícitamente que no se deben tratar resultados individuales de Pelican como una clasificación seria de modelos.
Esa limitación es importante porque los modelos modernos ya son lo bastante buenos como para que el gusto visual influya cada vez más en el resultado. Cuando cada resultado contiene un ave y una bicicleta reconocibles, una puesta de sol hermosa o una cesta de pescado puede hacer que una imagen parezca más inteligente, aunque otro modelo tenga una geometría más precisa.
¿Cómo se desempeñó GPT-6 Astra en la prueba de la bicicleta con pelícano?
El resultado más importante de GPT-6 Astra no es simplemente que Máximo resulte impresionante. Es que Bajo ya produce un Pelican mucho más potente que la familia GPT-5.6 anterior.
Willison probó Astra con niveles de razonamiento Bajo, Medio, Alto, XAlto y Máximo. Sus recuentos registrados de tokens de salida aumentaron de 1.906 en Bajo a 12.638 en Máximo.
| Razonamiento de Astra | Tokens de salida | Tiempo |
|---|---|---|
| Prueba de la bicicleta Pelícano con razonamiento Bajo de DeepSeek V4 Pro | 1,906 | $0.0955 |
| Prueba de la bicicleta Pelícano con razonamiento Medio de DeepSeek V4 Pro | 2,560 | $0.1282 |
| Prueba de la bicicleta Pelícano con razonamiento Alto de DeepSeek V4 Pro | 3,671 | $0.1837 |
| ~0,13 $ | 6,766 | $0.3385 |
| Max | 12,638 | $0.6321 |
La observación más contundente de Willison fue que Astra en nivel Bajo se veía mejor que cualquier Sol Pelican de GPT-5.6 que hubiera generado con cualquier nivel de razonamiento. Esto hace que la cuestión tenga menos que ver con el razonamiento Máximo y más con un aumento generacional de la capacidad visual básica de programación.
The bicycle becomes more coherent, the pelican becomes recognizably integrated with the vehicle, and the whole scene requires less interpretation from the viewer.
La bicicleta se vuelve más coherente, el pelícano se integra de forma reconocible con el vehículo y toda la escena requiere menos interpretación por parte del espectador.
Pero la tarea aún no está resuelta a la perfección. Por debajo de Max, Astra no colocó de forma fiable las dos patas en lados opuestos del cuadro de la bicicleta.
Precisamente por eso este absurdo referente sigue siendo útil. Un resultado pulido puede dar una impresión inmediata de competencia, mientras que una pequeña relación, como la colocación de las patas, revela si la escena es coherente estructuralmente.
Astra parece comprender mejor la composición, pero la prueba de Pelican no puede establecer que mantenga un modelo físico similar al humano para montar en bicicleta.
GPT-6 Astra también apareció en la demostración para desarrolladores de OpenAI
La presentación para desarrolladores de GPT-6 Astra de OpenAI contiene otra referencia a Pelican mientras muestra una generación visual y 3D más avanzada. No se trata de la misma ejecución controlada de SVG, por lo que debe considerarse evidencia complementaria y no parte de la comparación.
Ejemplo visual complementario de GPT-6 Astra de la presentación para desarrolladores de OpenAI. No debe compararse directamente con la cuadrícula SVG controlada.
Claude Fable 5.1: ¿Pensar más produce un Pelican mejor?
Prueba de Fable 5.1 de Simon Willison
Low y Medium terminaron en aproximadamente 23 segundos y costaron unos diez centavos cada uno. High tardó unos 29,6 segundos.
| Entonces la curva cambió drásticamente. | Razonamiento | Tiempo |
|---|---|---|
| Prueba de la bicicleta Pelícano con razonamiento Bajo de DeepSeek V4 Pro | Coste registrado | 23 segundos |
| Prueba de la bicicleta Pelícano con razonamiento Medio de DeepSeek V4 Pro | 23,8 segundos | 23 segundos |
| Prueba de la bicicleta Pelícano con razonamiento Alto de DeepSeek V4 Pro | ~0,10 $ | 29,6 segundos |
| ~0,13 $ | 7 minutos 51 segundos | $1.83 |
| Max | 13 minutos 54 segundos | $3.30 |
El resultado de Max mejora detalles importantes. Las dos patas están colocadas visiblemente a ambos lados del cuadro de la bicicleta, los pies llegan a los pedales, un ala alcanza el manillar y la geometría de la bicicleta recibe mucha más atención deliberada.
La traza de razonamiento es especialmente reveladora porque Fable reconsideró activamente partes del dibujo. Detectó problemas en la geometría de la horquilla delantera, reconsideró la colocación del casco alrededor del pico y comprobó repetidamente si los elementos decorativos chocarían con el resto de la escena.
Eso nos ofrece una conexión visible poco común entre un razonamiento más profundo y un artefacto más coherente internamente.
Pero la diferencia de coste es enorme.
La pregunta útil no es si Max es mejor. Es si un Pelican de casi 14 minutos tiene suficiente valor como para justificar un coste más de 30 veces superior al de Low.
El Pelican de Claude se animó después en una segunda pasada
La animación pública no fue creada por el prompt original de Pelican. Willison tomó el SVG de Max y se lo envió de nuevo a Fable 5.1 con una instrucción independiente para animar el artefacto existente.
Esa segunda ejecución utilizó 6.121 tokens de entrada y 26.201 tokens de salida, y añadió otro coste registrado de aproximadamente 1,37 $.
Como la animación era una segunda tarea, no debería clasificarse directamente junto a los resultados estáticos de una sola ejecución de los demás modelos. Aun así, resulta útil para mostrar qué ocurre cuando el modelo debe conservar la geometría mientras introduce movimiento.
Mira el pelícano animado original de Claude Fable 5.1.
Gemini 3.8 Flash: ¿Equivale el atractivo visual a una mejor comprensión?
Gemini 3.8 Flash destaca por una razón diferente: hace que la evaluación parezca un trabajo de ilustración en lugar de un ejercicio de geometría.
El resultado High incluye una bicicleta cruiser verde azulado, una bufanda roja con lunares, una cesta para peces, un paseo marítimo y un fondo costero resplandeciente.
Resulta atractivo de inmediato.
Eso convierte a Gemini en un ejemplo útil de un problema de las evaluaciones visuales: los humanos recompensamos naturalmente el estilo.
Una composición más pulida puede parecer más inteligente antes de comprobar si el cuadro de la bicicleta se cierra correctamente, si el pie realmente llega al pedal o si el cuerpo del pelícano está colocado de forma coherente con respecto al sillín.
El acabado visual es una capacidad real, pero el acabado visual y la coherencia física son capacidades distintas.
A medida que mejoran los modelos, la Prueba del Pelícano mide cada vez más ambas cosas. Por eso, las clasificaciones simples de ganadores son menos significativas que examinar las formas específicas en que cada modelo triunfa o falla.
Qwen 3.8 27B: ¿Puede un modelo local de 17 GB competir con los pelícanos de vanguardia?
Qwen 3.8 27B puede ser el resultado más importante para los usuarios de IA local, porque no se trataba de un modelo masivo disponible exclusivamente en la nube.
Willison ejecutó localmente una versión cuantizada Q4_K_M de aproximadamente 17 GB mediante LM Studio, incluidos experimentos en hardware local con mucha memoria.
El resultado es inusualmente coherente para un modelo que puede empaquetarse en un archivo cuantizado de aproximadamente 17 GB.
La bicicleta tiene la forma de cuadro esperada. Las dos patas aparecen en lados opuestos de la bicicleta, una relación sorprendentemente difícil para muchos modelos. El pelícano tiene una bolsa claramente definida, su ala llega hasta el manillar y las líneas de movimiento están colocadas detrás, en lugar de atravesar la escena.
Willison lo describió como el mejor SVG de un pelícano que había generado localmente hasta ese momento.
Pero hay un detalle importante.
Qwen 3.8 27B pensó demasiado en la tarea.
En su nivel de razonamiento xhigh predeterminado, el modelo tardó unos 21 minutos. Utilizó 22.276 tokens de razonamiento antes de producir 3.223 tokens de salida final.
Al desactivar el razonamiento, la generación se redujo a poco más de dos minutos, pero el resultado empeoró notablemente.
La estructura se volvió más débil, las patas no acertaron con los pedales y el modelo ya no hizo un intento serio de conectar el ala con el manillar.
Esto crea una historia casi opuesta a la de GPT-6 Astra.
La característica más impresionante de Astra es que Low ya es potente. Qwen 3.8 27B demuestra cuánta calidad visual puede extraerse de un hardware local relativamente compacto si se permite que el modelo dedique mucho tiempo al razonamiento.
No demuestra que un modelo de 17 GB haya alcanzado a GPT-6 en general. Demuestra que «lo bastante pequeño para ejecutarse localmente» y «capaz de producir una salida estructurada sofisticada» ya no son características mutuamente excluyentes.
Qwen 3.8 Flash-Next: ¿Qué puede dibujar un MoE con 6B de parámetros activos?
Qwen 3.8 Flash-Next aporta un segundo punto de datos de IA local procedente de una arquitectura muy diferente.
El modelo tiene un total de 125 mil millones de parámetros, pero activa aproximadamente 6 mil millones de parámetros por cada token. Esa distinción puede reducir los requisitos de cómputo, aunque el conjunto completo de pesos siga siendo mucho mayor que 6B.
El resultado de xhigh es una escena pulida. El pelícano se sitúa sobre una bicicleta roja, un pez ocupa la cesta delantera y la propia bicicleta mantiene una estructura reconocible en lugar de colapsar en arcos y tubos desconectados.
Lo interesante de este resultado no es si es más bonito que Gemini o Astra.
La cuestión es que los modelos MoE dispersos están haciendo que las comparaciones simples por número de parámetros resulten menos útiles.
Un modelo de 125B con aproximadamente 6B de parámetros activos no se comporta como un modelo denso convencional de 6B, ni tiene las mismas características de almacenamiento y memoria que uno.
El pelícano demuestra el lado de capacidad de esa ecuación: un cómputo activo relativamente bajo aún puede coordinar una escena estructurada sorprendentemente sofisticada.
Qwen 3.8 Max: ¿Qué cambia cuando el modelo se hace mucho más grande?
Qwen 3.8 Max ofrece una comparación útil del extremo superior dentro de la misma familia de modelos en sentido amplio.
El resultado es limpio y fácil de analizar. Las patas llegan a la zona de los pedales, la bicicleta tiene una forma convencional y la escena general sigue siendo lo bastante sencilla como para que la geometría se mantenga legible.
Pero Qwen Max refuerza otra lección de la prueba:
Un modelo más grande no debería recibir automáticamente una puntuación más alta por el mero hecho de ser más grande.
Para la IA local práctica, Qwen 3.8 27B puede ser en realidad el Pelícano más interesante, porque nos dice algo sobre lo que puede ejecutarse en un hardware que un usuario doméstico avanzado podría poseer de forma realista.
Max demuestra un límite del modelo. El resultado local de 27B demuestra avances en la implementación.
Kimi K3: ¿Cuánto razonamiento necesita un solo pelícano?
Kimi K3 produjo otro Pelícano coherente, pero su uso de cómputo oculto puede ser más interesante que la imagen.
El prompt solo tenía unas pocas palabras, pero la ejecución registrada utilizó 95 tokens de entrada y 16.658 tokens de salida.
De esos tokens de salida, 13.241 fueron tokens de razonamiento.
El coste registrado fue de aproximadamente 0,25 $ para esa ejecución.
La escena final es competente: una bicicleta reconocible, un pelícano reconocible, una posición razonable del ciclista, detalles de fondo, carretera y elementos de movimiento.
Pero las cifras revelan algo que la imagen no puede.
Un resultado visualmente sencillo puede ocultar una enorme cantidad de trabajo por parte del modelo.
Esto importa en aplicaciones reales. Un modelo puede parecer económico cuando se evalúa por un único resultado exitoso, pero volverse costoso o lento cuando el mismo patrón de razonamiento se repite cientos de veces dentro del flujo de trabajo de un agente.
Para Kimi, el Pelícano se convierte casi tanto en una prueba de eficiencia del razonamiento como en una prueba de dibujo.
DeepSeek V4 Pro: ¿Por qué los distintos niveles de razonamiento parecen modelos diferentes?
DeepSeek V4 Pro 0813 produjo una de las comparaciones de razonamiento más extrañas del archivo.
Bajo, Medio y Alto no parecían simplemente versiones cada vez más pulidas del mismo diseño. Parecían aplicar estrategias visuales diferentes.
DeepSeek V4 Pro 0813 con razonamiento Bajo, Medio y Alto. Fuente: Prueba de DeepSeek V4 Pro de Simon Willison.
Bajo es relativamente limpio y minimalista. Medio se vuelve mucho más abstracto: dominan los arcos de una rueda rota, un trazo suelto y una extraña forma alargada. Alto cambia de dirección nuevamente, vuelve a una bicicleta roja más convencional y añade una cesta, un banderín y notas musicales.
La lección no es simplemente que «Alto es mejor».
El esfuerzo de razonamiento parece influir en la estrategia visual que elige el modelo, no solo en el cuidado con el que ejecuta una composición fija.
Esto convierte a DeepSeek V4 Pro en un excelente recordatorio de que una sola captura de pantalla es una base muy débil para afirmar que un modelo es bueno o malo en programación visual.
La varianza del muestreo importa. La configuración del razonamiento importa. La API o el entorno de prueba también pueden importar. El Pelícano hace visibles esas diferencias porque podemos inspeccionar el resultado de inmediato.
DeepSeek V4 Flash: ¿Puede un mayor razonamiento reparar una bicicleta rota?
DeepSeek V4 Flash 0731 ofrece un ejemplo aún más claro de cómo el razonamiento afecta a la geometría.
La ejecución predeterminada produjo una bicicleta gravemente deformada. Las ruedas aparecían como arcos incompletos, los tubos del cuadro flotaban sin conectarse y el pelícano flotaba sobre la escena en lugar de conducirla de forma convincente.
Willison aumentó entonces el esfuerzo de razonamiento a High utilizando la misma tarea básica.
El resultado cambió drásticamente.
El resultado High tiene ruedas completas, un cuadro reconocible, una zona de la biela, un pelícano agarrado al manillar y una pata colocada cerca del pedal.
Esto no demuestra que un mayor razonamiento siempre solucione la generación visual.
Esto sugiere que algunos resultados SVG deficientes son fallos de coordinación, más que una prueba de que el modelo carezca por completo de una representación de la geometría de una bicicleta.
Es posible que las piezas ya existan dentro del modelo; un razonamiento adicional a veces puede ayudar a ensamblarlas correctamente.
Por qué DeepSeek V4 Flash superó en una ocasión a V4 Pro con el mismo mensaje sobre el pelícano
Una comparación anterior de DeepSeek V4 produjo otro resultado contraintuitivo.
Fuente: La comparación de DeepSeek V4 de Simon Willison.
La versión Flash produjo una bicicleta excelente según los estándares de Pelican-Test: un cuadro reconocible, una cadena visible, un reflector, alas que llegaban hasta el manillar y patas sobre los pedales.
El modelo Pro conservó una bicicleta razonable, pero generó un pelícano mucho más extraño, con un cuerpo sobredimensionado y una anatomía incoherente.
Esto no debe interpretarse como evidencia de que Flash sea, en general, más inteligente que Pro.
Demuestra algo más específico y útil:
El tamaño del modelo y su reputación en las pruebas de referencia no garantizan el mejor resultado a partir de un único mensaje estocástico de programación visual.
GLM-5.3-Flash frente a DeepSeek V4 Flash: ¿qué ocurre cuando los modelos obtienen herramientas?
GLM-5.3-Flash presenta un tipo diferente de experimento con pelícanos.
Una comparación de la comunidad utilizó un entorno de agente en lugar de la sencilla prueba de una sola línea. Tanto GLM-5.3-Flash como una configuración experimental de visión de DeepSeek V4 Flash se ejecutaron con OpenCode, Trellis, Chrome MCP y el razonamiento Max.
La instrucción pedía a los modelos crear una página HTML completa que contuviera una animación SVG en 2D y les indicaba explícitamente que trataran la tarea como una competición.
Eso cambia lo que se está midiendo.
El modelo ya no se limita a producir un SVG a partir de un solo mensaje. Puede dedicar más tiempo, utilizar herramientas, inspeccionar un entorno de navegador y comportarse más como un agente de programación.
Pelícano animado de GLM-5.3-Flash
Animación de GLM-5.3-Flash producida con OpenCode, Trellis, Chrome MCP y razonamiento máximo. Fuente: comparación original de la comunidad.
El resultado de GLM es considerablemente más ambicioso que los pelícanos estáticos anteriores. Contiene una escena completa, componentes explícitos de la bicicleta, movimiento, pedales y una presentación más rica a nivel de página.
Los comentaristas de la comunidad prefirieron en general el resultado de GLM y varios señalaron que el trabajo de pedaleo y animación era más completo.
Todavía hay errores visibles. Algunos movimientos de las patas parecen mecánicamente poco naturales, y añadir más animación crea más oportunidades de que las relaciones se rompan.
Esto establece una distinción útil:
Un resultado con más funciones no es automáticamente un resultado físicamente más correcto.
Pelícano animado con visión de DeepSeek V4 Flash
Experimento de visión de DeepSeek V4 Flash generado en el mismo entorno asistido por herramientas. Fuente: metodología y debate de la prueba comunitaria.
La versión de DeepSeek adopta un enfoque diferente, con una composición de atardecer y una presentación adaptable más limpia.
Los comentarios de la comunidad favorecieron en general la integridad mecánica de GLM, aunque reconocieron a DeepSeek el mérito por la composición visual y la presentación móvil.
Más importante aún, ambos resultados demuestran lo rápido que cambia el significado de una prueba de IA cuando se introducen herramientas.
El sistema que se está evaluando ahora es:
- el modelo base,
- la configuración del razonamiento,
- el entorno del agente,
- las herramientas del navegador,
- la retroalimentación visual,
- el tiempo de ejecución,
- y la estrategia de iteración.
Llamar al resultado simplemente «GLM frente a DeepSeek» oculta gran parte de lo que realmente produjo el artefacto.
Por qué los pelícanos generados de una sola vez y las animaciones asistidas por agentes no deberían compartir una misma clasificación
Esta distinción es lo bastante importante como para hacerla explícita.
| Prueba | Lo que mide principalmente |
|---|---|
| Indicación de SVG de una sola línea | Razonamiento del modelo, generación de SVG y coordinación espacial en una sola respuesta |
| Mayor esfuerzo de razonamiento | Si una inferencia adicional ayuda a reparar la geometría y las relaciones |
| Animación en una segunda pasada | Si un modelo puede conservar una composición existente mientras introduce movimiento |
| Agente + Chrome MCP | Modelo, entorno de evaluación, herramientas, ciclo de retroalimentación y programación iterativa en conjunto |
Podría decirse que una animación sólida asistida por un agente es más relevante para los flujos de trabajo modernos de programación que un SVG generado de una sola vez.
Pero es una prueba diferente.
Si GPT-6 Astra recibe una respuesta mientras GLM dispone de veinte minutos, un navegador y retroalimentación visual, no podemos afirmar responsablemente que la animación final demuestre que GLM es mejor en la prueba original.
Lo que demuestra es que los modelos se vuelven mucho más capaces cuando se integran en sistemas que pueden inspeccionar, ejecutar y revisar su propio trabajo.
¿Qué modelo de IA ganó realmente la prueba de la bicicleta pelícano?
No existe un único ganador que pueda defenderse científicamente, pero los resultados actuales sí revelan varios modelos destacados por categoría.
| Categoría | El más destacado | Por qué |
|---|---|---|
| La mejora más sólida de referencia | GPT-6 Astra | Un razonamiento bajo ya produce una mejora importante frente a la familia GPT-5.6 |
| La geometría de mayor elaboración deliberada | Claude Fable 5.1 Max | El razonamiento explícito reparó las relaciones entre el ciclista, la horquilla y el objeto |
| El mayor atractivo visual | Gemini 3.8 Flash | Convierte la instrucción mínima en una ilustración muy elaborada |
| El resultado local más impresionante | Qwen 3.8 27B | Un modelo local cuantizado de aproximadamente 17 GB produce una geometría inusualmente coherente |
| El resultado de MoE disperso más interesante | Qwen 3.8 Flash-Next | Composición sólida pese a contar con aproximadamente 6.000 millones de parámetros activos por token |
| El caso de razonamiento más extremo | Kimi K3 | Más de 13.000 tokens de razonamiento para una instrucción diminuta |
| El mejor ejemplo de reparación mediante razonamiento | DeepSeek V4 Flash | Un razonamiento alto mejora drásticamente una bicicleta defectuosa por defecto |
| La mayor variación en los resultados | DeepSeek V4 Pro | Bajo, Medio y Alto producen estrategias visuales radicalmente distintas |
| La animación asistida por herramientas más ambiciosa | GLM-5.3-Flash | Crea un artefacto HTML animado más completo cuando se le proporciona un entorno de agente y herramientas de navegador |
Si la pregunta es simplemente qué modelo actual produce el Pelícano más sólido en una sola ejecución con un razonamiento mínimo, GPT-6 Astra es difícil de ignorar.
Si la pregunta es qué resultado sorprende más en un hardware que realmente puede estar sobre un escritorio y ejecutarse localmente, Qwen 3.8 27B se vuelve mucho más importante.
Si la prueba pasa de la generación en una sola ejecución a un flujo de trabajo de agente de programación con herramientas e iteración, GLM-5.3-Flash demuestra hasta qué punto puede elevarse el techo.
Son tres preguntas diferentes, y precisamente por eso un único ganador numérico ocultaría más de lo que explicaría.
¿Estos modelos de IA entienden realmente lo que dibujan?
La Prueba de la Bicicleta del Pelícano no puede demostrar una comprensión física genuina.
Un modelo puede generar una bicicleta de aspecto correcto porque su entrenamiento le ha proporcionado representaciones potentes de bicicletas, pájaros, código SVG y composiciones visuales habituales.
Coordinar correctamente esas representaciones es una prueba de competencia espacial útil.
Esto no demuestra que el modelo comprenda el equilibrio, la gravedad, la carga mecánica, el movimiento de los pedales o la locomoción del mismo modo que un ser humano.
Los fallos restantes lo dejan especialmente claro.
Astra puede crear una bicicleta atractiva y, aun así, colocar incorrectamente ambas piernas alrededor del cuadro. Las ruedas animadas de Claude pueden revelar problemas de movimiento que eran invisibles en el SVG estático. Qwen puede dedicar 22.000 tokens de razonamiento a construir una escena que otro modelo produce mucho más rápido. DeepSeek puede producir una bicicleta defectuosa con un nivel de razonamiento y una coherente con otro.
Estos modelos están volviéndose excelentes a la hora de construir estructuras visuales a partir del lenguaje.
Que eso deba describirse como «comprensión» depende del nivel de representación interna que exijamos a la palabra.
Por qué los modelos abiertos chinos son la parte más interesante de esta prueba
El cambio más importante desde las primeras versiones de la Prueba del Pelícano quizá no sea que GPT-6 produzca un pájaro mejor.
Es que los modelos abiertos y desplegables localmente ahora producen resultados que, hasta hace sorprendentemente poco, habrían parecido de nivel puntero.
Qwen 3.8 27B puede generar localmente un pelícano coherente a partir de un modelo cuantizado de aproximadamente 17 GB. Qwen 3.8 Flash-Next combina una gran capacidad total de MoE con un cómputo activo mucho menor. DeepSeek V4 Flash puede recuperarse de un resultado visual defectuoso cuando se habilita un razonamiento adicional. GLM-5.3-Flash puede operar dentro de un ciclo de agente de programación equipado con navegador y producir un artefacto animado sofisticado.
Nada de eso significa que hayan alcanzado universalmente a GPT-6 Astra o Claude Fable 5.1.
Eso significa que la brecha se está volviendo específica de cada carga de trabajo.
Para los problemas de razonamiento más difíciles, los modelos de nube de vanguardia aún pueden tener una ventaja clara.
Para la generación estructurada, la programación, los flujos de trabajo privados y los agentes locales cada vez más sofisticados, la pregunta se está volviendo menos obvia.
La Prueba del Pelícano visualiza accidentalmente la misma tendencia que está ocurriendo en la IA local: la frontera sigue avanzando, pero el nivel de capacidad disponible fuera de ella avanza casi igual de rápido.
¿Qué deberíamos aprender de los pelícanos?
El resultado más claro no es que una IA haya aprendido por fin cómo debería montar en bicicleta un pelícano.
Es que la calidad de referencia de los artefactos visuales generados mediante código está aumentando rápidamente, mientras que las diferencias entre modelos se vuelven más sutiles.
GPT-6 Astra demuestra que una generación visual estructurada y sólida puede aparecer incluso con un nivel bajo de razonamiento. Claude Fable 5.1 demuestra cuánto cómputo adicional puede dedicarse a reparar la geometría. Gemini 3.8 Flash muestra cómo una composición estética sólida puede influir en el juicio humano. Qwen 3.8 27B muestra lo que es posible con una implementación local compacta. Kimi K3 revela el coste oculto de un razonamiento intensivo, mientras que DeepSeek demuestra lo inestables que pueden seguir siendo las generaciones visuales individuales.
GLM-5.3-Flash añade la pieza final: cuando un modelo recibe herramientas de navegador, retroalimentación visual y permiso para iterar, el punto de referencia empieza a medir un sistema de IA, no un modelo aislado.
Eso hace que la Prueba de la Bicicleta y el Pelícano sea menos útil como clasificación y más útil como microscopio.
Pone de manifiesto la diferencia entre:
- un modelo que puede escribir SVG válido,
- un modelo que puede mantener las relaciones espaciales,
- un modelo que puede dedicar más razonamiento a reparar errores,
- un modelo local que puede acercarse a un resultado de aspecto puntero,
- y un sistema de agentes que puede inspeccionar y mejorar su propio artefacto.
GPT-6 Astra puede producir actualmente uno de los pelícanos más logrados, pero la historia más importante es que Claude, Gemini, Qwen, DeepSeek, Kimi y GLM ahora fracasan —y tienen éxito— de formas cada vez más sofisticadas.
El pájaro sigue siendo ridículo. El punto de referencia es imperfecto. Pero, como instantánea visual de la rapidez con la que está cambiando el comportamiento de los modelos, la Prueba de la Bicicleta y el Pelícano sigue siendo sorprendentemente reveladora.
Centro de Tecnología e IA
Más para leer

¿Por qué Immich vuelve a procesar los datos existentes después de una actualización?
Immich puede reprocesar los archivos cuando una actualización invalida derivados, metadatos, modelos o el estado de los trabajos anteriores; el procesamiento interminable y repetido...

¿Qué dependencias suelen limitar realmente el rendimiento de Immich?
Immich está limitado por la dependencia más lenta de cada ruta medida, por lo que la carga, la búsqueda, la navegación y la reproducción...

Redes de Immich: cómo el descubrimiento, el DNS y el enrutamiento permiten la accesibilidad
Immich solo es accesible cuando la selección del endpoint, el DNS, el enrutamiento, la NAT o gestión del proxy, el TLS y la respuesta...

