GPT-6 Astra는 지금까지 가장 설득력 있는 펠리컨 중 하나를 만들어 내지만, Pelican Bicycle Test는 Claude Fable 5.1, Gemini 3.8 Flash, Qwen 3.8, DeepSeek V4, Kimi K3, GLM-5.3-Flash와 비교할 때 더욱 흥미로워집니다. 펠리컨이 자전거를 타는 모습을 SVG로 생성하라는 한 줄짜리 요청은 언어 모델이 단어를 코드, 기하 구조, 해부학적 형태, 객체 간 관계, 그리고 실수가 즉시 드러나는 장면으로 변환하도록 요구합니다.
최신 결과는 단순한 승자가 없다는 것을 보여 줍니다. GPT-6 Astra는 품질의 하한선을 끌어올렸고, Claude는 훨씬 더 많은 추론을 사용해 기하 구조를 크게 개선할 수 있으며, Gemini는 뛰어난 시각적 완성도를 더하고, Qwen은 로컬 모델이 얼마나 가까이 따라갈 수 있는지를 보여 주며, DeepSeek는 추론 설정이 하나의 모델 출력에 얼마나 큰 변화를 줄 수 있는지를 보여 줍니다. 도구의 지원을 받는 GLM과 DeepSeek의 애니메이션은 또 다른 점을 드러냅니다. 에이전트가 자신의 결과물을 직접 검사하고 반복해서 개선할 수 있게 되면, 이 테스트는 더 이상 모델만을 측정하지 않습니다.
펠리컨 자전거 테스트 결과 한눈에 보기
| 모델 | 테스트 유형 | 눈에 띄는 점 | 주요 주의점 |
|---|---|---|---|
| GPT-6 Astra | 표준 SVG, Low에서 Max까지 | 매우 강력한 기준선이며, Low만으로도 이전 GPT-5.6 제품군보다 시각적으로 뛰어났습니다 | Max보다 낮은 설정에서는 자전거 프레임 주변의 다리 배치가 여전히 일관되지 않았습니다 |
| Claude Fable 5.1 | 표준 SVG + 별도 애니메이션 단계 | Max는 라이더와 자전거의 상호작용이 뛰어난, 매우 의도적인 구성을 만들어 냈습니다 | Max는 거의 14분이 걸렸고 Low보다 비용이 크게 더 들었습니다 |
| Gemini 3.8 Flash | 표준 SVG, 낮음에서 높음까지 | 뛰어난 시각적 완성도와 장식적 일관성 | 시각적 화려함이 물리적 정확성과 같은 것은 아닙니다 |
| Qwen 3.8 27B | 로컬 표준 SVG | 약 17GB 규모의 로컬 모델이 생성한 펠리컨 중 가장 뛰어난 결과 중 하나입니다 | 기본 xhigh 추론에서 22,000개가 넘는 추론 토큰을 사용했습니다 |
| Qwen 3.8 Flash-Next | 로컬 표준 SVG | 활성 파라미터가 약 60억 개에 불과한 1,250억 파라미터 MoE에서 강력한 장면을 구현했습니다 | 로컬 결과는 양자화 방식과 사용 가능한 하드웨어에 크게 좌우됩니다 |
| Qwen 3.8 Max | 표준 SVG / 더 큰 모델 | 라이더와 자전거의 상호작용이 자연스럽고 구성이 세련되었습니다 | 훨씬 더 큰 모델이므로 로컬 하드웨어 비교로는 공정하지 않습니다 |
| Kimi K3 | 표준 SVG | 극도로 짧은 프롬프트에서 일관된 결과를 냈습니다 | 13,000개가 넘는 추론 토큰을 사용했습니다 |
| DeepSeek V4 Pro 0813 | 표준 SVG, 낮음에서 높음까지 | 추론 수준에 따라 시각적 전략이 극적으로 달라졌습니다 | 분산이 커서 스크린샷 하나만으로는 모델을 제대로 요약하기 어렵습니다 |
| DeepSeek V4 Flash 0731 | 표준 SVG | 높은 추론 설정이 심하게 망가진 기본 자전거를 복구했습니다 | 추론 능력은 크게 향상되었지만 보장되지는 않았습니다 |
| GLM-5.3-Flash | 에이전트 지원 애니메이션 HTML/SVG | 풍부한 애니메이션, 페달, 장면 제어 및 반복적인 시각 작업 | Chrome MCP와 에이전트 환경을 사용하므로 단일 실행 테스트와 직접 비교할 수 없습니다 |
이는 과학적 순위표가 아닙니다. 공개 실행은 서로 다른 시간에, 서로 다른 API, 추론 설정, 양자화 방식, 그리고 경우에 따라 서로 다른 도구 환경에서 수행되었습니다.
더 타당한 비교는 동작에 기반한 비교입니다. 자전거에 일관된 프레임이 있는가? 발이 페달에 닿는가? 새가 실제로 핸들바와 상호작용하는가? 추가적인 추론이 이러한 관계를 바로잡는가, 아니면 장식만 더하는가?
Pelican Bicycle 테스트는 실제로 무엇을 측정하나?
원래 프롬프트는 의도적으로 간단합니다.
자전거를 타고 있는 펠리컨의 SVG를 생성하세요.
설득력 있는 답변을 생성하려면 여러 능력이 동시에 작동해야 합니다. 모델은 유효한 SVG를 작성하고, 알아볼 수 있는 자전거를 구성하며, 펠리컨의 해부학적 구조를 근사하고, 장면의 올바른 위치에 새를 배치하며, 서로 다른 객체들이 시각적으로 그럴듯하게 상호작용하도록 만들어야 합니다.
따라서 이 테스트는 다음을 관찰하는 데 유용합니다.
- SVG 및 프런트엔드 코드 생성,
- 객체 기하학,
- 공간 구성,
- 해부학적 일관성,
- 객체 간 상호작용,
- 지시 사항 준수,
- 그리고 추론 노력의 효율성도 측정하지 않습니다.
이는 사실 정확성, 과학적 추론, 저장소 규모의 코딩, 에이전트 신뢰성, 전문 지식 또는 일반 지능을 직접 측정하지는 않습니다.
여러 세대의 모델에서 이 프롬프트를 반복적으로 사용해 온 Simon Willison도 이에 대해 더욱 신중해졌습니다. 그는 이제 이 테스트를 주로 빠른 동작 테스트이자 동일한 모델 제품군 내 릴리스를 비교하는 유용한 방법으로 여기며, 보편적인 지능 벤치마크로는 보지 않습니다.
그의 Kimi K3 Pelican 분석은 개별 Pelican 출력을 진지한 모델 순위표로 취급하지 말라고 명시적으로 경고합니다.
이러한 한계는 중요합니다. 최신 모델은 이제 시각적 감각이 결과에 점점 더 큰 영향을 미칠 만큼 충분히 뛰어납니다. 모든 출력에 알아볼 수 있는 새와 자전거가 포함되면, 아름다운 석양이나 생선 바구니 하나만으로도 다른 모델이 더 정확한 기하학을 표현했더라도 한 이미지가 더 똑똑해 보일 수 있습니다.
GPT-6 Astra는 Pelican Bicycle 테스트에서 어떤 성능을 보였나?
GPT-6 Astra의 가장 중요한 결과는 단순히 Max가 인상적이라는 점이 아닙니다. 이전 GPT-5.6 제품군보다 훨씬 뛰어난 Pelican을 Low에서도 이미 생성한다는 점입니다.
Willison은 Low, Medium, High, XHigh, Max 추론 수준에서 Astra를 테스트했습니다. 그가 기록한 출력 토큰 수는 Low의 1,906개에서 Max의 12,638개로 증가했습니다.
| Astra 추론 | 출력 토큰 | 기록된 비용 |
|---|---|---|
| 낮음 | 1,906 | $0.0955 |
| 중간 | 2,560 | $0.1282 |
| 높음 | 3,671 | $0.1837 |
| XHigh | 6,766 | $0.3385 |
| Max | 12,638 | $0.6321 |
Willison이 가장 강하게 관찰한 점은 Astra Low가 자신이 어떤 추론 수준에서 생성한 GPT-5.6 Sol Pelican보다도 더 보기 좋았다는 것입니다. 이는 이 결과가 Max 추론보다는 기본 시각적 코딩 능력이 세대 교체 수준으로 향상된 것에 더 가깝다는 의미입니다.
자전거는 더 일관성 있게 표현되고, 펠리컨은 차량과 하나로 통합된 모습이 분명해지며, 전체 장면을 해석하기 위해 시청자가 들이는 노력이 줄어듭니다.
하지만 이 작업은 여전히 완벽하게 해결되지 않았습니다. Max보다 낮은 Astra에서는 두 다리를 자전거 프레임의 서로 반대편에 안정적으로 배치하지 못했습니다.
바로 그렇기 때문에 이 우스꽝스러운 벤치마크가 여전히 유용합니다. 완성도 높은 결과물은 즉각적인 능력의 인상을 줄 수 있지만, 다리 배치와 같은 작은 관계를 통해 장면이 구조적으로 일관적인지 드러납니다.
Astra는 구성을 더 잘 이해하는 것처럼 보이지만, Pelican Test만으로는 자전거 타기에 대한 인간과 유사한 물리적 모델을 유지한다고 확정할 수 없습니다.
GPT-6 Astra도 OpenAI의 개발자 데모에 등장했습니다
OpenAI의 GPT-6 Astra 개발자 프레젠테이션에는 더 풍부한 시각 및 3D 생성을 시연하는 또 다른 Pelican 사례가 등장합니다. 이는 동일한 통제된 SVG 실행이 아니므로 비교의 일부가 아닌 보충 증거로 다뤄야 합니다.
OpenAI 개발자 프레젠테이션의 보충용 GPT-6 Astra 시각 예시입니다. 통제된 SVG 그리드와 직접 비교해서는 안 됩니다.
Claude Fable 5.1: 더 많이 생각하면 더 나은 Pelican이 만들어질까요?
Claude Fable 5.1은 추가 추론이 기하학적 관계를 개선할 수 있음을 보여주지만, 동시에 단순한 시각 작업의 비용이 얼마나 빠르게 폭증할 수 있는지도 보여줍니다.
Low와 Medium은 각각 대략 23초 만에 완료되었고 비용은 약 10센트였습니다. High는 약 29.6초가 걸렸습니다.
그러다 곡선이 극적으로 달라졌습니다.
| 추론 | 시간 | 기록된 비용 |
|---|---|---|
| 낮음 | 23.8초 | ~$0.10 |
| 중간 | 23초 | ~$0.10 |
| 높음 | 29.6초 | ~$0.13 |
| XHigh | 7분 51초 | $1.83 |
| Max | 13분 54초 | $3.30 |
Max의 결과물은 중요한 세부 사항을 실제로 개선합니다. 두 다리는 자전거 프레임 양쪽에 눈에 띄게 배치되었고, 발은 페달에 닿으며, 한쪽 날개는 핸들바에 닿고, 자전거의 형태에도 훨씬 더 세심한 주의가 기울어졌습니다.
추론 과정은 Fable이 그림의 일부를 적극적으로 재검토했기 때문에 특히 많은 것을 보여줍니다. 앞쪽 포크의 형태에서 문제를 발견하고, 부리 주변의 헬멧 위치를 재검토했으며, 장식 요소가 장면의 다른 부분과 충돌하지 않는지 반복해서 확인했습니다.
이를 통해 더 많은 추론과 내부적으로 더 일관된 결과물 사이의 드문 가시적 연관성을 확인할 수 있습니다.
하지만 비용 차이는 엄청납니다.
유용한 질문은 Max가 더 나은지 여부가 아닙니다. 거의 14분짜리 Pelican이 Low보다 30배 넘는 비용을 정당화할 만큼 가치가 있는지 여부입니다.
Claude의 Pelican은 두 번째 단계에서 애니메이션으로 제작되었습니다
공개 애니메이션은 원래 Pelican 프롬프트로 제작된 것이 아닙니다. Willison은 Max SVG를 가져와 기존 결과물을 애니메이션으로 만들라는 별도의 지시와 함께 Fable 5.1에 다시 보냈습니다.
두 번째 실행에서는 입력 토큰 6,121개와 출력 토큰 26,201개를 사용했으며, 약 1.37달러의 추가 기록 비용이 발생했습니다.
애니메이션은 두 번째 작업이었으므로 다른 모델의 정적 일회성 결과와 직접 비교해 순위를 매겨서는 안 됩니다. 그래도 모델이 움직임을 도입하면서 기하학적 형태를 유지해야 할 때 어떤 일이 일어나는지 보여준다는 점에서 유용합니다.
원본 Claude Fable 5.1 애니메이션 펠리컨 보기.
Gemini 3.8 Flash: 시각적 감각이 더 나은 이해를 의미할까?
Gemini 3.8 Flash는 다른 이유로 돋보입니다. 이 모델은 벤치마크를 기하학 연습이 아니라 일러스트 작업처럼 보이게 만듭니다.
High 결과에는 청록색 크루저 자전거, 빨간 물방울무늬 스카프, 물고기 바구니, 해변 산책로, 빛나는 해변 배경이 포함되어 있습니다.
즉시 눈길을 끕니다.
이는 Gemini가 시각적 벤치마크의 한 가지 문제를 보여주는 유용한 사례가 됩니다. 인간은 자연스럽게 스타일을 높이 평가하기 때문입니다.
더 완성도 높은 구도는 자전거 프레임이 제대로 닫혀 있는지, 발이 실제로 페달에 닿는지, 펠리컨의 몸이 안장에 비해 일관된 위치에 있는지 살펴보기 전에는 더 지능적으로 느껴질 수 있습니다.
시각적 완성도는 실제 능력이지만, 시각적 완성도와 물리적 일관성은 서로 다른 능력입니다.
모델이 발전하면서 Pelican Test는 점점 두 가지를 모두 측정하게 됩니다. 따라서 각 모델이 구체적으로 어떤 방식으로 성공하거나 실패하는지 살펴보는 것이 단순한 순위 매기기보다 의미가 있습니다.
Qwen 3.8 27B: 17GB 로컬 모델이 프런티어 펠리컨과 경쟁할 수 있을까?
Qwen 3.8 27B는 로컬 AI 사용자에게 가장 중요한 결과일 수 있습니다. 이는 거대한 클라우드 전용 모델이 아니었기 때문입니다.
Willison은 LM Studio를 통해 약 17GB 크기의 Q4_K_M 양자화 버전을 로컬에서 실행했으며, 고메모리 로컬 하드웨어를 사용한 실험도 진행했습니다.
약 17GB 크기의 양자화 파일로 패키징할 수 있는 모델의 결과치고는 이례적으로 일관성이 높습니다.
자전거는 예상되는 프레임 형태를 갖추고 있습니다. 두 다리는 자전거의 서로 반대편에 위치해 있는데, 이는 많은 모델에서 놀라울 정도로 구현하기 어려운 관계입니다. 펠리컨에는 뚜렷한 주머니가 있고, 날개는 핸들바까지 닿으며, 움직임을 나타내는 선은 장면을 가로지르지 않고 뒤쪽에 배치되어 있습니다.
Willison은 당시 자신이 로컬에서 생성한 것 중 최고의 Pelican SVG라고 설명했습니다.
하지만 중요한 함정이 있습니다.
Qwen 3.8 27B는 작업을 지나치게 깊이 생각했습니다.
기본 xhigh 추론 수준에서 모델은 약 21분이 걸렸습니다. 최종 출력 토큰 3,223개를 생성하기 전에 22,276개의 추론 토큰을 사용했습니다.
추론을 비활성화하자 생성 시간은 2분을 조금 넘는 수준으로 줄었지만, 출력 결과는 눈에 띄게 나빠졌습니다.
프레임은 약해졌고, 발은 페달을 놓쳤으며, 모델은 더 이상 날개와 핸들바를 연결하려는 진지한 시도조차 하지 않았습니다.
이는 GPT-6 Astra와 거의 정반대의 이야기를 만들어 냅니다.
Astra의 가장 인상적인 특징은 Low도 이미 강력하다는 점입니다. Qwen 3.8 27B는 모델이 충분한 시간을 들여 추론하도록 허용하면, 비교적 소형인 로컬 하드웨어에서 얼마나 높은 시각적 품질을 끌어낼 수 있는지 보여 줍니다.
이는 17GB 모델이 전반적으로 GPT-6를 따라잡았다는 증거가 아닙니다. “로컬에서 실행할 수 있을 만큼 작다”와 “정교한 구조적 출력을 생성할 수 있다”가 더 이상 서로 양립할 수 없는 특성이 아니라는 증거입니다.
Qwen 3.8 Flash-Next: 6B 활성 MoE는 무엇을 그릴 수 있을까?
Qwen 3.8 Flash-Next는 매우 다른 아키텍처에서 나온 두 번째 로컬 AI 데이터 포인트를 제공합니다.
이 모델은 총 1250억 개의 파라미터를 보유하지만, 각 토큰마다 대략 60억 개의 파라미터를 활성화합니다. 전체 가중치 집합은 6B보다 훨씬 크지만, 이러한 차이로 연산 요구량을 줄일 수 있습니다.
xhigh 결과물은 완성도 높은 장면입니다. 펠리컨은 빨간 자전거 위에 앉아 있고, 물고기 한 마리가 앞바구니를 차지하며, 자전거 자체도 서로 단절된 호와 튜브로 무너지지 않고 알아볼 수 있는 구조를 유지합니다.
이 결과가 흥미로운 이유는 Gemini나 Astra보다 더 보기 좋은지 여부가 아닙니다.
희소 MoE 모델이 단순한 파라미터 수 비교의 유용성을 떨어뜨리고 있다는 점입니다.
대략 6B의 활성 파라미터를 사용하는 125B 모델은 일반적인 밀집형 6B 모델처럼 동작하지 않으며, 저장 공간과 메모리 특성도 동일하지 않습니다.
펠리컨은 그 방정식에서 성능 측면을 보여 줍니다. 상대적으로 적은 활성 연산만으로도 놀라울 만큼 정교한 구조적 장면을 조율할 수 있습니다.
Qwen 3.8 Max: 모델이 훨씬 더 커지면 무엇이 달라질까?
Qwen 3.8 Max는 같은 더 넓은 모델 계열 안에서 유용한 상위급 비교 지점을 제공합니다.
결과물은 깔끔하고 파싱하기 쉽습니다. 다리는 페달 영역까지 닿고, 자전거는 전형적인 형태를 갖추며, 전체 장면도 기하 구조를 알아볼 수 있을 만큼 단순하게 유지됩니다.
하지만 Qwen Max는 테스트에서 또 다른 교훈을 강화합니다.
더 큰 모델이라고 해서 크기만으로 자동으로 더 높은 점수를 받아서는 안 됩니다.
실용적인 로컬 AI의 관점에서는 Qwen 3.8 27B가 실제로 더 흥미로운 Pelican일 수 있습니다. 정교한 홈 사용자라면 현실적으로 소유할 수 있는 하드웨어에서 무엇을 실행할 수 있는지 알려 주기 때문입니다.
Max는 모델의 한계를 보여 줍니다. 로컬 27B 결과는 배포 측면의 진전을 보여 줍니다.
Kimi K3: 펠리컨 한 마리에는 얼마나 많은 추론이 필요할까?
Kimi K3는 일관성 있는 또 다른 Pelican을 만들어 냈지만, 그림보다 숨겨진 연산 사용량이 더 흥미로울 수 있습니다.
프롬프트는 몇 단어에 불과했지만, 기록된 실행에서는 입력 토큰 95개와 출력 토큰 16,658개를 사용했습니다.
그 출력 토큰 중 13,241개가 추론 토큰이었습니다.
기록된 비용은 해당 실행에서 약 0.25달러였습니다.
최종 장면은 준수합니다. 알아볼 수 있는 자전거와 펠리컨, 무난한 라이더 배치, 배경 세부 요소, 도로와 움직임을 나타내는 요소가 있습니다.
하지만 수치는 이미지가 보여 주지 못하는 무언가를 드러냅니다.
시각적으로 단순한 결과 뒤에 막대한 양의 모델 측 작업이 숨겨져 있을 수 있습니다.
이는 실제 애플리케이션에서 중요합니다. 한 번의 성공적인 결과만 보면 모델이 저렴해 보일 수 있지만, 에이전트 워크플로에서 같은 추론 패턴을 수백 번 반복하면 비용이 많이 들거나 느려질 수 있습니다.
Kimi에게 Pelican은 그림 테스트인 동시에 추론 효율성 테스트에 가깝습니다.
DeepSeek V4 Pro: 추론 수준에 따라 왜 서로 다른 모델처럼 보일까?
DeepSeek V4 Pro 0813은 아카이브에서 가장 기묘한 추론 비교 중 하나를 만들어 냈습니다.
낮음, 중간, 높음은 단순히 같은 디자인을 점점 더 다듬은 것처럼 보이지 않았습니다. 서로 다른 시각적 전략을 추구하는 것처럼 보였습니다.
낮음, 중간, 높음 추론 설정에서의 DeepSeek V4 Pro 0813. 출처: Simon Willison의 DeepSeek V4 Pro 테스트.
낮음은 비교적 깔끔하고 미니멀합니다. 중간에서는 훨씬 더 추상적으로 변합니다. 부서진 바퀴의 호, 흐트러진 선과 기묘하게 길쭉한 형태가 구도를 지배합니다. 높음에서는 다시 방향을 바꿔 보다 전형적인 빨간 자전거로 돌아가며, 바구니와 페넌트, 음표를 추가합니다.
교훈은 단순히 “높음이 더 낫다”가 아닙니다.
추론 강도는 모델이 하나의 고정된 구도를 얼마나 신중하게 실행하는지만이 아니라, 어떤 시각적 전략을 선택하는지에도 영향을 미치는 것으로 보입니다.
이 점에서 DeepSeek V4 Pro는 스크린샷 하나만으로 모델의 시각적 코딩 능력이 좋다거나 나쁘다고 주장하는 것은 매우 취약한 근거라는 사실을 잘 보여줍니다.
샘플링 분산이 중요합니다. 추론 설정도 중요합니다. API나 하네스도 영향을 줄 수 있습니다. Pelican은 결과를 즉시 확인할 수 있기 때문에 이러한 차이를 눈에 보이게 드러냅니다.
DeepSeek V4 Flash: 더 많은 추론이 고장 난 자전거를 고칠 수 있을까?
DeepSeek V4 Flash 0731은 추론이 구조에 미치는 영향을 더욱 명확하게 보여줍니다.
기본 실행에서는 자전거가 심각하게 변형되었습니다. 바퀴는 불완전한 호처럼 보였고, 프레임 튜브는 서로 연결되지 않은 채 떠 있었으며, 펠리컨은 장면 위에 떠 있어 자전거를 타고 있는 모습이 전혀 설득력 있게 표현되지 않았습니다.
이후 Willison은 동일한 기본 작업에서 추론 수준을 High로 높였습니다.
결과가 극적으로 달라졌습니다.
High 출력에는 완전한 바퀴, 알아볼 수 있는 프레임, 크랭크 부위, 핸들바를 움켜쥔 펠리컨, 페달 근처에 위치한 발이 모두 포함되어 있습니다.
그렇다고 더 많은 추론이 시각적 생성을 항상 개선한다는 뜻은 아닙니다.
이는 일부 잘못된 SVG 결과가 모델에 자전거 구조에 대한 표현이 전혀 없다는 증거가 아니라, 조정 실패일 수 있음을 시사합니다.
구성 요소 자체는 이미 모델 내부에 존재할 수 있으며, 추가 추론이 이를 올바르게 조립하는 데 도움을 주기도 합니다.
동일한 펠리컨 프롬프트에서 DeepSeek V4 Flash가 한때 V4 Pro를 앞선 이유
이전의 DeepSeek V4 비교에서도 또 다른 반직관적인 결과가 나왔습니다.
출처: Simon Willison의 DeepSeek V4 비교.
Flash 버전은 Pelican-Test 기준으로 훌륭한 자전거를 구현했습니다. 알아볼 수 있는 프레임, 보이는 체인, 반사경, 핸들바까지 닿는 날개, 페달 위에 놓인 발이 있었습니다.
Pro 모델은 괜찮은 자전거를 유지했지만, 몸통이 지나치게 크고 해부학적 형태가 일관되지 않은 훨씬 더 기묘한 펠리컨을 생성했습니다.
이를 Flash가 일반적으로 Pro보다 더 똑똑하다는 증거로 해석해서는 안 됩니다.
이는 더 좁지만 더욱 유용한 사실을 보여줍니다.
모델 크기와 벤치마크 평판이 하나의 확률적 시각 코딩 프롬프트에서 최상의 결과를 보장하지는 않습니다.
GLM-5.3-Flash 대 DeepSeek V4 Flash: 모델에 도구를 제공하면 어떻게 될까?
GLM-5.3-Flash는 또 다른 형태의 펠리컨 실험을 선보입니다.
한 커뮤니티 비교에서는 단순한 한 줄 테스트가 아닌 에이전트 환경을 사용했습니다. GLM-5.3-Flash와 실험적인 DeepSeek V4 Flash 비전 설정을 OpenCode, Trellis, Chrome MCP 및 Max 추론과 함께 실행했습니다.
이 지시문은 모델에게 2D SVG 애니메이션이 포함된 완전한 HTML 페이지를 만들도록 요청했으며, 이 작업을 경쟁으로 간주하라고 명시했습니다.
이로 인해 측정 대상이 달라집니다.
이 모델은 이제 하나의 프롬프트에서 SVG 하나만 생성하지 않습니다. 더 많은 시간을 들이고, 도구를 사용하며, 브라우저 환경을 검사하고, 코딩 에이전트처럼 행동할 수 있습니다.
GLM-5.3-Flash 애니메이션 펠리컨
OpenCode, Trellis, Chrome MCP 및 Max 추론을 사용해 생성된 GLM-5.3-Flash 애니메이션. 출처: 원래 커뮤니티 비교.
GLM 결과는 위의 정적인 펠리컨보다 훨씬 더 야심 찬 작업입니다. 완성된 장면, 명시적인 자전거 구성 요소, 움직임, 페달, 더 풍부한 페이지 수준의 프레젠테이션을 포함합니다.
커뮤니티 댓글 작성자들은 대체로 GLM 결과를 선호했으며, 여러 사람이 더 완성도 높은 페달과 애니메이션 작업을 지적했습니다.
여전히 눈에 보이는 실수가 있습니다. 일부 발의 움직임은 기계적으로 부자연스러워 보이며, 애니메이션을 더 추가하면 관계가 깨질 기회도 늘어납니다.
여기서 유용한 구분이 생깁니다:
기능이 더 풍부한 결과가 자동으로 물리적으로 더 정확한 결과를 의미하지는 않습니다.
DeepSeek V4 Flash Vision 애니메이션 펠리컨
동일한 도구 지원 환경에서 생성된 DeepSeek V4 Flash 비전 실험. 출처: 커뮤니티 테스트 방법론 및 논의.
DeepSeek 버전은 석양 구성을 사용하고 더 깔끔한 반응형 프레젠테이션을 제공하는 등 다른 접근 방식을 취합니다.
커뮤니티 피드백은 대체로 GLM의 기계적 완성도를 높이 평가했으며, DeepSeek에는 시각적 구성과 모바일 프레젠테이션을 인정했습니다.
더 중요한 점은 두 결과 모두 도구가 도입되면 AI 벤치마크의 의미가 얼마나 빠르게 달라지는지를 보여 준다는 것입니다.
이제 테스트 대상 시스템은 다음과 같습니다:
- 기반 모델,
- 추론 구성,
- 에이전트 하니스,
- 브라우저 도구,
- 시각적 피드백,
- 실행 시간,
- 그리고 반복 전략.
결과를 단순히 “GLM 대 DeepSeek”라고 부르면 실제로 아티팩트를 만들어 낸 요소 대부분이 가려집니다.
한 번에 생성한 펠리컨과 에이전트의 도움을 받은 애니메이션을 하나의 순위에 함께 두면 안 되는 이유
이 구분은 명확히 밝혀 둘 만큼 중요합니다.
| 테스트 | 주로 측정하는 항목 |
|---|---|
| 한 줄 SVG 프롬프트 | 한 번의 응답에서 모델 추론, SVG 생성, 공간적 조정을 수행 |
| 더 높은 추론 노력 | 추가 추론이 도형과 관계를 수정하는 데 도움이 되는지 |
| 2차 애니메이션 | 모션을 추가하면서 기존 구성을 유지할 수 있는지 |
| 에이전트 + Chrome MCP | 모델, 하니스, 도구, 피드백 루프, 반복 코딩을 모두 결합한 결과 |
에이전트의 도움을 받은 완성도 높은 애니메이션이 한 번에 생성한 SVG보다 현대적인 코딩 워크플로에 더 적합하다고 볼 수도 있습니다.
하지만 이는 다른 테스트입니다.
GPT-6 Astra가 한 번 응답하는 동안 GLM에 20분, 브라우저, 시각적 피드백이 주어진다면, 최종 애니메이션만으로 GLM이 원래 벤치마크에서 더 뛰어나다고 주장하는 것은 무책임합니다.
이 결과가 입증하는 것은 모델이 자신의 작업을 검사하고, 실행하고, 수정할 수 있는 시스템 안에 배치될 때 훨씬 더 뛰어난 능력을 발휘한다는 점입니다.
펠리컨 자전거 테스트에서 실제로 승리한 AI 모델은 무엇일까?
과학적으로 방어 가능한 단일 승자는 없지만, 현재 결과는 여러 범주에서 두드러진 모델을 보여 줍니다.
| 범주 | 두드러진 모델 | 이유 |
|---|---|---|
| 가장 강력한 기준선 향상 | GPT-6 Astra | 낮은 추론만으로도 GPT-5.6 제품군보다 크게 향상된 결과를 냅니다 |
| 가장 공들인 고난도 기하 구조 | Claude Fable 5.1 Max | 명시적 추론을 통해 라이더, 포크 및 사물 간 관계를 수정함 |
| 가장 뛰어난 시각적 감각 | Gemini 3.8 Flash | 최소한의 프롬프트를 고도로 디자인된 일러스트로 변환함 |
| 가장 인상적인 로컬 결과 | Qwen 3.8 27B | 약 17GB로 양자화된 로컬 모델이 이례적으로 일관된 기하 구조를 생성함 |
| 가장 흥미로운 희소 MoE 결과 | Qwen 3.8 Flash-Next | 토큰당 활성 매개변수가 약 60억 개에 불과한데도 뛰어난 구도를 보여 줌 |
| 가장 극단적인 추론 사례 | Kimi K3 | 작은 프롬프트에 13,000개가 넘는 추론 토큰을 사용함 |
| 최고의 추론 기반 수정 사례 | DeepSeek V4 Flash | 높은 추론이 망가진 기본 자전거를 크게 개선함 |
| 가장 높은 출력 변동성 | DeepSeek V4 Pro | Low, Medium, High가 극적으로 다른 시각적 전략을 생성함 |
| 가장 야심 찬 도구 지원 애니메이션 | GLM-5.3-Flash | 에이전트 환경과 브라우저 도구가 주어지면 더 풍부한 애니메이션 HTML 결과물을 구축함 |
단순히 최소한의 추론으로 현재 어떤 모델이 가장 강력한 일회성 Pelican을 생성하는지 묻는다면, GPT-6 Astra는 무시하기 어렵습니다.
실제로 책상 위에 놓고 로컬에서 실행할 수 있는 하드웨어에서 어떤 결과가 가장 놀라운지 묻는다면, Qwen 3.8 27B가 훨씬 더 중요해집니다.
테스트가 일회성 생성에서 도구와 반복 작업을 활용하는 코딩 에이전트 워크플로로 전환되면, GLM-5.3-Flash는 성능의 상한이 얼마나 달라질 수 있는지를 보여 줍니다.
이는 서로 다른 세 가지 질문이며, 바로 그렇기 때문에 단 하나의 수치상 승자를 내세우면 설명하는 것보다 더 많은 것을 감추게 됩니다.
이 AI 모델들은 자신이 그리는 것을 실제로 이해할까?
Pelican Bicycle Test는 진정한 물리적 이해를 증명할 수 없습니다.
모델이 실제로 올바르게 보이는 자전거를 생성하는 이유는 학습 과정에서 자전거, 새, SVG 코드 및 일반적인 시각적 구도에 관한 강력한 표현을 갖추었기 때문일 수 있습니다.
이러한 표현을 성공적으로 조율하는 것은 유용한 공간적 능력의 증거입니다.
이는 모델이 인간과 같은 방식으로 균형, 중력, 기계적 하중, 페달의 움직임 또는 이동을 이해한다는 것을 입증하지 않습니다.
남아 있는 실패 사례는 이를 특히 분명하게 보여 줍니다.
Astra는 매력적인 자전거를 만들면서도 여전히 프레임 주변에 두 다리를 잘못 배치할 수 있습니다. Claude의 애니메이션 바퀴는 정적인 SVG에서는 보이지 않던 움직임 문제를 드러낼 수 있습니다. Qwen은 다른 모델이 훨씬 빠르게 만들어 내는 장면을 구성하는 데 추론 토큰 22,000개를 사용할 수 있습니다. DeepSeek는 한 추론 수준에서는 망가진 자전거를 만들고, 다른 수준에서는 일관된 자전거를 만들 수 있습니다.
이러한 모델은 언어로부터 시각적 구조를 구성하는 데 점점 뛰어난 능력을 보이고 있습니다.
그것을 “이해”라고 설명해야 하는지는 우리가 그 단어에 요구하는 내부 표현의 수준에 달려 있습니다.
이 테스트에서 중국 오픈 모델이 가장 흥미로운 부분인 이유
이전 버전의 Pelican Test 이후 가장 중요한 변화는 GPT-6가 더 나은 새를 만들어 낸다는 점이 아닐 수 있습니다.
핵심은 오픈 모델과 로컬에 배포할 수 있는 모델이 불과 얼마 전만 해도 최첨단급으로 보였을 결과를 이제 만들어 내고 있다는 점이다.
Qwen 3.8 27B는 약 17GB 크기의 양자화 모델만으로 로컬에서 일관된 Pelican을 생성할 수 있다. Qwen 3.8 Flash-Next는 전체 MoE 용량은 크면서도 실제로 사용하는 연산량은 훨씬 적다. DeepSeek V4 Flash는 추가 추론을 활성화하면 망가진 시각적 결과에서 회복할 수 있다. GLM-5.3-Flash는 브라우저가 장착된 코딩 에이전트 루프 안에서 작동하며 정교한 애니메이션 결과물을 생성할 수 있다.
그렇다고 해서 이들이 모든 면에서 GPT-6 Astra나 Claude Fable 5.1을 따라잡았다는 뜻은 아니다.
이는 격차가 작업에 따라 달라지고 있다는 뜻이다.
가장 어려운 추론 문제에서는 최첨단 클라우드 모델이 여전히 분명한 우위를 보일 수 있다.
구조화된 생성, 코딩, 비공개 워크플로, 그리고 점점 더 정교해지는 로컬 에이전트의 경우에는 질문이 덜 분명해지고 있다.
Pelican Test는 로컬 AI 전반에서 일어나고 있는 동일한 추세를 우연히 시각화한다. 최첨단은 계속 전진하지만, 최첨단 밖에서 이용할 수 있는 역량의 수준도 거의 그만큼 빠르게 높아지고 있다.
펠리컨들에게서 우리는 무엇을 배워야 할까?
가장 분명한 결과는 어느 한 AI가 마침내 펠리컨이 자전거를 어떻게 타야 하는지 배웠다는 것이 아니다.
핵심은 코드로 생성된 시각적 결과물의 기준 품질이 빠르게 높아지는 동시에 모델 간 차이가 더욱 미묘해지고 있다는 점이다.
GPT-6 Astra는 낮은 추론 수준에서도 강력한 구조적 시각 생성을 보여 준다. Claude Fable 5.1은 기하 구조를 수정하는 데 얼마나 많은 추가 연산을 사용할 수 있는지 보여 준다. Gemini 3.8 Flash는 뛰어난 미적 구성이 인간의 판단에 얼마나 큰 영향을 줄 수 있는지 보여 준다. Qwen 3.8 27B는 소형 로컬 배포 환경에서 무엇이 가능한지 보여 준다. Kimi K3는 고강도 추론의 숨은 비용을 드러내고, DeepSeek는 개별 시각 생성이 여전히 얼마나 불안정할 수 있는지를 보여 준다.
GLM-5.3-Flash는 마지막 조각을 더한다. 모델이 브라우저 도구와 시각적 피드백을 받고 반복 작업을 수행할 권한까지 갖게 되면, 이 벤치마크는 고립된 모델이 아니라 AI 시스템을 측정하기 시작한다.
따라서 Pelican Bicycle Test는 리더보드로서는 덜 유용하고, 현미경으로서는 더 유용하다.
이는 다음의 차이를 드러낸다.
- 유효한 SVG를 작성할 수 있는 모델.
- 공간적 관계를 유지할 수 있는 모델.
- 추가 추론을 통해 실수를 수정할 수 있는 모델.
- 최첨단 모델을 연상시키는 결과물에 근접할 수 있는 로컬 모델.
- 그리고 자신의 결과물을 검사하고 개선할 수 있는 에이전트 시스템.
GPT-6 Astra가 현재 가장 뛰어난 Pelican 중 하나를 만들어 낼 수 있지만, 더 중요한 점은 이제 Claude, Gemini, Qwen, DeepSeek, Kimi, GLM이 점점 더 정교한 방식으로 실패하고 성공한다는 것이다.
그 새는 여전히 우스꽝스럽다. 벤치마크는 불완전하다. 하지만 모델의 동작이 얼마나 빠르게 변하고 있는지를 보여 주는 시각적 단면으로서 Pelican Bicycle Test는 여전히 놀라울 만큼 많은 것을 드러낸다.
기술 및 AI 허브
더 읽어보기

업그레이드 후 Immich가 기존 데이터를 다시 처리하는 이유는 무엇인가요?
업그레이드로 인해 이전 파생 파일, 메타데이터, 모델 또는 작업 상태가 무효화되면 Immich가 에셋을 다시 처리할 수 있습니다. 반복적으로 작업이 끝없이 실행되는 것은 별도의 문제입니다.

실제 Immich 성능의 한계를 가장 자주 결정하는 종속 요소는 무엇인가?
Immich는 측정된 각 경로에서 가장 느린 종속 요소에 의해 성능 상한이 결정되므로, 업로드·검색·탐색·재생의 성능 한계가 서로 다를 수 있습니다.

Immich 네트워킹: 검색, DNS, 라우팅이 연결 가능성을 만드는 방식
엔드포인트 선택, DNS, 라우팅, NAT 또는 프록시 처리, TLS, 애플리케이션 응답이 하나의 유효한 경로를 구성할 때만 Immich에 연결할 수 있습니다.

