Pelican Test

大模型 SVG 能力演进

同一提示词,看见两年进步

从抽象几何块到会蹬车的鹈鹕,按时间浏览 30 个真实测试节点。

2024.10时间轴起点
30代表节点
57实图与视频
2026.08当前更新

从“画出来”到“关系正确”

选择年份,查看模型如何逐步解决对象、结构、接触关系和运动。

30 个节点

首轮 16 个模型

多数模型只画出了鸟或几何块

固定提示词

模型通常能生成 SVG,也知道鸟或轮子大概长什么样,但无法组织出骑自行车的完整关系。

Claude 3 Opus
Claude 3 Haiku
Claude 3.5 Sonnet · 2024-06-20
Claude 3.5 Sonnet · 2024-10-22
GPT-4o
o1-preview
Gemini 1.5 Flash-002
Gemini 1.5 Flash-8B
Llama 3.1 70B

QwQ 32B Preview

推理变长,构图没有同步解决

固定提示词

较长的推理过程最终仍得到抽象鸟形。这个样本很早就说明,更多推理 token 不保证更好的空间构图。

QwQ 32B Preview

Gemini exp-1206

第一次明显形成完整场景

固定提示词

主体、两个车轮、车架和地面同时出现。画面还不精确,但已经从识别对象跨到组织场景。

Gemini exp-1206

DeepSeek V3

完整场景开始成为常态

回顾样本

鹈鹕、车轮和车架已经在同一画面里,但主体更像叠放,接触关系仍然薄弱。

DeepSeek V3

DeepSeek R1

对象更清楚,物理关系仍脆弱

回顾样本

鹈鹕和自行车更容易辨认,细节也更多,但鸟、车把和脚踏之间仍缺少可信连接。

DeepSeek R1

Claude 3.7 Sonnet

推理模式带来两次可比结果

固定提示词

普通模式与 thinking 模式都画出了完整主体和自行车元素,但局部仍有重复、错位和堆叠。

普通模式
Thinking 模式

Gemini 2.5 Pro

骑车关系开始稳定

固定提示词

问题从有没有自行车,转向车架是否合理、脚是否真正踩在踏板上。

Gemini 2.5 Pro

Claude Sonnet 4 / Opus 4

同代两档模型首次并排

固定提示词

Sonnet 4 的自行车更完整,Opus 4 的车轮缺少辐条。两者都能完成场景,但旗舰档位并没有在这次单样本中明显胜出。

Claude Sonnet 4
Claude Opus 4

Gemini 2.5 Pro Preview 06-05

进入较完整的骑行构图

固定提示词

红色车架、两个轮子和车把相互连接,鹈鹕姿态也更接近骑乘。

Gemini 2.5 Pro Preview 06-05

Claude Opus 4.1

鸟形进步,自行车仍是短板

固定提示词

线稿里的喙和脚踏关系更清楚,但车架形状依然不合理,说明点版本升级没有稳定解决空间结构。

Claude Opus 4.1

GPT-5 系列

自行车结构显著改善

固定提示词

车架、辐条、脚踏、腿部位置和整体比例都明显进步。小模型也能完成场景,但细节并不按规模单调变化。

GPT-5
GPT-5 mini
GPT-5 nano

Claude Sonnet 4.5

Thinking 与普通模式各有缺陷

固定提示词

两次结果都能认出鹈鹕和自行车,但构件连接仍不可靠。Thinking 没有在这次单样本里带来稳定的结构优势。

Thinking 开启
Thinking 关闭

Claude Haiku 4.5

轻量模型也能完成完整场景

固定提示词

圆润的鸟形、两个车轮和地面同时出现。主体更像一般鸟类,但低成本档位已经跨过“完整构图”门槛。

Claude Haiku 4.5

Claude Opus 4.5

细化要求改善物种特征与车架

混合口径

原始提示词下鹈鹕朝向和车架仍有问题;加入繁殖羽、喉囊等要求后,鸟种特征与车架都明显改善,因此单独标记为混合口径。

原始提示词 · high
增强提示词

GPT-5.2

基础任务与细节任务分轨

混合口径

基础提示词已经能生成完整结果。增强提示词增加鸟种、羽毛和喉囊要求,两者不应直接排名。

原始提示词
增强提示词

Claude Opus 4.6

鹈鹕细节成熟,车架仍略扭曲

固定提示词

喙、喉囊和羽毛已经很像鹈鹕,整体观感明显成熟;自行车基本成立,但车架几何仍有轻微错位。

Claude Opus 4.6

Claude Sonnet 4.6

完整但带着稳定的怪异细节

固定提示词

两次尝试都给鹈鹕加了礼帽。展示样本的鸟喙之间多出一根线,车架也发生弯折,完整性不等于关系正确。

Claude Sonnet 4.6

Gemini 3.1 Pro

复杂约束继续增加

混合口径

原始提示词用于纵向比较,增强提示词测试羽毛、喉囊、姿势和场景细节。

原始提示词
增强提示词

GPT-5.4 家族

推理等级并不单调决定画质

固定提示词

同一家族的模型和推理等级组成对照矩阵。高推理通常有帮助,但单次画面并不保证更好。

模型与推理等级矩阵

Claude Opus 4.7

两次尝试都没修好自行车

固定提示词

默认与 max thinking 的鹈鹕都可以辨认,但车架分别以不同方式失真。更多推理没有在这次测试里解决结构问题。

默认推理
Max thinking

Qwen 3.6 27B

本地小模型跨过实用门槛

固定提示词

约 17GB 的本地模型已经画出完整车架、辐条、车把和踩踏姿势,进步不再只属于大型云端模型。

Qwen 3.6 27B 本地运行

Claude Opus 4.8

五档推理展示从鸭到鹈鹕

固定提示词

low、medium、high 更像鸭或鹭,xhigh 才稳定出现鹈鹕特征,max 的鸟形与自行车最完整,也付出了最高的输出成本。

Low
Medium
High
Xhigh
Max

Claude Fable 5

五档推理差异不再只是细节

固定提示词

同一个固定提示词下,五档 effort 在造型、结构和输出成本上形成明显梯度;high 的 token 反而少于 medium,说明推理预算仍不是线性旋钮。

Low
Medium
High
Xhigh
Max

GLM 5.2

从静态构图进入动画 SVG

动画变体

画面结构已经很完整,并且能生成动画。新的难点变成车轮转动时,脚能否持续跟随踏板。

GLM 5.2 动画 SVG

Claude Sonnet 5

自行车成立,物种却退成了鹅

固定提示词

车轮、车架和抓住车把的动作已经连贯,但主体更像白鹅。结构能力成熟后,物种辨识仍会独立失手。

Claude Sonnet 5

GPT-5.6 家族

同一家族内部仍有明显差异

固定提示词

Luna、Terra、Sol 和多档推理等级组成九宫格,展示模型档位、推理预算与采样的共同影响。

GPT-5.6 九宫格

Kimi K3

结果更完整,测试开始失去区分度

固定提示词

场景已经相当连贯,但测试无法代表代理能力和工具调用等差异,也开始面临过度推理和成本问题。

Kimi K3

Claude Opus 5

两次生成暴露渲染兼容性差异

固定提示词

第一版用 SVG use 元素复用轮组,Simon 当时记录为“车轮缺失”,在本站现代浏览器中会显示;第二版改为显式车轮,构图也更稳。

第一次 · 复用轮组
第二次 · 显式轮组

Qwen 3.8 27B

17GB 本地模型继续逼近前沿效果

固定提示词

xhigh 推理得到结构完整的结果,关闭推理则明显松散,直观显示效果、等待时间和本地资源之间的取舍。

xhigh 推理
关闭推理

未公开新模型

效果很好,但模型身份待确认

待确认

原帖没有给出模型名称,讨论中也提到可能见过该测试。这里只展示实际结果,不据此判断排名。

X 视频样本

如何读这条时间轴

它适合感受变化,不替代系统评测。四条记录规则避免把不同任务混成排行榜。

固定提示词作为主线

主线统一使用 “Generate an SVG of a pelican riding a bicycle”。

增强提示词单独标记

加入鸟种、羽毛、背景等要求后,任务已经变化,不能直接横向排名。

动画变体单独标记

动画 SVG 还要处理时间与运动关系,难度不同于静态结果。

未知模型不做结论

只有结果、没有模型和运行信息的样本保留展示,但不参与能力判断。

Claude 覆盖按可追溯样本

Claude 3 Sonnet、Claude 3.5 Haiku 与 Mythos 5 暂未找到可追溯的同提示词原图,因此不补空白节点。