“鹈鹕骑自行车”是AI圈非常流行的非正式基准测试,它最早由Django创始人、开发者Simon Willison在2024年10月发起,最初的指令是「生成一张鹈鹕骑自行车的SVG图片」,后来逐渐成为大家快速检验模型能力的经典测试题。之所以选用这个场景,核心原因有以下几点:
1. 简单指令背后,考验多项核心能力
这个测试看似只有一句话,实则能同时考察模型的多维度能力:
- 空间关系与概念理解:模型不仅要分别识别“鹈鹕”和“自行车”的形态,还要构建二者之间合理的物理交互——比如鹈鹕的肢体如何握住车把、踩踏板,身体重心和自行车结构如何匹配,非常考验空间想象和常识推理。
- 代码生成与结构化能力:最初的测试是生成SVG(可缩放矢量图形),它本质是代码而非位图。模型需要把视觉场景拆解为线条、图形的坐标,输出格式正确、可正常渲染的代码,同时验证了代码逻辑与组织能力。
- 物理与动态一致性:高质量的生成结果需要符合基础运动逻辑,比如肢体与踏板的联动、车轮滚动的合理性;后续延伸到动画、3D场景时,还会进一步考验时序一致性和连续执行能力。
2. 结果直观,好坏一眼可辨
和很多需要专业指标、量化分数的评测不同,鹈鹕骑车的结果零门槛就能判断:鹈鹕形态是否正常、腿和踏板有没有错位、自行车结构有没有穿帮、动作是否合理,普通人一眼就能看出生成质量的高低。
它能非常直观地体现模型能力的差异,甚至能敏锐反映出模型“降智”、推理波动的情况,因此被大家称为AI能力的“体感温度计”。
3. 反常识场景,避免“刷题作弊”
现实中不存在鹈鹕骑自行车的场景,模型的训练数据里几乎没有现成的对应素材。这意味着模型没法靠“记忆”现成的图片/代码来完成任务,必须真正理解概念、自主进行空间组合与推理,能更真实地反映模型的泛化能力,而不是背诵训练数据的能力。
4. 社区传播形成的文化效应
因为测试简单易复刻、对比效果强烈,它很快在全球AI社区流行开来:每次有新模型发布,开发者和用户都会自发用这个测试快速验证实力,社区甚至还举办了专门的“鹈鹕杯”生成大赛。
包括OpenAI在内的厂商在新品发布会上也会用这个案例演示模型能力,进一步让它成为了公认的民间评测标杆,后续还从静态SVG延伸出了动画、Blender 3D生成等更复杂的测试版本。
|