你可能会产生一个疑问:一张简单的“鹈鹕骑自行车”SVG图片,究竟能反映出什么深层次问题?
然而在人工智能领域,这项测试已经悄然演变为评估大语言模型综合能力的非正式标杆。由Simon Willison构思的这个看似幽默的测评方式,从最初仅供个人娱乐的趣味实验,迅速成长为整个AI社区竞相追捧的评估标准。每当有新型号模型问世,Hacker News等技术社区中关于“鹈鹕骑单车”的讨论热度总是居高不下。这种持续高涨的关注度,甚至让部分AI实验室开始认真考虑:是否应当针对这一特定提示词开展专项优化工作?
近期,有研究者针对这一现象展开了系统验证。Dylan Castillo通过一项涵盖1008个样本的大规模对比实验,系统评估了七款顶尖AI模型——包括GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2以及DeepSeek V4 Pro。实验的核心思路十分清晰:通过采用相似但又不完全相同的提示词组合,观察模型的表现是否存在显著差异或能力断层。

核心要点
- 非正式基准的快速崛起:Simon Willison提出的“鹈鹕骑单车”SVG生成提示词,如今已成为衡量大模型实际能力的重要非正式风向标。
- 刷榜嫌疑(Benchmaxxing)备受关注:该测试拥有极高的行业知名度,外界普遍怀疑AI实验室可能针对这一特定提示词进行了模型层面的针对性优化。
- 大规模实验提供有力验证:研究团队通过8种动物与6种交通工具的交叉组合,共生成1008个SVG样本进行系统对比分析,数据基础扎实。
- 覆盖主流前沿模型:测试对象全面涵盖了GPT-5.6 Terra、Claude Sonnet 5等七款业界领先的AI模型,具有较强代表性。
详细分析
从玩笑到行业基准的蜕变之路
近几年来,Simon Willison始终坚持使用同一个提示词——“生成一个鹈鹕骑自行车的SVG”来测试每个主要大语言模型的最新版本。这个最初带着浓厚戏谑色彩的个人行为,如今已演变为AI领域最具知名度的非正式基准测试之一。在Hacker News等主流技术社区,每当有新模型发布,围绕“鹈鹕骑单车”生成结果的讨论往往能迅速成为最热门的话题。这种超乎寻常的关注度,不仅让该测试成为模型能力的直观体现,更逐渐演变为产品宣传和市场推广的重要素材。
实验设计:精准识别“针对性优化”
为了切实验证AI实验室是否存在所谓的“Pelicanmaxxing”(即专门针对鹈鹕提示词进行模型训练)现象,研究团队精心设计了一套严谨的测试矩阵。实验中不仅包含了原始的“鹈鹕+自行车”组合,还引入了形态相似的对象(如火烈鸟、苍鹭),以及完全不同的生物与交通工具组合(如鲸鱼、浣熊分别搭配滑板、飞机等)。如果模型在生成“鹈鹕骑单车”时表现近乎完美,但在处理“火烈鸟骑单车”时却表现欠佳,那么“刷榜”的嫌疑无疑将大幅上升。
利益驱动之下的技术博弈
当前AI领域动辄涉及数十亿乃至万亿美元的资金投入,一个强有力的基准测试结果能够显著提升用户信心与市场评价。在这种巨大利益诱惑的驱使下,AI实验室确实存在强烈的动机去优化那些广为人知的测试案例。本次实验通过OpenRouter平台,调用了包括GPT-5.6 Terra、Claude Sonnet 5、Grok 4.5等在内的全球顶尖模型,在统一温度参数(Temperature 1.0)的条件下生成样本,并由LLM法官进行客观评分,力求真实还原各模型在SVG生成任务上的泛化能力与本质差异。
行业影响
这一现象实际上折射出AI行业评价体系正在发生的深刻转变。随着传统基准测试(如MMLU等)可能面临数据污染风险,像“鹈鹕骑单车”这类非正式、难以预测的视觉生成任务正变得越来越重要。然而,一旦非正式基准变得过于流行,它们也同样面临着被实验室“针对性破解”的潜在风险。这提醒行业需要构建更加多样化、动态化的评估体系,以确保模型能力的提升是真实的泛化进步,而非针对特定提示词的机械记忆与表面优化。
常见问题
问题 1:什么是“Pelicanmaxxing”?
“Pelicanmaxxing”是一个由社区创造的合成词,特指AI实验室为了在Simon Willison著名的“鹈鹕骑单车”SVG测试中获得更佳评价,而专门针对该提示词优化模型表现的行为。它是“Benchmaxxing”(针对基准测试刷榜)在具体场景下的典型表现。
问题 2:为什么选择SVG作为测试媒介?
SVG(可缩放矢量图形)本身是纯文本代码格式,大语言模型可以直接生成。它不仅考验模型的代码编写能力,更能检验模型对空间结构、物体形态以及如何用代码精准描述视觉形象的综合理解能力,具有较高的评估价值。
问题 3:这次测试涉及了哪些模型?
本次测试覆盖了当前最前沿的七款AI模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2以及DeepSeek V4 Pro,基本代表了当前行业的主流技术水平。
