2026年7月22日 - 链接博客
AI实验室是否在刻意训练“鹈鹕骑自行车”?(pelicanmaxxing)(来源链接)这是一项相当扎实的研究成果。Dylan Castillo 全面剖析了一个经常被拿来调侃的问题——AI实验室是否故意让模型生成“鹈鹕骑自行车”的图像,以回应他那套颇受争议的基准测试。
此前也有研究人员进行过随机抽查,例如用其他动物搭配其他交通工具来对比,但从未有任何实验设计像Dylan这样细致入微。
Dylan 选取了8种动物 × 6种交通工具 = 48个提示词,每个提示词重复运行3次,共测试了7个模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro)。随后,他使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助评估结果。
这个交互式筛选视图非常方便,可以直接查看结果:

在他所测试的模型范围内,并未发现任何“鹈鹕最大化(pelimaxxing)”的证据:
- 鹈鹕骑自行车的生成质量并未优于其他组合
- 各家实验室在绘制鹈鹕方面没有明显优势
- 各家实验室在绘制自行车方面同样没有明显优势
- 即便控制难度差异后,鹈鹕骑自行车这个组合依然没有更出色
- 鹈鹕+自行车的场景看起来并非模型记忆化(memorization)的结果
鹈鹕并不比其他动物画得更好,自行车也不比其他交通工具画得更好。没有任何一个实验室在“鹈鹕骑自行车”这个组合上的表现超出其单独绘制鹈鹕和自行车的预期。GLM-5.2最接近:它在这个组合上的提升幅度最大,而且第一张鹈鹕骑自行车的样本确实令人眼前一亮。但效果非常微弱,统计上也不显著,因此不必过于当真。
