游乐游手机版
首页/AI热点日报/热点详情

AI实验室是否在鹈鹕骑车基准测试中刷榜了

类型:热点整理2026-07-23
2026年7月22日 - 链接博客 AI实验室是否在刻意训练“鹈鹕骑自行车”?(pelicanmaxxing)(来源链接)这是一项相当扎实的研究成果。Dylan Castillo 全面剖析了一个经常被拿来调侃的问题——AI实验室是否故意让模型生成“鹈鹕骑自行车”的图像,以回应他那套颇受争议的基准测试

2026年7月22日 - 链接博客

AI实验室是否在刻意训练“鹈鹕骑自行车”?(pelicanmaxxing)(来源链接)这是一项相当扎实的研究成果。Dylan Castillo 全面剖析了一个经常被拿来调侃的问题——AI实验室是否故意让模型生成“鹈鹕骑自行车”的图像,以回应他那套颇受争议的基准测试。

此前也有研究人员进行过随机抽查,例如用其他动物搭配其他交通工具来对比,但从未有任何实验设计像Dylan这样细致入微。

Dylan 选取了8种动物 × 6种交通工具 = 48个提示词,每个提示词重复运行3次,共测试了7个模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro)。随后,他使用GPT-5.6 Luna和Gemini 3.1 Flash-Lite辅助评估结果。

这个交互式筛选视图非常方便,可以直接查看结果:

在他所测试的模型范围内,并未发现任何“鹈鹕最大化(pelimaxxing)”的证据:

  • 鹈鹕骑自行车的生成质量并未优于其他组合
  • 各家实验室在绘制鹈鹕方面没有明显优势
  • 各家实验室在绘制自行车方面同样没有明显优势
  • 即便控制难度差异后,鹈鹕骑自行车这个组合依然没有更出色
  • 鹈鹕+自行车的场景看起来并非模型记忆化(memorization)的结果

鹈鹕并不比其他动物画得更好,自行车也不比其他交通工具画得更好。没有任何一个实验室在“鹈鹕骑自行车”这个组合上的表现超出其单独绘制鹈鹕和自行车的预期。GLM-5.2最接近:它在这个组合上的提升幅度最大,而且第一张鹈鹕骑自行车的样本确实令人眼前一亮。但效果非常微弱,统计上也不显著,因此不必过于当真。

来源:https://www.bestblogs.dev/article/0e041af55d?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。