OpenAI于昨日(7月8日)发布博文,直接对行业权威编程能力评测基准SWE-Bench Pro提出质疑——在731个公开测试任务中,大约30%存在评测缺陷。这一事件非同小可,毕竟SWE-Bench Pro由Scale AI推出,专门用于衡量大语言模型与AI智能体的编程能力,高度贴近真实企业级开发环境,防作弊标准也极为严格,早已成为软件工程领域的“裁判员”。如今连裁判都被质疑,整个行业自然引发热议。
数据最能说明问题:前沿模型在8个月内,通过率从23.3%一路飙升至80.3%。进步固然值得欣喜,但OpenAI认为,该基准已经失效——它再也无法有效评估模型的软件开发能力了。

OpenAI详细拆解了审查流程:第一路是数据点分析,标记出200个失效任务,占全部731个公开任务的27.4%;第二路是并行的人工标注,识别出249个失效任务,占比34.1%。两条路径交叉验证后,估测大约30%的任务存在缺陷。
具体问题被梳理为四大类:
测试过于严苛——把题面根本没有写明的实现方式也列为硬性要求;提示不充分——隐藏测试要求一些无法从题面合理推断出来的细节;测试范围过窄——不完整的修复也能轻松通过;提示具有误导性——指向与测试要求完全不一致的行为。
有一个典型例子能充分说明问题:题面要求把内容转成Markdown时,行首只加1个空格,但隐藏测试却要求2个空格。模型按说明老老实实写代码,结果被判错。这种“标准不对齐”的陷阱,别说AI,资深开发者遇上也得抓狂。

基于这次分析,OpenAI直接撤回此前对SWE-Bench Pro的采用建议,并表态:后续需要由资深软件开发者专门为AI评测设计新的基准。毕竟,裁判都不靠谱,比赛结果还有什么意义?
