游乐游手机版
首页/科技数码/文章详情

最新OpenAI挑战AI评测基准SWE-Bench Pro中约有30%的评测存在缺陷

时间:2026-07-19 11:19
OpenAI指出,其SWE-BenchPro基准中约三成的任务存在缺陷,包括测试条件过于严苛、提示信息不充分等。例如,题面要求行首加一个空格,但隐藏测试却要求两个空格。OpenAI已撤回采用该基准的建议,并呼吁为人工智能设计新的评估基准。

OpenAI于昨日(7月8日)发布博文,直接对行业权威编程能力评测基准SWE-Bench Pro提出质疑——在731个公开测试任务中,大约30%存在评测缺陷。这一事件非同小可,毕竟SWE-Bench Pro由Scale AI推出,专门用于衡量大语言模型与AI智能体的编程能力,高度贴近真实企业级开发环境,防作弊标准也极为严格,早已成为软件工程领域的“裁判员”。如今连裁判都被质疑,整个行业自然引发热议。

数据最能说明问题:前沿模型在8个月内,通过率从23.3%一路飙升至80.3%。进步固然值得欣喜,但OpenAI认为,该基准已经失效——它再也无法有效评估模型的软件开发能力了。


OpenAI详细拆解了审查流程:第一路是数据点分析,标记出200个失效任务,占全部731个公开任务的27.4%;第二路是并行的人工标注,识别出249个失效任务,占比34.1%。两条路径交叉验证后,估测大约30%的任务存在缺陷。

具体问题被梳理为四大类:

测试过于严苛——把题面根本没有写明的实现方式也列为硬性要求;提示不充分——隐藏测试要求一些无法从题面合理推断出来的细节;测试范围过窄——不完整的修复也能轻松通过;提示具有误导性——指向与测试要求完全不一致的行为。

有一个典型例子能充分说明问题:题面要求把内容转成Markdown时,行首只加1个空格,但隐藏测试却要求2个空格。模型按说明老老实实写代码,结果被判错。这种“标准不对齐”的陷阱,别说AI,资深开发者遇上也得抓狂。


基于这次分析,OpenAI直接撤回此前对SWE-Bench Pro的采用建议,并表态:后续需要由资深软件开发者专门为AI评测设计新的基准。毕竟,裁判都不靠谱,比赛结果还有什么意义?

来源:https://www.163.com/dy/article/L1DIB9HU0511B8LM.html
上一篇国芯科技量子密码卡与中移互联量子平台完成兼容互认 下一篇七彩虹隐星G15版游戏本重启上市 搭载i5-12450H与RT显卡
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
中科量枢4个月两轮融资,打造量子计算全栈软件生态
科技数码 · 2026-07-20

中科量枢4个月两轮融资,打造量子计算全栈软件生态

中科量枢成立4个月完成两轮融资,团队源自中科院计算所,具备二十余年量子计算理论与算法研究经验。公司打造“天枢”操作系统、“天璇”编译平台及“天玑”算法库,构建全栈式软件生态,与中石油勘探院合作推动量子计算在油气勘探等领域的应用落地。

比亚迪巴西工厂第10万辆新能源车下线员工超5500人
科技数码 · 2026-07-20

比亚迪巴西工厂第10万辆新能源车下线员工超5500人

比亚迪巴西卡马萨里工厂投产满一年,第10万辆新能源汽车下线,车型为海鸥。工厂在岗员工超5500人,总投资约55亿雷亚尔,一期年产能15万辆。计划2026年底实现半数零部件本地化,已获阿根廷和墨西哥10万辆出口订单。

三星晶圆代工部门超八成员工因奖金不满欲离职
科技数码 · 2026-07-20

三星晶圆代工部门超八成员工因奖金不满欲离职

三星电子晶圆代工部门超八成员工因奖金差距巨大有意离职,离职意向是存储器部门的两倍以上。工会警告危机感突出,已着手研讨人才留存对策。

无问芯穹在AGI到来前构建前店后厂一中心
科技数码 · 2026-07-20

无问芯穹在AGI到来前构建前店后厂一中心

无问芯穹发布面向Agent时代的“前店后厂一中心”架构,涵盖算力集散中心、Token工厂和AI生产力商店,旨在解决算力异构与跨域协同难题,提升Token生产效率,并通过智能体蜂群优化基础设施运维,实现用智能进化智能。

WAIC青年论坛把AI圈真话全说了
科技数码 · 2026-07-20

WAIC青年论坛把AI圈真话全说了

在WAIC青年论坛上,多位从业者围绕模型格局、垂直AI、Agent确定性、具身智能机会、运动健康垂类模型、数据重要性及14岁AI原生思考等话题展开讨论,直言行业正从炫技转向较真付费与落地。