游乐游手机版
首页/AI热点日报/热点详情

腾讯WorkBuddy Bench编码智能体考场整合代码办公安全

类型:热点整理2026-07-24
在AI编码智能体评测领域,业界普遍采用分领域测试的方式:代码修复侧重SWE-bench,前端开发关注Design2Code,而生产环境基准往往闭门不对外公开审计。腾讯此次创新性地将四大领域整合为统一评测框架,推出名为WorkBuddy Bench的多领域评测套件,相关论文已发布在arXiv平台。该套

在AI编码智能体评测领域,业界普遍采用分领域测试的方式:代码修复侧重SWE-bench,前端开发关注Design2Code,而生产环境基准往往闭门不对外公开审计。腾讯此次创新性地将四大领域整合为统一评测框架,推出名为WorkBuddy Bench的多领域评测套件,相关论文已发布在arXiv平台。该套件的核心亮点并非题量庞大,而是从根源上杜绝了模型“背答案”的可能性,确保评测结果真实可信。

整个基准测试横跨四个专业工作领域:代码(仓库级软件工程)、网页(前端制品生成)、办公(多文件业务流程)以及安全(红蓝队攻防对抗)。各领域任务数量分别为80、70、50、60个,总计260项任务。关键在于,每项任务并非从公开题库中直接改编,而是通过对真实代码提交、拉取请求或实际业务场景进行“逆向工程”构建,再改写为简洁、口语化且带有角色扮演色彩的请求指令。这种设计逻辑很简单:任务的提示词无法通过联网搜索找到对应的PR或提交记录——你搜不到,自然就无法“背题”。由于数据集已公开发布(包含任务目录、环境镜像、评估工具、测试用例及参考方案),其抗污染能力依赖这种独特的构造方式与版本管理机制,而非将数据封闭起来。

image.png

四个子集共享统一的任务目录格式,但各自采用独立的验证方法,因此分数无法在子集之间直接比较,腾讯索性不公布套件整体平均分。代码类依据隐藏测试通过率打分;网页类采用规则检查结合LLM/VLM评判及智能体评判,且必须交付声明路径上的制品,不允许连接实时互联网;办公类采用确定性规则检查与基于证据的LLM评判,权重在0.70到0.95之间偏向规则;安全类则直接使用确定性的scoring.py脚本运行三次取平均值,不依赖大模型作为裁判。安全子集还部署了五层反作弊机制:禁止字面量扫描、重命名输入、覆盖篡改测试、编码依赖检测、低权重诱饵设置,其中红队38题、蓝队22题,白盒审计锚定binutils、curl、nginx等真实CVE漏洞。

任务构建遵循统一流水线:来源收集、改写为真实请求、组装工作空间、回合后隔离评估资产、独立目录打包,全程不碰用户数据。代码任务分配五种角色(开发者、算法工程师、产品经理、QA、运维),安全任务赋予专业角色,并且刻意设计信息不充分——不告知目标文件、模式或边界,智能体必须自行找回上下文。评分资产在智能体运行完成后才引入,智能体全程无法看到。

评测在隔离容器中执行,模型与沙箱分离,框架采用CodeBuddy Code(默认)和Claude Code两种,推理设置调高、上下文长度给到200k,并禁用WebSearch与AskUserQuestion功能。这一点至关重要:关闭联网搜索,正是为了验证抗污染机制是否真正有效。

排行榜展示了多家模型家族的表现(分数范围0–100,思考模式,三次取平均值)。Claude Opus4.8在代码、网页、办公、安全多个领域占据榜首,共拿下五个第一;GLM-5.2在安全类两榜登顶,GPT-5.5则摘得办公类cc榜第一。框架的敏感性也不容小觑——安全子集重排最显著,平均绝对变动达8.6个百分点;Claude Opus4.8在cc框架下拒答13次,GPT-5.5在cbc下仅拒答2次。效率方面,GPT-5.5输出token最少但分数不低,而DeepSeek-V4-Pro在代码任务上跑了44轮,出入token都高,显得更为“费力”。

这篇论文由腾讯多个实验室联合完成,署名包括优图实验室(Youtu Lab)、科恩安全实验室(Keen Security Lab)、Workbuddy团队与云鼎安全实验室(Yunding Security Lab)。团队也坦诚承认局限性:代码子集以Python为主,跨语言覆盖偏少;开源发布本身存在被爬取污染的风险,需依赖版本管理缓解;评判器偏差尚未量化;办公类偏向文本处理,暂无OCR与GUI支持。近期计划包括校准网页评分、扩充公开榜单。对于一款旨在将“真实工作分布”搬进评测环境的套件而言,WorkBuddy Bench已经打开了广阔的大门。

来源:https://news.aibase.com/zh/news/29864

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。