WorkBuddy Bench是什么
腾讯近期开源的 WorkBuddy Bench 是一款面向 AI 编码智能体的评测套件,覆盖代码、网页、办公和安全四大真实应用场景。每项任务均源自真实的 commit、PR 以及实际业务场景,通过逆向工程构建而成。具体流程是:先将真实需求改写为口语化请求,使搜索引擎无法检索到原题,从根源上杜绝数据污染。全部 260 个任务在隔离沙箱中运行,采用隐藏测试、规则检查与 LLM 评判相结合的多元评分机制,并在双框架下交叉验证,最终实现开源、可复现、可审计的端到端评估。
WorkBuddy Bench的主要功能
- Code(代码):包含 80 个仓库级软件工程任务,涵盖 bug 修复、功能开发、接口调整、算法实现等 18 个类别,由开发者、算法工程师、产品经理、QA 和运维五种角色提出请求。
- Web(网页):70 个前端任务,覆盖页面实现、交互设计、数据可视化、视觉设计、代码测试、文档转换等 7 个类别,要求交付可运行的前端制品,而非对话文本。
- Office(办公):50 个多文件业务流程任务,智能体需处理电子表格、文档、PDF、JSON 等混合格式文件,完成数据核对、报告生成、状态更新等交接型工作。
- Security(安全):60 个红蓝队安全任务,包括漏洞发现与利用、恶意软件分析、安全运营、AI 智能体安全评估,采用确定性评分脚本,无需 LLM 评判器参与。
WorkBuddy Bench的技术原理
- 逆向工程构建:每个任务从真实代码提交、PR、CVE 或业务场景逆向工程而来,改写为简短口语化的角色扮演请求,使提示词无法通过搜索引擎还原。
- 刻意信息不充分:请求仅陈述意图与约束,省略目标文件、精确接口、边界处理等细节,智能体必须自行从工作区恢复上下文,测试需求消歧与落地能力。
- 回合后评估隔离:智能体解题期间能看到任务指令与工作区,评分资产(隐藏测试、评分细则等)在完成后才引入沙箱,避免评分信息泄露。
- 双框架交叉验证:所有任务在 CodeBuddy Code 与 Claude Code 两种智能体框架下分别运行,消除单一框架的系统性偏差。
- 抗污染机制:依赖任务构建方式封闭可搜索提示路径,配合数据集版本管理定期刷新,替代传统保密式防污染方案。
如何使用WorkBuddy Bench
- 获取任务集:访问 GitHub 下载标准化任务目录,包含 instruction.md、task.toml、environment/ 环境镜像与 tests/ 评分资产。
- 运行评测:将智能体接入 Harbor 风格任务目录,在隔离 Docker 沙箱中执行,智能体读取自然语言请求后探索工作区并生成制品。
- 查看结果:任务完成后自动运行评分器,代码子集通过隐藏单元测试评分,网页子集通过规则+LLM/VLM+智能体评判器评分,办公子集通过规则检查与证据驱动的 LLM 评判器评分,安全子集通过确定性 scoring.py 评分。
- 独立审计:任何第三方均可离线重新运行单个任务并直接检查其内容,实现端到端可复现与可审计。
WorkBuddy Bench的核心优势
- 真实工作分布:任务类别、模式、难度均匹配内部真实使用分类法,并非基于公开题库或教程练习构造。
- 完全开源可审计:任务目录、环境镜像、评估代码、评分测试、参考答案全部公开,区别于 CursorBench 等封闭厂商基准。
- 多维度评分体系:代码用隐藏测试、网页用规则+语义+交互三重评判、办公用规则+证据驱动 LLM 评判、安全用确定性脚本,各子集评分工具独立设计。
- 角色与场景多样性:代码子集引入五种请求者角色,安全子集覆盖红蓝队全频谱,避免单一任务类型导致的评估偏差。
- 效率与能力解耦:排行榜同时报告 token 消耗与轮次效率,GPT-5.5 以最小输出预算取得顶级分数,证明高分不等于高消耗。
WorkBuddy Bench的项目地址
- 项目官网:https://workbuddybench.com/
- GitHub仓库:https://github.com/Tencent/workbuddy-bench
- HuggingFace模型库:https://huggingface.co/datasets/tencent/workbuddy-bench
- 技术论文:https://workbuddybench.com/report/main.pdf
WorkBuddy Bench的同类竞品对比
抗污染方式:构建层面封闭搜索路径与版本管理 vs 依赖发布时的新颖性
覆盖领域:Code / Web / Office / Security 四领域 vs 仅代码缺陷修复
开源程度:任务/镜像/评分/答案全部公开 vs 公开任务集与测试
请求风格:口语化、角色扮演、信息不充分 vs 详细技术 issue 描述
评测框架:双框架(CodeBuddy + Claude Code) vs 单一框架
WorkBuddy Bench的应用场景
- 智能体研发基准:为编码智能体、前端 AI 工具、办公自动化 Agent、安全 AI 提供标准化能力标尺。
- 模型选型参考:跨模型排行榜覆盖 Claude Opus 4.8、GPT-5.5、GLM-5.2、DeepSeek-V4 等主流模型,辅助企业选型。
- 学术研究与对比:完全开源的任务集与评分协议,支持第三方复现、审计与改进,推动领域基准迭代。
- 产品迭代优化:通过细分的子集得分与 token 效率数据,定位智能体在代码导航、前端状态管理、跨文件一致性等具体环节的短板。
- 安全能力评估:独立的安全子集为 AI 红队与蓝队能力提供可量化的攻防测试环境。
