游乐游手机版
首页/AI热点日报/热点详情

PawBench通用智能体度量基准测试

类型:热点整理2026-07-20
PawBench是面向通用智能体的评测基准,将底座模型与运行框架纳入同一体系。v1 0包含150道真实任务、4050个测试单元,覆盖9个模型与3个Harness的交叉评测,旨在区分任务失败源于模型能力不足还是运行框架问题。
当前,通用智能体已广泛应用于实际工作流,能够自主完成编写代码、处理文件等复杂任务。然而,一个现实挑战是:当任务执行失败时,很难判断究竟是模型理解能力不足,还是工具或环境配置存在缺陷。为此,我们正式推出全新的评测基准——**PawBench**。 PawBench专为个人助理与通用智能体场景设计,将底座模型与运行框架(Harness)纳入统一评测体系。简而言之,底座模型负责思考执行策略,决定智能体的能力上限;而运行框架(Harness)则负责为模型装配Prompt、提供工具、管理工作区(workspace)以及处理异常,决定能力能否稳定落地。两者缺一不可,但此前很少有评测将二者联合评估。 PawBench v1.0构建了包含150个真实任务、4050个测试单元的评测数据集。它不仅能够评选出“模型+Harness”的最佳组合,更能帮助Harness开发者精准定位问题并验证优化效果。项目地址:https://github.com/agentscope-ai/PawBench,榜单地址:https://agentscope-ai.github.io/PawBench。注:PawBench是OpenJudge生态的一部分,秉承了OpenJudge“评测驱动优化”的核心理念,专注于评估LLM × Harness这一垂直维度的联合表现。OpenJudge项目地址:https://github.com/agentscope-ai/OpenJudge,项目主页:https://openjudge.me。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578586a22aec2d8b65415168370.webp) PawBench并非单纯构建一个模型排行榜,而是将“模型、Harness、任务”三者进行交叉评测。本次评测矩阵为9个模型 × 3个Harness × 150个任务,共计4050个测试单元。三家Harness分别为**Hermes**、**OpenClaw**和**QwenPaw**。所有任务均在Docker沙箱中运行,执行轨迹、评分器(grader)产物以及环境快照都会被保留,便于后续按切片进行复盘。 150道任务是从6个高质量Agent评测集中抽取的: ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578596a22aec3303c6654223747.webp) 每道任务都会按照5个维度进行标注: - **应用场景**:办公协同、软件工程、自动化脚本、多模态内容生成等。 - **原子能力**:工具调用、Skill使用、规划、逻辑推理、自我校验。 - **复杂度**:L1 / L2 / L3,避免仅靠简单题目刷高分。 - **输入模态**:区分纯文本任务与图像、音频、视频等多模态任务。 - **运行环境**:区分离线沙箱任务和需要联网的Web搜索/网页获取任务。 最终得分由两部分组成:一部分来自自动评分器(基于规则和子项断言),另一部分来自LLM-as-judge,用于评估语义层面的结果质量。本期评测采用混合权重计算最终分数,分数范围在0到1之间。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578596a22aec361cc5396579150.webp) PawBench榜单支持Overall、Text、Multimodal三个切片。同一组提交结果既可以查看150个任务的总分,也可以切换为124个纯文本任务或26个多模态任务的分数。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578596a22aec38f9d1402052475.webp) 从本次评测结果来看,有两个明显结论。 - **Harness间存在稳定分差**:QwenPaw(76.4)、OpenClaw(75.4)、Hermes(70.4)。最高6.4分的极差,堪比一次重大的模型版本升级。 - **优秀的Harness能让模型实现“以下克上”**:在Hermes环境下,GLM 5.1仅得68.2分;而在QwenPaw环境下,Qwen3.6-35b-a3b却能拿到70.4分。这证明Harness环境甚至比底座模型本身更为关键。 面对如此决定性的差距,PawBench的价值不仅在于提供一个排行榜,更在于提供深度诊断,帮助我们追问:这关键的几分,究竟是从哪里拉开的? ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578596a22aec3d2223009142168.webp) ### 发现一:Harness机制显著影响模型表现 最典型的样本是qwen3.6-35b-a3b。同一个模型仅更换Harness,分数差距就达到11.5分。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578606a22aec4371b0224811719.webp) 对执行轨迹进行复盘后,我们发现了几个可能的原因。 **(1)缺乏“产物级”硬校验,导致“虚假完工”** 当前Harness多依赖模型的自我声明,缺少对工作区(Workspace)产物的实质性校验——文件是否真正落盘?diff是否生成?测试是否通过?路径是否正确?这导致模型极易过早宣布完成,从而在此类任务中严重失分。 **(2)路径感知与约束宽松** 例如,Hermes未在Prompt中明确当前工作目录,也未在write_file等工具层强约束写入路径。这导致模型“自以为”写入成功,但评测程序在标准工作区却扫描不到产物。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578606a22aec45accf722790459.webp) **(3)工具表体量过大,增加模型决策负担** 不同Harness默认装载的工具数量差异显著——Hermes约65个,OpenClaw约30个,QwenPaw约15个。工具并非越多越好,庞大的工具Schema不仅挤占上下文窗口,还会显著增加小模型的首轮决策负担。 ### 发现二:Skill主动发现是Harness能力短板 许多用户会将Skills放在项目workspace中,作为项目专属Skills。本次评测模拟的就是这种情况:每个任务专属的Skills会复制到workspace中,以测试Harness主动发现和应用Skills的能力。从结果来看,与工具调用、规划或逻辑推理等其他能力切片相比,三家Harness在17个Skill任务上的表现都较为吃力。 这暴露出两个核心问题。首先是**Harness的主动发现能力不足**。除了OpenClaw外,另外两个Harness都不会主动加载workspace中的Skills。如果Harness只扫描全局预装Skill,而不扫描当前工作区,就会漏掉这份关键指南,迫使模型只能自行摸索。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578606a22aec48529c751543961.webp) 其次是**模型自身的长链路推理瓶颈**。即使Harness成功注入了Skill并设置了“路标”,模型在执行复杂推理和精细计算时依然容易出错。Harness能指路,但能否走通,最终仍考验底座模型的能力。 ### 发现三:Web搜索任务高度依赖默认可用性 这里所说的Web搜索任务侧重于考察模型的网页检索、内容抓取与深度调研能力。本次评测不追求“配齐所有搜索服务API Key的理论上限”,而是**还原开发者第一次clone后的默认体验**:拉取固定版本源码,写入LLM密钥,然后直接运行。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578606a22aec4b2015992915749.webp) 在这类任务中,Hermes表现偏低,核心原因是**其核心工具在零配置下被“锁死”**。虽然源码内置了`web_search`和`web_extract`,但必须配置外部搜索API Key才能启用。在仅配置LLM密钥的评测环境下,模型无法获取这些工具,只能降级使用基础`browser`工具勉强应对。相比之下,OpenClaw提供了更好的体验,其`web_search`支持DuckDuckGo等免密服务,`web_fetch`依赖内置HTTP抓取,真正实现了**零配置直连**;QwenPaw虽无专属搜索工具,但通过`browser_use`结合模型知识储备,也能有效完成基础的Web访问。 这说明,Web搜索任务的评测结果不仅反映模型的搜索和阅读能力,也反映Harness是否将关键工具做成了“默认可用”。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578606a22aec4e825c104324061.webp) 结合上述切片结果,PawBench为Harness设计提供了4条比较直接的原则。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578616a22aec51b819509818254.webp) **1. Inform Fully:充分告知** 模型看不见的东西,对它来说就不存在。Harness应明确告知模型当前运行环境:当前工作目录(cwd)在哪、workspace在哪、输出目录在哪、工作区里是否有SKILL.md,以及有哪些可用资源。不要假设模型能自行推断这些上下文。 **2. Equip on Demand:按需装备** 工具要装得对,也要装得精。“装得对”指关键工具应在默认配置下可用,例如无密钥的web搜索、内置HTTP抓取、Skill helper自动注册。“装得精”指工具数量要匹配目标模型的上下文窗口和注意力预算。工具并非越多越好,过多的schema反而可能压垮小模型。 **3. Monitor Actively:主动监控** 不要只听模型说了什么,要看它做了什么。Harness应检查任务产物是否真正落地:文件是否存在、是否非空、是否包含必填字段、工具调用是否合法、退出码(exit code)是否正常。尤其在文件写入、代码修改、报告生成等任务中,产物级校验比一句“我完成了”可靠得多。 **4. Recover Gracefully:弹性恢复** 一次异常不一定代表任务失败。当Harness发现模型空响应、只画计划、工具调用异常或产物缺失时,可以给它一次更有信息量的续推机会——注入当前状态、说明缺少什么产物、保留中间结果,并设置合理的重试预算(retry budget)。许多任务并非不会做,而是缺少在关键节点的一次及时纠偏。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578616a22aec54c0fe107494307.webp) 如果你是智能体用户,PawBench可以帮助你选择更合适的模型和Harness组合。例如,面对纯文本任务、多模态任务、Skill任务或Web搜索任务,不同组合的表现各不相同。 如果你是Harness开发者,PawBench不仅仅是一个榜单。它提供了4050个单元格的对照矩阵和切片分析能力,可以帮助你做三件事: - **横向自检**:将你的Harness运行在同一组模型上,查看在哪些任务类型上落后。 - **失败画像**:锁定可疑切片,对比执行轨迹(trace),找到具体的Harness行为问题。 - **回归验证**:每次修复后重新切片,观察分数变化是否真正对应到问题。 这类评测对通用智能体尤其重要。因为真实用户不会只问模型一个问题就结束,他们会让智能体操作文件、调用工具、运行脚本、读取网页、跨步骤完成任务。PawBench希望将这些复杂链路拆解,让模型能力和Harness能力都能被看见、被诊断、被持续改进。 ![PawBench:给通用智能体一把可度量的尺](http://img.318050.com/uploads/20260605/17806578616a22aec56a4c4240171517.webp) PawBench v1.0已开源。你可以到社区参与: - 接入新的Harness,例如Cursor Agent或其他社区框架。 - 提交新的模型评测结果。 - 贡献更多任务,并按照五维标签体系完成标注。 - 基于切片(slice)能力分析你关心的任务切片,反馈诊断报告。 PawBench站在开源Agent评测社区的肩膀上,致敬Claw-Eval、QwenClawBench、WildClawBench、PinchBench和skillsbench。欢迎你一起参与贡献,共同建设Agent评测生态。
来源:https://mp.weixin.qq.com/s/Q1fa3KwT63HBOF2fmWKzlg

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。