2026年7月17日,一个值得关注的日子。百度文心助手任务Agent,以最高分94.6%、平均分94.4%的成绩,登顶全球工程向AI智能体评测榜单PinchBench v2。这不仅是技术上的突破,更是一个标志性事件——它成为首个以正式产品身份拿下PinchBench总榜第一的国产智能体系统。
在59个参评模型中,文心助手任务Agent排名第一,领先Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。

这个榜单,测的是最难作假的能力
PinchBench由Kilo AI推出,OpenClaw社区维护。它和MMLU、GPQA这类传统大模型基准的区别很直接:传统基准考的是“模型知不知道”,而PinchBench考的是“智能体能不能把整件事做完并交付可验证的结果”。
当前版本包含23个真实工作场景、147项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,总共进行了617次测试运行。评分采用“自动化校验 + LLM 评审”双轨机制,全程零人工干预——这意味着所有结果都经得起推敲。

更关键的是,PinchBench用于衡量模型与Agent框架的综合能力。即便是同一底座模型,搭载不同的Agent框架,最终评测得分也存在较大差距。这也说明,文心助手任务Agent取得榜首成绩,代表的是模型能力与系统工程协同打造的综合实力第一。
百度AI搜索团队在GitHub上开源了完整评测流程,147个任务的执行快照、交付物、LLM Judge打分理由全量公开,任何人都可以逐条复现。这种透明性,本身就是一种技术自信。
让AI从“动动嘴”,到“迈开腿”
比如其中一个任务是:“GitLab Q3 2025 财季的实际利润率与指引之间差了多少个基点?”没有给任何数据文件,Agent需要自主检索GitLab财报原文或电话会议记录,定位相关指引,计算出非GAAP运营利润率约18%、超出指引约500个基点,并将结论写入指定文件。五个自动化评分维度——文件创建、指标定位、实际值与指引值提取、基点计算结论——全部满分1.0。
另一个任务考的是安全工程:分析一个Node.js应用的多个CVE漏洞,按优先级分级并制定修复计划。评测要求Agent识别express RCE和JWT bypass两个CRITICAL级漏洞为P0,其中JWT bypass因存在活跃利用记录需要特别标注;将PostgreSQL SQL注入定为P1,并结合PCI DSS支付路径给出上下文;将仅影响构建阶段的依赖漏洞降级为P2/P3;制定五批次修复计划,附具体部署窗口(4月12日紧急热修、4月14日P1批次)。LLM评审的结论是“所有维度表现卓越”,得分满分1.0。
还有一个合同法律分析的案例,任务是读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。这种任务过去需要律师助理花几个小时。文心助手任务Agent的输出结果,识别了客户方12项风险、供应商10项风险、5项共享风险,付款结构六期分期的现金流前置问题、IP转让条件的产权间隙,全部做到了——最终评分四个维度都是满分1.0。
上面这些复杂的任务文心助手任务Agent都不在话下,更不用说普通用户的日常办公需求。比如,你扔给文心助手一份职业数据表,然后说“统一表头格式,新建汇总sheet,按职业大类做汇总表和Top10/Bottom10榜单,生成图表对比各职业大类就业人数。”这是一条有内部依赖关系的任务链,任何一步出错后面就没法接。文心助手任务Agent自主拆解,一次性跑完。

或者你给不了这么详细的指令,想摇个盲盒:“我这周末想从北京去青岛玩两天solo trip。”没有给任何别的信息。Agent自主检索了交通、住宿、景点实时数据,排出完整行程、预算清单和避坑指南,交付一份可以直接截图出发的攻略。

或者你不想每次都要问AI,让它帮你完成重复性又高脑力的劳动,可以设置定时任务,如“每周一晚上十点,帮我汇总近一周的高质量AI领域论文,用投研报告风格的HTML给我”。7×24小时,用户无需时刻在场。

为什么是百度做出来了?
答案其实很简单:百度是一家在意图理解上花了20多年的公司。文心助手任务Agent依托百度搜索猎户座AI引擎的多智能体框架构建。从架构逻辑来看,搜索引擎本身就是最早的Agent雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度已经跑了二十余年。工具集从索引爬虫升级成了代码执行环境、文件处理器和实时API接口,输出从蓝链列表变成了结构化报告和可运行代码,但底层逻辑一脉相承。
文心助手任务Agent将模型任务评估得分提升至94%以上,证明优秀的系统架构与工程实现能够显著释放模型潜力。也就是说,同一个底层模型,换上文心助手任务Agent的框架,任务完成率会更高。Agent时代,框架工程能力的重要性正在超过单纯的模型参数比拼。
