模型大战,说到底,是入口和生态的战争。
从今年6月到8月初,短短不到60天,新BAT几乎同时干了一件事。
先是6月,阿里动手整合内部Agent的产品线和能力。到了8月3日,在官宣编程和专业办公能力大幅提升的Qwen3.8模型的同时,正式把内部孵化的三款Agent产品——QoderWork、悟空、MuleRun——合并成了统一的“千问办公”。
紧接着,7月20日,腾讯也开始整合,QClaw的业务和团队被并入WorkBuddy体系。
10天后,7月30日,字节跳动宣布飞书产品团队整体并入豆包,飞书负责人谢欣向豆包负责人赵祺汇报。
三家中国最顶级的互联网企业,组织结构不同,产品积累和优势市场也不同,却在相近的时间点做出了相似的整合决策。这显然不是巧合。
更合理的解释是:AI行业走过了摸索期,已经进入入口争夺阶段。过去,大厂需要多个团队分别验证桌面操作、云端执行和企业协作等不同路线;现在,主要产品形态逐渐清晰,竞争也从“能不能做出Agent”转向了“谁能成为用户和企业的统一入口”。
千问办公作为这轮收束中最新落地的产品,自然是最适合观察行业变化的样本。
它既是阿里阶段性能力重组的结果——把此前分散在模型、桌面端、云端和企业协作场景中的积累,装进了一款独立产品——也集中体现了企业Agent竞争中最关键的几个问题:内部赛马为什么此时结束?企业IM与云为什么成了Agent的底层资产?模型、产品和真实任务如何形成共同进化的闭环?
读懂它,就读懂了企业级Agent真正的赛点。
01 大厂为什么同时收敛路径
大厂为什么几乎同一时间开始整合Agent产品?
以阿里为例,今年年初同时保留QoderWork、悟空和MuleRun,在当时是合理的。这三款产品代表了三种不同的判断。
QoderWork运行在用户电脑上,擅长读取和处理本地文件;悟空试图进入钉钉的企业账号、权限和应用体系;MuleRun从一开始就运行在云端,可以长时间执行任务,也更早进入海外市场。截至今年5月,它已经服务了43个国家和地区的企业和用户,其中单月付费超过200美元的用户占比达到34%。
市场尚未定型时,三个团队分别测试本地执行、企业协作和云端运行,可以帮助阿里更快地找到方向。
但试错期不会一直持续。今年上半年,行业对通用Agent的理解发生了明显变化。
Anthropic发现,许多非技术员工会绕过普通聊天界面,直接使用Claude Code整理文件、处理表格和完成多步骤知识工作。于是,Cowork被做了出来——它保留了Claude Code的任务执行能力,但换成了更适合普通知识工作者的交互方式。
相似的变化也发生在老对手OpenAI身上。一部分用户在ChatGPT里处理编程问题,另一部分用户则在Codex中完成报告、图片和数据处理等非编程任务。聊天、编程和办公之间原本清晰的产品边界,开始被用户主动打破。7月下旬,OpenAI将独立运行近一年的Codex并入ChatGPT桌面客户端,Chat、Work、Codex三端合一。
而千问办公的这次动作,同样是阿里三场实验验证过的能力重新组合:桌面端继承本地文件和电脑操作能力,云端承接长任务、资源调度与多模态生成,企业端则继续进入组织身份、权限和业务系统。把原来分散的产品能力和反馈数据,集中到一个入口、一套工程体系和一个迭代闭环中。

千问办公实测显示,它不仅能快速根据需求产出专业报告,还能直接打通钉钉发送到聊天界面。
用户在自发地“用脚投票”,市场也没有给大厂留下太多继续分散试验的时间。
易观分析发布的二季度报告显示,2026年6月,17款主流桌面端AI办公智能体的合计访问量已经超过6000万次。腾讯系、字节系和阿里系产品相加约为5622万,留给其他玩家的市场不到500万。
技术路线逐渐确定,头部效应开始出现。这时候,分散本身就是资源分配上的负担。
工程层面也是同理。过去,模型每升级一次,三支团队都要针对任务规划、上下文管理、工具调用、失败重试、权限控制做一次重新适配——本质上是一种不必要的重复劳动。
千问办公就是在这个分秒必争的背景下诞生的。
02 企业Agent的分水岭
目前市场上大多数通用办公Agent,首先解决的仍然是个人生产力问题。它们可以读取用户电脑里的文件,分析个人文档,理解历史对话,整理个人日程,再根据用户本人拥有的权限调用有限的外部工具。
但这些主要是个人上下文。个人上下文的叠加不等于企业上下文。企业内所有人的效率相加,也不等于企业效率。给每位员工配置一个更聪明的个人助手,可以提高局部产出,却未必能改善整体信息流转、任务协同,以及个人结果转化为组织行动与结果的效率。
企业面对的是另一类问题。
企业并不是个人账号的简单集合。所有员工的文件、对话和任务相加,也不会自动变成企业的运行方式。同样一份文件,在个人Agent看来可能只是一份需要总结的材料;在企业Agent看来,它还涉及谁可以阅读、谁需要确认、结论应该同步给哪些部门,以及后续任务必须经过谁批准。
这是企业级Agent与个人办公Agent最根本的区别。也是相似的整合背景下,中美大厂行为逻辑产生明显区别的一个认知基础。
OpenAI和Anthropic主要在合并聊天、编程和桌面执行入口。中国大厂的整合范围,则包括了钉钉、飞书这样的企业协作软件,同时也让云成了Agent底层能力的一部分。
体现在企业内部产品协同上:豆包产品线融合飞书的同时,也与火山引擎深度结合;千问办公合并了此前主攻钉钉场景的悟空,也同时继承了阿里云过去在企业级服务市场上关于行业认知、数据管理、资源调度的全方位资源。
换句话说,Agent开始吸收IM与云,把它们变成底层的infra。
云作为Agent核心infra的重要性不必多说。这里重点看看IM的整合叙事。
传统办公软件按照功能划分世界:邮件负责沟通,文档负责写作,表格负责数据……但真实世界中,用户想完成一个目标,需要的是多种工具能力的组合。Agent也是同理。
过去十多年,整合了沟通、员工身份、组织关系、协作网络、文件、会议、审批、权限和各种企业应用连接的钉钉式IM,作为功能最多、也包含完整组织上下文的软件,必定会成为Agent时代最底层的能力支撑。

在自建的钉钉组织群里模拟了一段三人选题讨论,让千问办公总结讨论要点并提取待办事项。它从对话中识别出了五条待办,每条都正确分配了负责人,还给紧急的那条标了较高优先级和即将截止,并直接写入了钉钉的待办系统。
当然,对一个外部的第三方Agent来说,通过连接器读取群消息,再生成一份摘要,或者完成投研、网页制作或表格处理,并不困难。真正难的是“写回”:创建待办、调整日程、发送邮件、提交审批,或者把任务分配给正确的人。
读取只需要接口,而写回需要更高的信任。企业必须确定Agent能看到什么、可以替谁操作、哪些步骤需要审批,以及发生错误后如何追溯和撤销。从这个角度看,过去十多年里,钉钉为Agent积累的不仅是工具,更是信任与企业级上下文的护城河。
03 模型和Agent,成为智能飞轮
如果将眼光进一步收敛到国内的一梯队玩家,会发现阿里在这场竞争中拥有一项难得的条件:它同时拥有一线大模型、企业协作平台和云计算基础设施。
但模型和应用都在自己手里,并不会自动转化成优势。只有模型和Agent能够相互提供反馈时,这种组合才真正有价值。
于是,我们看到,推出千问办公的同日,阿里低调放出了在编程和专业办公方面能力大幅提升的Qwen3.8。

背后的逻辑在于:在生产环境中,Agent可以为模型提供一种比聊天记录更有价值的反馈,而模型又能一劳永逸地解决Agent中的底层问题。
比如,很多Agent产品中看似发生在应用层的问题,根源其实在模型层。过去,模型选错工具,产品团队可以增加一条调用规则解决;模型在长任务中忘记最初要求,团队也可以在外面再套一层工作流。这些应用上的修补客观上能降低错误率,却不能改善模型本身的判断与认知能力。
因此,我们可以看到OpenAI推出Codex时,没有只是给通用模型接入代码编辑器,而是训练了面向软件工程任务的codex-1。它使用真实编程任务进行强化学习,能够读取和修改文件、运行测试,并根据测试结果继续调整,直到得到通过的结果。这个做法一举改善了开发者们在编程任务中的大量问题,也成为OpenAI在编程领域逆袭的关键。
模型解决了Agent的底层能力问题,Agent也可以为模型带来比聊天记录更完整的反馈。
对OpenAI和千问系列模型来说,Agent留下的完整行动轨迹,可以告诉模型它如何理解目标,制定了什么计划,调用了哪些工具,在哪一步偏离了要求,用户修改了什么,以及最终产物是否真的被使用。尤其在代码任务中,能不能运行、测试有没有通过、文件是否正确修改,通常可以被机器验证。而这种真实企业任务中的失败轨迹,又能反馈给模型,成为模型迭代的动力。
最终,Agent为模型提供真实任务反馈,模型为Agent提供更强的判断能力。模型+Agent构成的,正是一套持续运行、不断进化的飞轮系统。
04 结尾
客观来说,千问办公这次整合完成,并不意味着阿里关于Agent的探索从此就可以高枕无忧了。但它至少说明,阿里已经找到了自己的主线。
当越来越多Agent都能制作PPT、分析表格、控制浏览器时,各种To C式Agent的功能差异会快速缩小。未来真正的差距,将来自产品背后的系统能力:它掌握多少企业上下文,能够获得多大的执行权限,又能否把每一次Agent真实任务,变成下一次模型升级的依据。
在这个过程中,IM的上下文、infra的基础能力建设、模型与Agent的飞轮,三者缺一不可。
千问办公,已经拿到了半张门票。
