阿里千问于2026年8月20日正式推出Qwen-UI-Agent,这是全球首款真机驱动的跨端GUI智能体基座模型。该模型全面支持移动端、PC桌面端及网页应用,通过视觉理解屏幕内容并模拟人类操作,无需修改原有程序即可实现智能化交互。
Qwen-UI-Agent核心能力与性能表现
阿里千问大模型于2026年8月20日正式推出Qwen-UI-Agent,这是一款专为真实设备环境构建的GUI图形界面智能体基座模型,全面支持移动端、PC桌面端、网页应用及深度搜索场景。
该模型的核心突破在于赋予AI直接理解屏幕内容并模拟人类操作的能力,使其能够自然地与各类应用程序和软件交互,成为数字设备上的通用执行终端。其核心使命是攻克大量未开放API的传统软件应用的智能化难题——无需修改原有程序,仅凭视觉理解屏幕即可完成操作,切实拓展智能体在真实世界中的应用广度与落地深度。

权威基准测试刷新行业最优水平
在多项权威基准测试中,Qwen-UI-Agent展现出领先行业的性能表现,多个指标刷新当前最优水平,综合能力已达到并与国际主流旗舰模型持平,部分场景实现超越:
- 移动端表现:移动端标准测试MobileWorld得分为82.1%,基于真实设备运行的MobileWorld-Real达92.2%,日常安卓任务测试AndroidDaily高达97.5%。
- PC端表现:PC端OSWorld Verified得分为79.5%,网页交互测试WebArena为73.6%。
- 精准定位能力:界面元素精准定位能力ScreenSpot-Pro达到81.5%。
技术架构与训练机制
Qwen-UI-Agent依托大规模真实设备环境进行训练,构建了涵盖超百台真机、覆盖150余款主流应用的测试集群,完整打通从仿真推演到实机部署的全链路验证闭环。
GUI与CLI协同操作
在操作方式上,模型支持GUI图形界面交互与CLI命令行指令协同工作,可一次性输出多步动作序列。在PC端任务中,近半数流程可调用系统命令行,显著压缩操作路径,提升执行效率。
在线强化学习与数据飞轮
模型具备超100步长轨迹的在线强化学习能力,训练过程依托上万并发的真实任务环境,结合AutoResearch风格的AI驱动数据飞轮机制,实现任务反馈、优化与迭代的自主闭环。
安全机制与跨端协同
安全设计贯穿模型运行始终:对高风险操作请求自动拦截;涉及支付、数据删除、权限授予等敏感行为,必须经用户明确授权后方可继续执行。
跨设备无缝衔接
基于Harness框架,Qwen-UI-Agent具备主动服务意识,支持手机与电脑跨设备任务无缝衔接,并可与深度搜索能力深度融合,将网页信息检索与界面操作有机统一。
总结
Qwen-UI-Agent通过视觉理解屏幕内容并模拟人类操作,无需修改原有程序即可实现智能化交互,切实拓展智能体在真实世界中的应用广度与落地深度。其核心使命是攻克大量未开放API的传统软件应用的智能化难题。
以上就是阿里发布Qwen-UI-Agent:全球首款真机驱动的跨端GUI智能体基座模型的详细内容,更多关于Qwen-UI-Agent的资料请关注本站其它相关文章!
