8月20日消息,阿里千问大模型正式推出Qwen-UI-Agent。这是一款面向真实设备场景的GUI图形界面智能体基座模型,可覆盖手机移动端、PC桌面端、网页浏览器以及深度搜索等多类使用环境。
其最大亮点在于,AI如今能够直接理解屏幕界面内容,像人类一样操作App和各类软件,成为适用于数字设备的通用执行智能体。

在性能测试方面,Qwen-UI-Agent在多项权威基准评测中均达到行业领先水准。其中,移动端MobileWorld得分达到82.1%,真机测试基准MobileWorld-Real更是高达92.2%,AndroidDaily成绩也达到97.5%。
在电脑端评测中,OSWorld?Verified取得79.5%,浏览器任务基准WebArena获得73.6%。
在ScreenSpot-Pro界面定位测试中,模型准确率达到81.5%,多项榜单成绩刷新SOTA。综合表现与GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等海外旗舰大模型相比不落下风,部分场景甚至更强,同时也保留了基座模型原有的通用能力和Agent智能体能力。

该模型基于大规模真实设备环境训练,构建了由100多台真机手机和150余款应用组成的测试集群,打通了从仿真模拟到真实设备部署落地的完整链路。
安全机制贯穿整个执行流程。面对高风险请求,系统会直接拒绝;涉及支付、数据删除、权限授权等敏感操作时,必须经过用户确认后才会继续执行。

Qwen-UI-Agent支持GUI图形界面操作与CLI命令行混合执行,也支持批量动作输出。在电脑任务中,接近一半的场景可调用命令行能力,从而有效减少操作步骤,进一步提升自动化执行效率。
同时,模型支持超过100步的超长轨迹在线强化学习,并通过上万并发环境进行训练迭代,结合AutoResearch式AI驱动数据飞轮,形成任务闭环优化能力。


依托Harness框架,模型具备主动服务能力,支持手机与电脑之间的跨设备任务接力,还能与DeepSearch深度搜索联动,将网页信息检索与界面自动操作相结合。
Qwen-UI-Agent的目标,是解决大量没有开放API的传统软件和应用使用难题。无需对现有程序进行改造,AI仅凭“看懂屏幕”即可完成操作,进一步拓展智能体在真实场景中的落地边界。


