阿里发Qwen-UI-Agent,拿100多台真机练操作

8 月 20 日,阿里千问团队推出 Qwen-UI-Agent,一个面向真实设备的 GUI 智能体基座模型。它要干的事听上去很朴素:让模型看懂屏幕,然后像人一样点、划、输入,把一件事从头做到尾。覆盖范围包括手机、电脑、网页,以及带联网检索的 DeepSearch 环境。

官方给出的成绩单铺得很满。手机侧,MobileWorld 拿到 82.1%,真机版 MobileWorld-Real 92.2%,AndroidDaily 97.5%;电脑侧,OSWorld-Verified 79.5%,浏览器任务 WebArena 73.6%,中文检索题 BrowseComp-ZH 75.0%;界面元素定位这一项,ScreenSpot-Pro 报出 81.5%。在 OSWorld-v2 的部分任务上,官方称完成率 40.0% 的同时把执行步数压掉了约 58%。列出来的对比对象是 GPT-5.6 Sol、Claude Opus 4.8 和 Gemini 3.1 Pro 这一档。

一百多台手机堆出来的训练场

比跑分更能说明投入方向的是背后那套环境。阿里搭了一个超过 100 台真实手机、覆盖 150 多个应用的机房,配了 400 多个任务的真机基准,同时能跑一万个并发环境,强化学习的轨迹长度支持到 100 步以上。

这条路线偏重资产。GUI 智能体这几年大多在模拟器或者网页沙箱里训练,成本低、可复现,代价是模拟器和真机之间隔着一层:真机会弹广告、会跳权限框、会因为网络抖动卡在加载页,这些恰恰是长任务翻车的高频位置。把机房搬进来,等于用硬件成本换分布对齐。

单步精度和长任务成功率之间的落差也在这里。粗算一下,假如每一步的成功率是 81.5%,一个 100 步的任务想一次走通,概率低到可以忽略。撑住长流程靠的是出错之后能自己发现、退回、换一条路,而真机环境提供的恰好是这类翻车样本——模拟器里很难自然长出来。

桌面端混着命令行用

电脑端有个细节:官方说这套方案支持界面操作和命令行的混合动作,大约一半的桌面任务用到了 CLI 调用。

这在工程上算是一种承认。纯靠点鼠标去完成”把这批文件按日期分好类再压缩”这种任务,步数会膨胀到失控;能敲命令行的 Agent 直接跳过几十次点击。代价是权限边界变得敏感,一条命令的破坏半径远大于一次误点。跨设备接力则交给了 Harness 框架,手机上没做完的活可以递到电脑上接着做。

安全线画在哪

“面对违法或高风险请求,它会不执行任何界面操作,直接拒绝并终止任务”,官方这样描述模型的拒绝策略。支付、删除数据、修改授权这类敏感动作则要求用户先确认。

对国内用户来说,这套机制的实际约束力要等真机推送之后才看得出来。手机上的高风险操作往往不长成明显的样子——一个免密支付的确认页和一个普通的”下一步”按钮在像素上区别有限,模型判断依赖的是上下文而非控件外观。

谁来接这套东西

技术报告已经挂到 arXiv,代码仓库放在 GitHub 上的 Tongyi-MAI/MAI-UI。这个仓库此前开源过 MAI-UI 系列,2B 到 235B 四个尺寸,用的是 Apache 2.0 协议。Qwen-UI-Agent 的权重开放范围目前还没有明确说法。

从落地顺序看,最先受益的大概率是手机厂商和 PC 厂商——他们手里有系统级权限,也有把 Agent 塞进语音助手的现成入口。第三方应用要接,绕不开辅助功能权限这道坎,而这道坎在国内的合规口径一直收得比较紧。

参考来源:千问大模型官方公众号、IT之家、CocoLoop、快科技;Qwen-UI-Agent 技术报告与项目主页核验各项基准口径与真机环境规模。