阿里Qwen-UI-Agent 破百台真機受訓

8月20日,阿里千問團隊推出Qwen-UI-Agent,一個面向真機的GUI智能體基礎模型。它要做的事聽起來很單純:讓模型看懂畫面,然後像人一樣點、滑、輸入,把一件事從頭做到尾。涵蓋範圍包括手機、電腦、網頁,以及帶連網檢索的DeepSearch環境。

官方公布的成績單相當豐富。手機端,MobileWorld拿到82.1%,真機版MobileWorld-Real 92.2%,AndroidDaily 97.5%;電腦端,OSWorld-Verified 79.5%,瀏覽器任務WebArena 73.6%,中文檢索題BrowseComp-ZH 75.0%;介面元素定位這一項,ScreenSpot-Pro報出81.5%。在OSWorld-v2的部分任務上,官方稱完成率40.0%的同時把執行步數壓低了約58%。列出的比較對象是GPT-5.6 Sol、Claude Opus 4.8和Gemini 3.1 Pro這一檔。

破百台手機堆出來的訓練場

比跑分更能說明投入方向的,是背後那套環境。阿里搭了一個超過100台真機、涵蓋150多款應用的機房,配了400多個任務的真機基準,同時能跑一萬個並行環境,強化學習的軌跡長度支援到100步以上。

這條路線偏重資產投入。GUI智能體這幾年大多在模擬器或網頁沙盒裡訓練,成本低、可重現,代價是模擬器和真機之間隔著一層:真機會跳廣告、會彈權限視窗、會因為網路不穩卡在讀取畫面,這些恰好是長任務容易翻車的高頻位置。把機房搬進來,等於用硬體成本換取分布對齊。

單步精準度和長任務成功率之間的落差也在這裡。粗略算一下,假設每一步的成功率是81.5%,一個100步的任務想一次走完,機率低到可以忽略。撐住長流程靠的是出錯之後能自己發現、退回、換一條路,而真機環境提供的恰好是這類翻車樣本——模擬器裡很難自然長出來。

桌面端混著命令列用

電腦端有個細節:官方說這套方案支援介面操作和命令列的混合動作,大約一半的桌面任務用到了CLI呼叫。

這在工程上算是一種承認。純靠點滑鼠去完成「把這批檔案按日期分類再壓縮」這類任務,步數會膨脹到失控;能打命令列的智能體直接跳過幾十次點擊。代價是權限邊界變得敏感,一條指令的破壞範圍遠大於一次誤點。跨裝置接力則交給Harness框架,手機上沒做完的工作可以遞到電腦上接著做。

安全線畫在哪

「面對違法或高風險請求,它不會執行任何介面操作,直接拒絕並終止任務」,官方這樣描述模型的拒絕策略。付款、刪除資料、修改授權這類敏感動作,則要求使用者先確認。

對中國用戶來說,這套機制的實際約束力,要等真機推送之後才看得出來。手機上的高風險操作往往不長成明顯的樣子——一個免密付款的確認頁面和一個普通的「下一步」按鈕,在像素上差別有限,模型判斷依靠的是上下文,而非控制項外觀。

誰來接這套東西

技術報告已經掛上arXiv,程式碼倉庫放在GitHub上的Tongyi-MAI/MAI-UI。這個倉庫先前開源過MAI-UI系列,2B到235B四種尺寸,採用Apache 2.0授權。Qwen-UI-Agent的權重開放範圍目前還沒有明確說法。

從落地順序來看,最先受益的大概率是手機廠商和PC廠商——他們手上有系統層級權限,也有把智能體塞進語音助理的現成入口。第三方應用要接進來,繞不開協助工具權限這道關卡,而這道關卡在中國的合規口徑一直收得比較緊。

參考來源:千問大模型官方公眾號、IT之家、CocoLoop、快科技;Qwen-UI-Agent技術報告與專案主頁核驗各項基準口徑與真機環境規模。