阿里巴巴於8月20日正式發佈了全新的GUI智能體基座模型Qwen-UI-Agent。該模型全面覆蓋移動端、電腦端、網頁端及深度搜索(DeepSearch)環境,並在多項核心圖形用戶界面基準測試中全面對標並超越業界多款旗艦模型。

在具體的基準表現方面,Qwen-UI-Agent在移動端展現出強勁實力。在MobileWorld基準上得分爲82.1%,分別領先GPT-5.6Sol和Claude Opus4.8達12.0和14.6個百分點;在真實環境基準MobileWorld-Real上取得了92.2%的成績,超越了Gemini3.1Pro、Claude Opus4.8以及GPT-5.6Sol;在AndroidDaily基準上更是高達97.5%,接近滿分表現。在電腦端與瀏覽器方面,其在OSWorld-Verified上達到79.5%,超越GPT-5.5和Gemini3.1Pro;在WebArena上也以73.6%的成績位列所有對比模型第一。此外,在GUI Grounding的ScreenSpot-Pro測試中取得81.5%的分數,並刷新了其餘4個評測基準的SOTA記錄。

image.png

爲了攻克從模擬到真實的落地難題,Qwen-UI-Agent搭建了覆蓋100多臺真實手機和150多款應用的真機移動環境,用於執行任務構建、軌跡採集、模型訓練與評測,並自建了包含400多項任務和100多款應用的MobileWorld-Real真機基準。除了常規的GUI點擊操作外,該模型還支持直接執行命令行操作,並在單次決策中批量輸出多個動作,其中電腦任務中的CLI動作佔比近半,約40%的動作以批量形式輸出。

image.png

在安全性與長程任務處理方面,Qwen-UI-Agent將安全機制貫穿任務執行的全過程。面對違法或高風險請求,模型會直接拒絕並終止任務;而在面對支付、數據刪除、隱私授權等敏感場景時,則會在關鍵步驟主動停手並向用戶說明情況。同時,模型支持在超過100步的超長軌跡上進行在線強化學習訓練,配合約10000個併發環境同時rollout,持續攻克高難度的長程任務。