アリババは、現実世界を基盤としたGUIスマートエージェントのベースモデル「Qwen-UI-Agent」を正式にリリースしました。このモデルはモバイル端末、コンピュータ、ウェブ端末、および深層検索環境をすべてカバーしており、従来のシミュレーションテストの制約を打ち破り、複雑な現実的なデバイス上でシームレスに動作する能力を備えています。

業界トップクラスを超える総合性能
さまざまな権威あるテストと実際の環境において、Qwen-UI-Agentは強力な実力を示しています:
- モバイル端末でのパフォーマンス: MobileWorldテストで82.1%という高いスコアを獲得し、多くの主流の国際的なスタンドアローンモデルを上回りました。また、自社で構築した100台の本物のスマートフォンを用いたMobileWorld-Realでは、成功率が92.2%に達し、Android Dailyではほぼ満点に近い成績を収めています。
- コンピュータ端末でのパフォーマンス: OSWorld-Verifiedで79.5%の成績を収め、いくつかのタスクにおいてベースラインに比べて実行ステップ数を大幅に節約しています。
- ウェブと汎用性: WebArenaウェブテストで対比モデルの中で最も高い順位を記録し、その汎用性とAgentic能力はトレーニングベースモデルを全面的に超えており、長尾ニーズにも対応できます。
シミュレーションから真実へと進む本物の端末環境
「シミュレーションから真実への最後の1マイル」をつなぐために、Qwen-UI-Agentは100台以上の本物のスマートフォン、150以上のアプリケーションをカバーする本物のモバイル環境を構築しました。これはタスク構築、トラッキングの収集、モデルの訓練に使用され、400以上のタスクを含むMobileWorld-Realの本物のベンチマークを導入しました。これにより、開発チームは本物の端末の成功確率に基づいて正確な選定が可能です。

効率的なコマンドとセキュリティ管理を両立
機能特性において、このモデルは通常のGUIインターフェース操作だけでなく、コマンドライン操作も直接実行でき、一度の意思決定で一括アクションを出力することで、実行軌跡を大幅に短縮し、効率を向上させます。さらに、完全なプロセス全体のセキュリティ判断メカニズムを備えています。違法または高リスクのリクエストには直接拒否し、タスクを終了します。支払い、データ削除、プライバシーの許可などのセンシティブな場面では、重要なステップで一時停止してユーザーの確認を待つようにしています。
また、このモデルは100ステップ以上の長い軌跡でオンライン強化学習の訓練が可能で、自己適応的なコース学習と組み合わせることで、高難易度の長期タスクを継続的に克服していきます。
プロジェクトのホームページ:https://tongyi-mai.github.io/Qwen-UI-Agent/
VIP会員