HyperAIHyperAI

Command Palette

Search for a command to run...

Qwen-UI-Agent 技术报告:迈向下一代以真实世界为核心的基础 GUI 智能体

摘要

GUI 智能体有潜力成为现有数字设备上的通用执行器。为将其推向真实世界应用,我们构想的智能体应能在真实设备上可靠运行,跨平台执行工作流,将 GUI 交互与 CLI 执行相结合,完成长周期任务,主动启动有用服务,并以最少的人工干预自主提升自身能力。在此愿景指导下,我们提出 Qwen-UI-Agent,一个以真实世界为核心的基础 GUI 智能体,覆盖移动端、计算机使用、网页和 DeepSearch 环境。Qwen-UI-Agent 将多样化的沙盒环境与大规模真实设备移动运行时相结合。其统一动作空间将 GUI 操作与 CLI 执行交织在一起,并在单次模型轮次中生成批量动作。一个 AutoResearch 风格的数据飞轮利用智能体构建任务和环境、诊断失败并规划后续迭代。在线 RL 支持在超过 100 轮的轨迹上进行训练,超过 10,000 个并发环境加速了 rollout。一个轻量级适配层支持跨移动端和计算机的主动服务启动与有状态工作流。在广泛的评估套件中,Qwen-UI-Agent 在移动端使用基准上取得了最先进的性能,同时在计算机和浏览器使用任务上展现出与前沿模型(包括 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol)相比具有竞争力的表现。在移动端使用方面,它在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,在 AndroidDaily 上达到 97.5%。在计算机使用方面,它在 OSWorld-Verified 上达到 79.5%,在 OSWorld-v2 上取得 40.0% 的部分进度得分。在浏览器使用和 GUI 定位方面,它分别在 WebArena 上达到 73.6%,在 ScreenSpot-Pro 上达到 81.5%。

一句话总结

阿里巴巴集团推出 Qwen-UI-Agent,一个以真实世界为中心的基础 GUI agent,统一了移动端、电脑使用、网页和 DeepSearch 环境,具备融合 GUI 和 CLI 操作的统一动作空间、批量动作,以及 AutoResearch 风格的数据飞轮,并在超过 10,000 个并发环境中进行在线 RL 训练,在移动端使用方面取得了最先进的结果,包括在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,同时在电脑和浏览器使用方面展现出与 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol 等前沿模型相比具有竞争力的性能。

核心贡献

  • Qwen-UI-Agent 是一个基础 GUI agent,统一了移动端、电脑使用、网页和 DeepSearch 环境,具备融合 GUI 和 CLI 的操作空间,能够在单次模型轮次中生成批量动作。
  • 一个 AutoResearch 风格的数据飞轮自主构建任务和环境,诊断失败,并规划迭代改进,搭配一个支持在超过 10,000 个并发环境中进行超过 100 轮次轨迹训练的在线 RL 训练框架。
  • Qwen-UI-Agent 在移动端使用方面取得了最先进的性能,在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,在 AndroidDaily 上达到 97.5%,同时在电脑使用和浏览器使用方面取得了与包括 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol 在内的前沿模型相比具有竞争力的分数。

引言

图形用户界面仍然是数字服务的主要访问层,这使得能力强的 GUI agent 成为实现通用任务自动化的一个有前景的途径,无需每个应用程序都暴露专用的 API。尽管多模态基础模型推动了在模拟基准测试上的快速进展,现有的 agent 仍然难以将这种性能迁移到真实世界的设备上,难以维持长周期的执行,也难以跨越移动端、网页和桌面环境的工作流。作者介绍了 Qwen-UI-Agent,这是一个基础 GUI agent,旨在通过在物理移动硬件上运行、在统一的跨平台工作流中结合 GUI 和 CLI 动作、将在线强化学习扩展到超过一百步的轨迹,以及通过 agent 驱动的数据飞轮自动化大部分能力开发循环,来弥合这种从模拟到现实的差距。

数据集

作者构建了两个不同的数据资源:一个由 agent 驱动的数据飞轮生成的训练语料库,以及一个名为 MobileWorld-Real 的留出评估基准。

来自 agent 驱动飞轮的训练数据

  • 来源与生成: 强大的基础模型分析跨移动端、桌面和网页的领域知识和能力。它们生成一个初始的任务池和环境上下文。通过执行这些任务来收集候选轨迹。
  • 过滤与质量控制: 遵循 MAI-UI 方法,应用多轮拒绝采样。一个基于 VLM 的步骤级评判员检查每条轨迹,并提取最大连续正确步骤、每个反思或探索阶段的第一步,以及恢复段。仅保留这些细粒度片段,从成功和失败的运行中恢复有效的监督信号。
  • 迭代优化: 在训练初始 SFT 策略后,agent 驱动的失败分析识别模型弱点,并将其映射到有针对性的优化目标。合成新的任务、环境和任务特定的验证器来解决这些差距,并将接受的轨迹添加到语料库中,从而闭合循环。
  • 用途: 过滤后的轨迹被聚合到一个统一的 SFT 语料库中,用于训练一个强大的初始策略。为可能存在可靠结果检查的任务构建可执行验证器;这些为在线 RL 提供高精度信号。步骤级判断用于扩展 SFT 的过程监督,而可执行验证器则为 RL 提供结果奖励。

MobileWorld-Real 评估基准

  • 构成与规模: 409 个端到端任务,涵盖 104 个真实的 Android 应用程序,分为 7 个日常使用领域:内容消费、生活服务、生产力、电子商务、系统设置、金融服务和社交沟通。
  • 来源与真实性: 任务由人类贡献者编写,以反映日常需求。它们在带有真实账户、内容和网络的真实设备上运行,使 agent 暴露于弹窗、过期登录、权限请求、CAPTCHA 和其他真实世界的干扰中。
  • 任务特征: 近一半的任务被标记为困难,涉及长周期执行、比较和排序、基于变化信息的推理、深度嵌套导航、弹窗恢复和跨应用协调。任务可能需要 agent 询问缺失信息或请求用户接管。
  • 处理与评估: 每次运行生成一条与屏幕截图对齐的完整轨迹。AutoJudge,一个轨迹级评估器,使用五个独立的 VLM 评判员进行多数投票,以分配三种结果之一:通过、失败或环境错误。环境错误单独报告,并从成功率的分母中排除,以减少真实设备可变性带来的噪声。
  • 用途: 所有 MobileWorld-Real 任务和收集的轨迹均不参与训练。该基准衡量在受控环境中学习到的能力是否能迁移到真实设备上,作为沙盒评估的补充。

方法

作者将 Qwen-UI-Agent 设计为一个用于构建高级基础 GUI agent 的集成系统。该系统包括环境基础设施、自动化数据飞轮、统一训练框架和衔接层。

一个任务被定义为 τ=(I,Eτ)\tau = (I, \mathcal{E}_\tau)τ=(I,Eτ),其中 III 是用户指令,Eτ\mathcal{E}_\tauEτ 是数字环境集合。在决策步骤 ttt,agent 接收一个多通道观察 ot=(otGUI,otCLI,otAPI)o_t = (o_t^{\text{GUI}}, o_t^{\text{CLI}}, o_t^{\text{API}})ot=(otGUI,otCLI,otAPI),并预测一个中间推理输出 rtr_trt 和一个可执行动作输出 at\mathbf{a}_tat

(rt,at)=πθ(I,ot,ht)(r_t, \mathbf{a}_t) = \pi_\theta(I, o_t, h_t)(rt,at)=πθ(I,ot,ht)

其中 hth_tht 表示之前的交互历史。模型可以生成单个动作或批量动作序列 at=(at(1),,at(Kt))\mathbf{a}_t = (a_t^{(1)}, \dots, a_t^{(K_t)})at=(at(1),,at(Kt))。统一的动作空间涵盖 GUI 交互、CLI 命令和 API 调用。关于主动跨平台任务执行的示例轨迹,请参考框架图。

环境基础设施围绕四个核心组件组织,以支持可扩展和真实的 agent 学习。首先,模拟沙盒环境为移动端、电脑、浏览器和深度搜索任务提供可控的设置。其次,一个从模拟到现实的桥梁将 agent 扩展到带有实际应用程序和网络状态的真实设备。第三,一个混合的 GUI 和 CLI 动作空间将图形操作与直接命令执行交织在一起。最后,一个统一接口标准化了跨异构环境的思考、动作和观察循环。如下图所示,该基础设施从大规模虚拟沙盒延伸到真实世界的设备。

为了解决真实设备的不稳定性,作者构建了一个真实设备移动运行时。如下图所示,一个健康感知调度器持续跟踪设备、应用程序和网络的健康状况,将任务路由到符合条件的运行时,并拉黑不健康的运行时。虚拟显示器允许单个物理手机托管多个并发的应用程序会话。一个专门的 User Agent 处理需要明确用户批准的敏感操作。此外,一个基于 VLM 的评判员检查轨迹,以区分任务成功、模型失败和环境失败,并将确认的环境问题反馈给调度器进行恢复。

持续改进 agent 需要一个迭代过程。作者引入了一个 agent 驱动的数据飞轮,将人类参与转变为高层监督。如下图所示,该飞轮由领域能力引导和一个迭代优化循环组成。在引导期间,强大的基础模型分析领域知识以生成初始任务和环境上下文。在迭代循环中,系统评估性能,诊断失败,并合成有针对性的任务和验证器以解决特定的弱点。步骤级 VLM 评判员和轨迹级验证器为训练提供可扩展的监督。

训练框架结合了监督微调(SFT)和强化学习。对于 SFT,作者采用领域条件专家训练,将移动端、桌面和网页的专门专家合并到一个统一的模型中。他们还使用滑动窗口训练来高效处理长轨迹。为了纠正反复出现的动作错误,例如易混淆元素定位或过早完成,他们引入了 Action RL。此阶段使用针对性的错误模式数据和一个动作感知的奖励函数:

rt=Ft(wtypeCt+wargCtQtλsensStλrepLt)r_t = F_t(w_{\text{type}}C_t + w_{\text{arg}}C_tQ_t - \lambda_{\text{sens}}S_t - \lambda_{\text{rep}}L_t)rt=Ft(wtypeCt+wargCtQtλsensStλrepLt)

其中 FtF_tFt 表示格式有效性,CtC_tCtQtQ_tQt 衡量动作类型正确性和参数质量,而 StS_tStLtL_tLt 惩罚不正确的敏感动作和重复。对于长周期决策,Online RL 使用群体相对策略优化(GRPO)和模型自适应任务课程来优化端到端任务成功,该课程根据当前策略能力动态调整任务难度。

最后,衔接层将核心 agent 扩展到孤立的单任务执行之外。它连接来自用户数字环境的信号,以启用主动服务和跨平台工作流。对于主动服务,衔接层将移动通知解析为结构化事件,将其与持久事务关联,并在用户询问之前准备决策就绪的建议。关于由航班取消通知触发的旅行恢复计划的演示,请参考下图。

对于跨平台执行,衔接层充当一个分层的规划器-执行器系统,将目标分解为依赖感知的子任务,并在移动端和电脑环境之间协调并行执行,同时保持共享上下文。

实验

评估设置涵盖移动端、电脑、浏览器、DeepSearch、GUI 定位和通用 agent 基准测试,将三个 Qwen-UI-Agent 变体与前沿专有模型、开放权重基础模型和专门的 GUI agent 进行比较。每个实验验证一项独特的能力:移动端使用测试展示了在模拟和真实设备环境上最先进的长周期、跨应用执行能力;电脑使用评估通过混合 GUI 和 CLI 动作空间与批量执行展示了具有竞争力的性能;浏览器和 DeepSearch 结果证实了强大的网页导航和证据综合能力;GUI 定位基准测试揭示了跨不同界面的准确元素定位能力;通用能力评估表明 GUI 后训练保留了广泛的推理和 agent 技能。行为分析进一步揭示,有限的真实设备经验会导致特定的失败模式,如探索循环和弹窗干扰,而 Action RL 和 Online RL 系统地纠正了步骤级错误,并培养了轨迹级模式,如验证完成和跨模态协作。总体而言,Qwen-UI-Agent 在所有评估领域都取得了领先或极具竞争力的结果,其 27B 模型在任务能力、真实设备可靠性和部署效率之间提供了有利的平衡。

Online RL 使 agent 从过早宣布成功转变为在终止前验证结果。这导致更均衡地使用 Bash 进行执行和 GUI 进行视觉检查,并出现了跨模态协作,从而改善了长周期约束满足。经过 Online RL 后,包含至少一个验证动作的轨迹增加了 14.7%,而错误停止率下降了 11.2%。GUI 动作的份额增加了 6%,结合 GUI 和 Bash 的轨迹增加了 10.6%,执行-验证转换从 40.2% 增长到 52.4%。经过 Online RL 后,在 OSWorld 上的约束满足提高了 8.6%,在 BrowseComp-ZH 上提高了 7.5%。

在 MobileWorld 的纯 GUI 子集上,Qwen-UI-Agent-27B 取得了最高的成功率,大幅超越了通用视觉语言模型和专门的 GUI agent。其较小的变体也超过了所有专门的基线和大多数通用模型,展示了在标准步骤预算下强大的移动任务完成能力。Qwen-UI-Agent-27B 的成功率达到 82.1%,超过次优通用模型 8.9 个百分点。最强的专门 GUI 基线 GUI-Owl-1.5-32B-Instruct 达到 43.9%,Qwen-UI-Agent-27B 超过其 38.2 个百分点。Qwen-UI-Agent-35B-A3B 达到 65.0%,超过了所有专门的 GUI 模型和除 Seed 2.1 Pro 和 Claude Opus 4.8 之外的所有通用 VLM。在通用 VLM 中,Seed 2.1 Pro 以 73.2% 领先,其次是 GPT-5.6 Sol 的 70.1% 和 Claude Opus 4.8 的 67.5%。

在真实设备移动基准测试上,所提出的模型取得了强劲的性能,其最大变体在 MobileWorld-Real 和 AndroidDaily 上都达到了最高的成功率。它超越了多个闭源通用视觉语言模型,并大幅优于所有专门的 GUI 基线,而较小的变体也超过了所有专门的模型和大多数通用竞争对手。最大模型在 MobileWorld-Real 和 AndroidDaily 上都取得了最高的成功率,超越了 Seed 2.1 Pro、Gemini 3.1 Pro、GPT-5.6 Sol 和 Claude Opus 4.8 等闭源模型。27B 模型在 MobileWorld 上大幅超越了最强的专门 GUI 基线 GUI-Owl-1.5-32B-Instruct。较小的 35B-A3B 变体在 MobileWorld 上达到了 65.0% 的成功率,超过了所有专门的 GUI 基线和除 Seed 2.1 Pro 和 Claude Opus 4.8 之外的所有通用视觉语言模型。在 AndroidDaily 上,多个闭源模型达到了 92% 以上的成功率,所提出的模型以 95.2% 领先。开源和较小的模型,如 Qwen 3.7 Plus 和 Kimi K2.6,在两个基准测试上的得分都相当低,在 MobileWorld-Real 上低于 80%,在 AndroidDaily 上低于 80%。

Qwen-UI-Agent 在 OSWorld-Verified 上取得了 79.5% 的成功率,排名第二,超越了大多数领先的闭源模型和所有评估过的开放权重基础模型。它仅落后于 Claude Opus 4.8,同时超越了 Seed 2.1 Pro、GPT-5.5、Gemini 3.5 Flash、Gemini 3.1 Pro 和 Qwen 3.7 Plus。Qwen-UI-Agent 在所有比较模型中取得了第二高的成功率,仅次于 Claude Opus 4.8。它超越了所有评估过的开放权重模型和多个知名的闭源替代方案,包括 GPT-5.5 和 Gemini 3.5 Flash。该模型的性能在此基准上相对于最强的开放权重基线确立了实质性的领先优势。

在 OSWorld-v2 上,Qwen-UI-Agent 取得了 40.0% 的部分进度分数和 13.9% 的二元完成率,使其在前沿闭源模型中具有竞争力。它大幅超越了所有开放权重模型,部分进度提高了超过 17 个百分点,二元完成率提高了超过 9 个百分点,超过了最强的开放权重基线,同时每个任务所需的步骤数要少得多。批量动作设计有助于其效率,平均步骤数为 135.8,而单动作开放权重模型超过 170 步。Qwen-UI-Agent 在二元完成率上超过 GPT-5.5 0.9 个百分点,但在部分进度上落后 9.5 个百分点。它每个任务仅需 135.8 步,远少于 MiniMax M3 (326.7) 和 Qwen 3.7 Plus (173.5),展示了批量动作的效率。

Online RL 使 agent 从过早宣布任务完成转变为在终止前验证结果,导致更均衡地使用 Bash 和 GUI 动作,并出现跨模态协作,从而改善了长周期约束满足。Qwen-UI-Agent 系列在多个基准测试上取得了强劲的结果:在纯 GUI 的 MobileWorld 上,27B 模型大幅超越了通用视觉语言模型和专门的 GUI agent;在真实设备移动基准测试上,最大变体取得了最高的成功率并超越了多个闭源模型;在 OSWorld-Verified 上,它排名第二,仅次于 Claude Opus 4.8,同时超越了所有评估过的开放权重模型;在 OSWorld-v2 上,它在与前沿闭源模型的竞争中取得了具有竞争力的分数,同时由于其批量动作设计,大幅超越了所有开放权重基线,且效率更高。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供