HyperAIHyperAI

Command Palette

Search for a command to run...

15 小时前
Agent
多模态

UI-Mate:通过上下文演示推进开放权重基础 GUI 智能体

摘要

基础 GUI 智能体在自动化复杂数字任务方面具有巨大潜力,但其部署受到两个关键挑战的制约:训练层面的数据稀缺与分布偏差,以及交互层面的提示模糊与执行不可靠。日常工作流高度依赖用户特定的工具和隐性惯例,未明确说明的指令在不同运行之间容易产生任意变化——因此一个智能体可能一次成功,下一次却失败。我们提出 UI-Mate,一个旨在通过整合环境锚定训练栈与上下文演示学习来克服这些瓶颈的基础 GUI 智能体。UI-Mate 包含三项核心贡献:可扩展的环境锚定训练栈:一个闭环数据引擎,自动化任务生成、环境构建、轨迹展开、过滤和分层能力平衡,通过统一的任务-验证器包在大规模并行环境中为监督微调(SFT)和在线强化学习(RL)提供数据。上下文演示学习:一种将多模态演示转化为灵活的、子任务级工作流的机制,而非重放僵化的轨迹,在关键步骤遵循演示内容,同时基于实时界面自主重新规划。OSWorkerBench 基准与洞见:一个涵盖 41 个应用、100 个长时程办公任务的基准,支持仅指令评估和演示引导评估。其演示资源将 33 个任务的自我演示设置(由同一目标的成功强智能体轨迹构建)与 45 个任务的变体演示设置(由相关但非完全相同任务的人类记录构建)区分开来。实验表明,UI-Mate-27B 在通用计算机使用基准上创造了新的开放权重最优水平,在 OSWorld-Verified 上得分为 77.0%,在 WindowsAgentArena 上得分为 66.2%。在 OSWorkerBench 上,它达到 41.0% 的严格成功率和 76.9% 的进度率,分别比其 Qwen3.6-27B 基础模型高出 17.7 和 24.5 个百分点。在 33 个任务的自我演示子集上,一次演示将严格成功率从 17.2% 提升至 35.4%,将进度率从 67.9% 提升至 81.1%,显著提高了长时程可靠性。

一句话总结

腾讯 Hy Frontier 团队提出了 UI-Mate,一个基础 GUI agent,它将环境接地的训练栈与上下文演示学习相结合,将多模态演示转换为灵活的子任务级工作流,并引入了 OSWorkerBench,一个包含 41 个应用中 100 个长时程办公任务的基准;UI-Mate-27B 在 OSWorld-Verified 上达到 77.0%,在 WindowsAgentArena 上达到 66.2%,在 OSWorkerBench 上比其 Qwen3.6-27B 基座高出 17.7 个严格成功分。

核心贡献

  • UI-Mate 是一个基础 GUI agent,它将可扩展的环境接地训练栈与上下文演示学习相结合。该训练栈提供闭环数据引擎,可自动执行任务生成、环境构建、rollout、过滤和分层能力均衡,用于在大规模并行环境中通过统一的任务验证器包进行监督微调和在线强化学习。
  • 上下文演示学习机制将多模态演示转换为灵活的子任务级程序化工作流,而不是复现僵化的轨迹。它选择性地遵循、跳过或调整演示步骤,并从当前界面重新规划,以支持演示引导的程序化泛化。
  • OSWorkerBench 是一个包含 41 个应用中 100 个长时程办公任务的基准,支持仅指令和演示引导评估,并区分 33 个自演示和 45 个变体演示资源。UI-Mate-27B 在 OSWorld-Verified 上达到 77.0%,在 WindowsAgentArena 上达到 66.2%,在 OSWorkerBench 上达到 41.0% 的严格成功率和 76.9% 的进度(比其 Qwen3.6-27B 基座分别高出 17.7 和 24.5 分),在 33 个任务的自演示子集上,一个演示将严格成功率从 17.2% 提高到 35.4%,将进度从 67.9% 提高到 81.1%。

引言

基础 GUI agent 可以将自然语言意图转化为多步桌面操作,但真实部署受到两个瓶颈限制。训练数据偏向短小的单应用任务,导致长时程工作流、跨应用迁移和错误恢复稀疏;简洁指令省略用户特定的程序细节,导致类似请求的执行不一致。作者用 UI-Mate 解决这一问题,UI-Mate 是一个开放权重的基础 GUI agent,将环境接地训练与上下文演示学习相结合。闭环数据流水线构造可执行任务和验证器,过滤 rollout,并使用分层能力树重新平衡覆盖,而 DemoCUA 将人类或 agent 演示转换为自适应子任务级工作流,而不是刚性动作重放。作者还引入 OSWorker-Bench,用于在仅指令和演示引导设置下评估长时程办公任务。

数据集

作者描述了两个数据层:训练与强化学习数据流水线,以及 OSWorkerBench 基准。

训练与强化学习数据流水线

来源与构成

  • 开源计算机使用数据集(包括 AgentNet 和 ScaleCUA)提供来自真实用户活动的日常任务。
  • 由失败或停滞 rollout 分解出的原子子任务聚焦于 agent 觉得困难的操作。
  • 从真实文档、电子表格、演示文稿和静态网站生成的指令提供了具体实体和长时程多应用工作流。
  • 由应用规范构建的能力树覆盖常见工作流可能跳过的细粒度操作。
  • 整体分布有意偏向日常办公使用。

环境构建

  • LLM 识别所需文件,并在需要时生成可执行的设置代码来创建它们。
  • 设置代码上传资源并配置操作系统、应用和任务特定状态。
  • 随机化会改变壁纸、桌面布局、应用设置和侧边栏位置,同时保持任务可行性。
  • 开源文档、演示文稿、电子表格、图像、视频和音频被索引并检索为真实的接地资源。
  • 仅在没有合适的真实文件时才使用合成文件。

Rollout 与过滤

  • Rollout 基础设施通过云虚拟机后端支持 Ubuntu、Windows 和 macOS,以进行并行执行。
  • 过滤分为两个阶段:
    • 多模态评判器验证任务和环境设置,并拒绝模糊、不可行、格式错误或已经满足的轨迹。
    • 步骤级结果验证在 GUI 观察和动作中跟踪可独立验证的交付项。
  • 仅当每个交付项都有证据支持时,轨迹才会被保留。

能力分类与再平衡

  • 任务被映射到一个共享能力树,包含三个层级:应用、粗粒度能力和细粒度操作。
  • 一个单独的跨应用领域覆盖连接应用的行为。
  • 数据再平衡使用目标覆盖率、观测密度、rollout 成功率和过滤拒绝率。
  • 低密度能力会触发更多生成,供应过剩的能力会被降权,任务长度被视为单独的采样维度。

人工标注

  • 来自真实工作流的人工标注轨迹补充了自动化 rollout,并捕获长尾交互模式。
  • 验证包括确定性结构检查以及对任务完成和状态转换的多模态审查。
  • 观察修复通过选择较早或较晚的缓冲帧,修复来自光标或悬停状态的目标泄露以及渲染不完整。
  • 教师模型在保持人类动作参数不变的情况下,用推理和自然语言动作重新标注人类记录。

可验证的 RL 任务

  • 每个 RL 任务包包括指令、环境、固定初始状态、参考完成状态和可执行验证器。
  • 不变性要求初始状态得分为 0,参考完成状态得分为 1。
  • 生成使用能力引导采样,并将环境构建与奖励构建解耦。
  • 评估器优化使用硬负样本探针、替代正样本探针和 rollout 反馈。
  • 只有通过不变性检查以及正负证据测试后,任务才会被提升到 RL 语料库。

所提供的摘录未指定具体数据集大小、训练划分百分比或最终混合比例。分配通过基于能力的再平衡描述,而不是固定比例。

OSWorkerBench 基准

组成

  • OSWorkerBench 包含 100 个真实办公任务,覆盖 41 个规范化应用和 10 个职位族。
  • 全部 100 个任务支持仅指令评估。
  • 基准包含两个独立标注、可能有重叠的子集:
    • 67 个长时记忆任务,要求延迟重用动态信息或持续跟踪工作流状态。
    • 49 个多应用任务,要求在至少三个逻辑应用之间传递动态的多字段信息。

演示引导设置

  • 自演示:33 个任务与同一任务的成功强 agent rollout 配对。
  • 变体演示:45 个任务与来自语义相关但非同一源任务的人类演示配对。
  • 33 和 45 是独立的演示集合,不是 100 个任务的划分。
  • 45 个变体演示任务尤其长时程,Kimi-2.6 在仅指令评估下平均每个任务超过 100 个决策轮次。

构建与处理

  • 工作流根据职位、应用、经过验证的 UI 能力和目标难度合成。
  • 难度在合成过程中沿广度、深度和推理轴分配。
  • 密集评估器包含 1 到 13 个检查点,平均为 4.86,中位数为 5。
  • 88 个任务在应用后端上使用基于状态的评估器,12 个任务针对电子表格、图像、复合文档或条件工作流使用任务特定评估器。
  • 人工审核员验证指令清晰度、设置完整性、可行性、检查点覆盖和预期部分得分。
  • 对于 DemoCUA 演示,一个能力较强的 GUI agent 首先生成轨迹,这些轨迹被转换为带标注截图的结构化动作序列。然后人工标注员补全未完成部分,删除冗余交互,并保留关键动作,而不泄露任务特定答案。

覆盖统计

  • 100 个任务中有 99 个至少需要两个应用。
  • 每个任务平均使用 3.26 个应用,最大为 7。
  • 常见中枢包括 Slack(65 个任务)、Gmail(34 个)、Google Sheets(31 个)、Salesforce(23 个)和 Google Calendar(19 个)。
  • Kimi-2.6 轨迹的观察到决策轮次中位数为 68,平均为 88.3;100 条轨迹中有 38 条达到至少 100 轮。

OSWorkerBench 用于评估而非训练,严格成功要求所有最终状态条件,部分进度由检查点加权分数衡量。

方法

作者将计算机使用任务定义为一对 T=(x,E)\mathcal{T} = (x, \mathcal{E})T=(x,E),其中 xxx 是自然语言指令,E\mathcal{E}E 是环境。agent 在离散决策步骤中交互,接收截图观察 oto_tot,并生成响应 yt=(rt,at)y_t = (r_t, a_t)yt=(rt,at),其中包含中间推理和要执行的动作。

为训练通用计算机使用策略,系统采用结合监督微调(SFT)与 Agentic 强化学习(RL)的训练栈。RL 流水线使用来自环境的可验证奖励,优化策略以完成任务。

如下图所示:

RL 系统运行在两个主要阶段:rollout 和更新。在 rollout 阶段,自适应采样器选择任务,优先考虑薄弱领域以确保广泛覆盖。策略服务器在线沙箱(环境服务器)交互,在 Web、Mail 和 Calendar 等应用中执行动作。这些交互生成的轨迹被收集到 rollout 池中。在更新阶段,结果验证器检查这些轨迹的最终状态以分配二值奖励。为了在最终结果之外改进功劳分配,可选的过程信用模型(PCM)分析轨迹步骤,识别进展、冗余和错误。然后,RL 训练器策略模型上执行异步 Group Relative Policy Optimization(GRPO)更新,利用决策轮次居中和 token 级归一化来处理不同轨迹长度和响应大小。

为使 agent 能够从用户特定程序中学习,作者引入了 DemoCUA,一个用于从上下文多模态演示中学习的模块。

参考框架图:

演示过程由离线捕获流水线和在线执行循环组成。离线时,原生记录器捕获事件序列。视觉语言模型(VLM)分析这些步骤以提取语义意图,并将其分组为连贯的子任务。在线时,agent 从 harness 接收实时截图和工作流钩子。该钩子提供进度清单、当前子任务目标和关键里程碑,但不提供像素坐标,从而引导 agent 在桌面环境中执行动作。

将这种演示集成到模型上下文中的结构旨在提供引导的同时防止捷径学习。

如下图所示:

上下文窗口将演示块注入第一个用户轮次。其中包括工作流进度(带有已完成、当前和待办标记的子任务清单)、当前子任务(具体目标和完成标准)以及当前子任务动作列表(关键里程碑)。这种设置确保 agent 聚焦于当前子任务。关键的是,动作列表仅包含关键里程碑,迫使模型从实时截图中推断中间步骤,而不是盲目复制演示。

最后,为部署,作者设计了 UI-Mate App,其模块化架构将模型逻辑与桌面控制分离。

架构如下图所示:

系统包含四个层。前端管理任务控制、可视化和演示捕获。后端入口验证目标并路由请求。Harness 驱动核心 agent 循环,处理模型推理、观察-推理-行动循环和上下文记忆。Bridge 将这些动作适配到特定操作系统,处理屏幕观察和输入执行。这种设计使 agent 可以在本地桌面或虚拟机上运行,而无需为已安装应用提供插件。

实验

论文在 OSWorld-Verified、WindowsAgentArena 和新引入的 OSWorkerBench 上评估 UI-Mate 与通用和专用 GUI agent 的对比,OSWorkerBench 为长时程跨应用办公工作流增加了基于密集检查点的评估器和人在回路验证。结果表明,环境接地训练使 UI-Mate 能够达到或超越更大的通用模型和此前的专用 agent,在操作系统控制、工作流协调、长时记忆和多应用任务上尤其有提升,而严格端到端成功仍受后期遗漏限制。在 OSWorld、OSWorkerBench 和 GameDev 上的演示引导评估表明,同任务演示可提高任务完成度和执行效率;进一步分析表明,历史推理有助于推断,但可能减少强化学习期间的探索。

UI-Mate-27B 在 OSWorld-Verified 上与强大的通用多模态模型具有竞争力,超过多个通用和专用计算机使用 agent,同时仍低于顶级闭源模型。较小的 UI-Mate-9B 在操作系统交互上已达到较大的 UI-Mate-27B 的水平,规模收益集中在应用和工作流任务。结果表明,对于计算机使用性能,训练数据覆盖率和质量可能与模型规模同样重要。UI-Mate-27B 超过通用模型 Kimi-K2.6 和 Qwen3.7-Plus,以及专用模型 ScaleCUA-Qwen3.5、EvoCUA-32B 和 UI-TARS-1.5。UI-Mate-27B 落后于最强的闭源通用模型 Claude Sonnet 5 和 Claude Opus 4.8,并略低于 GPT-5.5。UI-Mate-9B 超过更大的 EvoCUA-32B,表明规模本身并不能决定计算机使用能力。9B 和 27B 的 UI-Mate 模型在操作系统得分上相同,更大模型的提升集中在 Office、Daily、Professional 和 Workflow 任务。

在仅指令协议下,闭源权重前沿模型在 OSWorkerBench 上领先,其中 GPT-5.6-Sol 在报告系统中取得最高进度和二值成功率。UI-Mate 在 9B 和 27B 规模上均显著优于其 Qwen 基座模型,UI-Mate-27B 在整体成功率和进度上略超 Kimi-K2.6,但仍落后于前沿模型。其相对优势出现在 Multi-App 和 Long-Memory 子集上,表现优于 Kimi-K2.6。闭源权重前沿模型保持最高进度分数和二值成功率,GPT-5.6-Sol 领先所有报告系统。UI-Mate-27B 相比其 Qwen3.6-27B 基座模型有显著提升,并在整体成功率和进度上略超 Kimi-K2.6。UI-Mate-27B 在 Multi-App 和 Long-Memory 子集上优于 Kimi-K2.6,表明更强的跨应用和状态跟踪性能。UI-Mate-9B 也显著优于其 Qwen 基座模型,并超过基于同一基座模型构建的专用 ScaleCUA agent。

UI-Mate 在 WindowsAgentArena 上建立了最强的开源权重性能,UI-Mate-27B 领先开源基线并接近顶级闭源系统。各模型规模均有提升,UI-Mate-9B 显著优于其基座模型和同规模专用 agent,同时超过一个更大的专用模型。UI-Mate-27B 超过所有列出的开源权重基线,包括参数高达 1T 的模型。UI-Mate-9B 相对于其 Qwen3.5-9B 基座模型和同规模专用 agent 有显著提升,并超过更大的 EvoCUA-32B agent。

演示引导将 UI-Mate-27B 在 GameDev 上的平均成功率从 76.76% 提高到 81.15%,提升 4.39 个百分点。最大改进出现在需要结构化细粒度操作的长时程任务上,而已经完美解决的任务保持不变。演示也缩短了平均轨迹长度,表明在不降低完成度的情况下提高了执行效率。演示将平均成功率提高 4.39 个百分点,并将平均轨迹长度从 303.6 步减少到 253.1 步。最大收益出现在 godot-04、godot-07 和 qgis-01 等长时程结构化任务上;已经完美的任务没有变化,少数任务出现小幅下降。

自演示引导提高了 UI-Mate-27B 在 OSWorld 和 OSWorkerBench 子集上的表现。OSWorld 的提升更大,因为仅指令表现较低,并且更多任务在引导下达到满分。少数 OSWorld 任务仍然退化,表明演示引导偶尔可能被误用。在 OSWorld 上,自演示引导将平均进度提高 25.48 个百分点,30 个任务中有 18 个改善,4 个此前未解决的任务完美完成。在 OSWorkerBench 上,自演示引导将平均进度提高 13.29 个百分点,将二值成功率提高 18.18 个百分点,并将满分任务从一个增加到五个。

在 OSWorld-Verified、OSWorkerBench 和 WindowsAgentArena 上,UI-Mate 在仅指令协议下评估,并与通用和专用计算机使用 agent 比较。UI-Mate-27B 领先开源权重基线并接近顶级闭源前沿模型,而 UI-Mate-9B 在操作系统交互上与更大的模型持平,并超过更大的专用 agent,表明训练数据覆盖率和质量可能与规模同样重要。在 GameDev、OSWorld 和 OSWorkerBench 上的演示和自演示引导实验显示成功率提高、轨迹缩短,尤其在长时程结构化任务上,仅有偶发的小幅退化。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供