Command Palette
Search for a command to run...
UI-Venus-2:面向 GUI 智能体的大语言模型
UI-Venus-2:面向 GUI 智能体的大语言模型
摘要
图 1 展示了 UI-Venus-2 在 GUI 智能体基准上的性能。每个子图将 UI-Venus-2-27B 和 UI-Venus-2-9B 与若干选定的强基线进行比较。我们倾向于在可用任务子集和步数预算最接近的条件下评估独立的端到端系统;来源报告的动作框架可能仍存在差异。MobileWorld 使用 117 个任务、50 步下的仅 GUI 成功率,WebVoyager 使用刷新后的 595 任务划分,Odysseys 使用 200 个任务上的平均评分,VenusBench-CAPTCHA 使用全部 219 个示例上的微观 Pass@1,VenusBench-GD 使用英文指令的微观平均准确率。“*”表示结果由我们复现。
一句话总结
作者提出 UI-Venus-2,一个面向 GUI agent 的大语言模型,在 MobileWorld(GUI-only 成功率,117 个任务、50 步)、WebVoyager(刷新后的 595 任务划分)、Odysseys(200 个任务的平均评分)、VenusBench-CAPTCHA(所有 219 个示例的微 Pass@1)以及 VenusBench-GD(英文指令微平均准确率)上取得最先进结果,在独立端到端评估中超越强基线。
核心贡献
- UI-Venus-2 是一个 GUI agent,它联合扩展多语言环境、桌面计算机使用能力和细粒度验证机制,以实现最先进性能。
- 该模型提供 27B 和 9B 两种规模,在 MobileWorld、WebVoyager、Odysseys、VenusBench-CAPTCHA 和 VenusBench-GD 等 GUI agent 基准上刷新最先进结果。
- UI-Venus-2 跨移动、Web 和桌面平台泛化,支持在多种操作系统上的日常真实使用。
引言
多模态大语言模型使 GUI agent 能够感知屏幕截图并模拟点击、输入等人类动作,从而在无需依赖结构化 API 的情况下自动操作应用。然而,以往的 agent 在狭窄的基准之外表现不佳,因为它们仅在有限的应用集合上训练,依赖的查询可能无法反映真实应用功能,并且常使用将部分进展误判为成功的奖励验证器。作者提出 UI-Venus-2,一个通用基础 agent,它联合扩展跨多语言移动应用、桌面操作系统和 Web 平台的环境池;构建大量基于实际应用能力的可执行任务;并采用鲁棒的两级验证系统,通过视觉关键点和多模型投票来评估真实任务完成情况。
数据集
作者构建了一个多模态 GUI 交互数据集,采用闭环流水线在四个领域生成、执行并验证轨迹:Web 导航、计算机使用、合成 GUI 基础定位和合成 CAPTCHA。数据在用于监督微调(SFT)和强化学习(RL)之前,经过轨迹级和步骤级验证进行过滤和标注。
数据集组成与来源
-
Web 导航
- 环境池:来自 19 个类别的超过 4,000 个域名,通过将公开浏览器 agent 基准与 Tranco 排名结合,并由自动化 VLM(Kimi 2.6)对动态性、交互性和视觉质量评分后筛选得出。
- 种子任务:从 InSTA‑150k‑v3 中采纳的 45,000 个任务,优先选择具有丰富成功标准标注的任务。
- 采集:通过 15 种动作的 Playwright 接口在真实 Chrome 会话中记录轨迹。
- 后处理:步骤级清洗移除冗余等待、相反方向滚动和循环动作模式;成功轨迹中的可恢复错误被保留,以丰富能力目录中的失败模式覆盖。
-
计算机使用
- 任务:每个任务序列化为一个
TaskSpec,包含受控桌面快照、设置操作、所需文件/服务以及结果评估器。 - 执行前检查:物化计划配置工作空间;夹具指纹去重环境;预检检查验证初始状态完整性。
- 长时程处理:层次化分割将任务拆分为子目标,每个子目标具有独立的工件和完成检查;退出状态为后续片段播种回忆。
- 采集:真实桌面交互被展开执行,成功和失败均反馈至能力目录。
- 任务:每个任务序列化为一个
-
合成 GUI 基础定位
- 生成:从自然语言场景合成可执行的 HTML/CSS/JS 界面,可选地以角色或参考截图作为条件。
- 目标识别:候选目标通过九点命中测试(可见性、视口裁剪、遮挡等)和文本节点细化进行验证。
- 标注:接受的目标携带坐标、可见文本、ARIA 属性和局部上下文;不可行的指令作为难负例。
- 用途:直接导出用于基础定位专用的 SFT 和 RL,绕过通用任务构建阶段。
-
合成 CAPTCHA
- 类型:70 种 CAPTCHA 类别,每种由规则引擎驱动,存储定义答案、目标几何、有效动作和求解轨迹的潜在状态。
- 渲染:渲染器将谜题组合到移动面板或网页上下文中,将坐标映射到最终画布;渲染前验证谜题有效性。
- 记录:包含渲染观察、归一化几何、推理监督和可执行动作序列。
- 用途:导出用于 CAPTCHA 专用的 SFT 和 RL,与其他领域共享导出约定。
数据处理与使用方式
-
轨迹级验证(语义引导验证)
- VLM-as-Judge 检查完整轨迹,判断任务目标是否在语义上得到满足,生成基于关键点的证据和最终分类:已完成、部分完成、不可行或失败。
- 已完成的轨迹进入高质量训练池;部分完成的轨迹可被修复;不可行案例用于细化任务可行性规则;失败样本帮助区分 agent 能力与任务设计问题。
- 该验证是一种筛选机制,而非直接训练标签;新发现的功能反馈至能力目录。
-
样本级验证
- 每个交互步骤在获得执行结果之前被评估为正确、探索性、无效或不正确。
- 步骤判断聚合为三层轨迹标签,区分通用操作(启动应用、滚动)与任务特定操作(输入内容、选择目标)。轨迹仅当包含至少一个有效任务特定操作时才获得部分完成评价。
- 这些细粒度信号为 RL 提供更可靠的奖励信号,并有助于过滤训练数据。
-
训练使用
- Web 和计算机使用轨迹经验证后用于 SFT 和 RL,以教会 agent 真实环境交互。
- 合成基础定位和 CAPTCHA 记录为各自模态提供密集监督,直接用于 SFT 和 RL。
- 所有领域输出持续更新共享的能力目录,指导后续轮次的任务生成。
方法
作者提出 UI-Venus-2,一个通用基础 GUI agent,将视觉感知和高级推理与强化学习驱动的交互能力相结合。给定自然语言指令,模型通过统一的推理与动作框架运行。它观察渲染的界面图像,解读视觉上下文,将高层用户意图转化为可执行的 GUI 动作,并根据环境反馈持续调整决策。训练流水线整合多模态中期训练、离线强化学习和多教师在线策略蒸馏。模型从强大的开源多模态基础模型初始化,以提供视觉理解和指令跟随的鲁棒先验。
为支持这种交互范式,作者设计了一个全面的数据生成与验证框架。
参考框架图。
数据生成流水线作为一个闭环迭代系统运行。它从能力目录构建开始,将来自异构源的应用知识蒸馏为结构化注册表。在该目录的指导下,任务构建模块合成多样化的任务类型,将每个任务形式化为可执行契约,将自然语言指令绑定到应用域和预期结果。有效性门控施加严格约束以拒绝模糊或不受支持的任务。在轨迹收集期间,执行器通过截图和动作循环与环境交互。成功和失败的执行均产生结构化反馈,用于更新能力目录并为后续轮次的覆盖感知采样提供信息。这一过程覆盖移动、浏览器和计算机环境,确保多样且可扩展的交互数据。
第一阶段训练涉及在大规模合成和交互导向数据混合上的多模态中期训练。移动、Web 和操作系统导航任务构成主要部分。作者模拟广泛的交互环境以收集可执行轨迹。任务查询通过精心策划的种子与合成方式互补构建,以平衡真实性与语言多样性。生成的轨迹经过人工检查和自动评估相结合的协同验证过程,以过滤低质量交互。
在中期训练模型的基础上,第二阶段应用带有任务特定监督的离线强化学习。对于移动、操作系统和 Web 环境,作者构建大规模步骤级强化学习轨迹,在单个交互步骤上提供监督,以优化状态感知的动作选择和多步导航。对于 CAPTCHA 和基础定位任务,程序化合成框架将验证过的实例嵌入真实界面,提供密集且可扩展的强化学习监督,确保鲁棒的目标识别和精确的空间定位。
最后阶段采用多教师在线策略蒸馏,以整合从异构任务分布中获取的能力。为减轻直接合并独立训练专家带来的干扰,作者采用在线策略蒸馏范式,由教师对学生采样的轨迹进行评分。认识到普通在线策略蒸馏施加统一的 token 级监督对 GUI agent 并非最优,作者引入结构化动作感知蒸馏。由于动作是与环境交互的唯一接口并具有内部结构依赖,token 级蒸馏信号以学生动作的正确性为条件。若完整动作正确,则抑制蒸馏信号;若动作类型正确但参数有误,则强化动作跨度上的监督;若动作类型错误,则强调类型 token 并屏蔽下游参数。
此外,作者实现了教师端动作类型条件化。训练时,被路由的教师对学生采样的响应进行评分。为在结构化动作上提供精确监督,将正确动作类型的提示附加到教师提示中。该提示从不包含在学生提示中,推理时不可用。token 级蒸馏优势计算为:
Athint=sg[logπTd(yt∣PT(x,z∗),y<t)−logπθ(yt∣PS(x),y<t)]其中 Athint 是第 t 个学生采样 token yt 的蒸馏优势,y<t 表示其前文。Td 是领域 d 的冻结教师,πθ 是学生策略。原始 GUI 输入记为 x,z∗ 是正确动作类型。PT(x,z∗) 表示附加提示后的教师提示,而 PS(x) 是未改变的学生提示。运算符 sg[⋅] 停止优势计算中的梯度。这一设计确保蒸馏信号有效集中在关键可执行行为上,在多样 GUI 领域产生稳健的融合结果。
实验
实验在覆盖移动使用、计算机使用、Web 导航、GUI 基础定位、CAPTCHA 求解和安全性的全面 GUI agent 基准上评估 UI-Venus-2 模型。与通用视觉语言模型和专用 GUI agent 相比,UI-Venus-2 持续取得顶级或最先进结果,在移动、Web 和 CAPTCHA 任务上优势尤为突出,同时展现出有竞争力的基础定位能力和显著提升的安全性,能抵御显式攻击和看似无害的有害指令。9B 变体经常匹敌大得多的模型,27B 变体则进一步扩展性能,表明在多样真实场景中具有鲁棒的泛化性和有效的规模扩展。
通用视觉语言模型在移动 GUI 基准上表现不均衡,没有单一模型在所有任务上占优。Seed-2.0-Pro 在 MobileGym、KnowUBench 和 MemGUI 上取得最高分,而 Kimi-K3 在 MobileWorld 上领先,Qwen3.6-27B 在 AndroidWorld 上领先。较大模型变体始终优于其较小版本,如 Qwen 和 Kimi 家族所示。Seed-2.0-Pro 在 MobileGym 上达到 52.0,KnowUBench 上 51.6,MemGUI 上 65.6,但在 VenusBench-Mobile 上仅得 20.1。在 MobileWorld 上,Kimi-K3 取得 74.4,超过 Seed-2.0-Pro(63.2)和其他模型。Qwen3.6-27B 在所有同时报告的基准上均优于 Qwen3.5-9B,在 MobileGym 上提升 15.6 分,VenusBench-Mobile 上提升 12.7 分。MobileWorld 的 100 步设置将 Qwen3.6-27B 从 36.8 提升至 41.9,表明额外步骤对某些模型有益。
UI-Venus-2 模型在真实 Web 导航基准上建立新的最先进水平,27B 变体在 WebVoyager、Online-Mind2Web 和 REAL 上均领先。较小的 9B 模型同样表现强劲,常超越更大的通用系统并媲美顶级 agent。UI-Venus-2-27B 在 WebVoyager 上达到 93.4%,比最强的基于 GUI 的基线高出 4.1 个百分点。UI-Venus-2-9B 在 WebVoyager 上达到 90.8%,在规模小得多的情况下仍与 GPT-5(SoM)竞争。在 Online-Mind2Web 上,UI-Venus-2-9B 得分 74.0%,超过更大的 Fara1.5-27B。UI-Venus-2-27B 和 -9B 在 REAL 上分别超越此前最佳 5.8 和 2.5 个百分点。
UI-Venus-2-27B 在 VenusBench-GD 和 OSWorld-G-R 上取得 GUI 专用模型中的最高准确率,在 ScreenSpot-Pro 和 UI-Vision 上排名第二,持续超越强大的通用视觉语言模型和闭源基线。较小的 9B 变体显著缩小了与更大版本的差距,在参数少得多的情况下在多样界面上提供鲁棒的基础定位。UI-Venus-2-27B 相比前代在 VenusBench-GD 上提升 5.1 分,在 UI-Vision 上提升 12.2 分,在综合性和视觉挑战性基础定位任务上均展现持续进步。9B 模型在 ScreenSpot-Pro 和 OSWorld-G-R 上几乎与 27B 模型持平,表明精确的 GUI 基础定位可在较小规模上实现。
UI-Venus-2 模型在需要将识别转化为可执行动作的 CAPTCHA 以及多样推理混合任务上大幅超越通用 VLM,在组合多种原语的任务上增益最大。在空间和异构基准上性能保持竞争力,最佳通用模型几乎匹敌 27B 变体,表明视角转换和多步变换仍是瓶颈。9B 模型保留了大部分能力,常以较大幅度超越最强通用基线。在 VenusBench-CAPTCHA 上,UI-Venus-2-27B 和 -9B 分别达到 79.9% 和 78.1% 的 Pass@1,而最佳通用 VLM 为 53.0%,显示出将 CAPTCHA 理解有效转化为有效界面动作的能力。在类别平衡的 MCA-Bench 子集上,27B 模型达到 79.6%,9B 达到 75.7%,而 Qwen3.6-27B 为 51.7%,表明在常见格式之外的广泛泛化。最明显的差距出现在 NextGen-CAPTCHAs 上,UI-Venus-2-27B 达到 54.5%,而 Seed-2.0-Pro 为 20.4%,9B 模型则是最佳通用基线的两倍以上。在 Spatial-CAPTCHA-Bench 上,27B 模型以 48.6% 领先,仅比 Seed-2.0-Pro 高 4.8 分,9B 变体仅落后 1.0 分,表明空间变换对所有模型仍是瓶颈。Open CaptchaWorld 竞争最为激烈:UI-Venus-2-27B 以 56.3% 仅领先 Seed-2.0-Pro 0.7 分,9B 模型(50.7%)仍比 Kimi-K2.6 高 2.9 分,展现广泛覆盖但提升空间有限。
在 OSHarm 和 OSBlind 基准上的安全性评估显示,现有通用和 GUI 专用模型极易受到 OSBlind 攻击,攻击成功率超过 79%。相比之下,UI-Venus-2 模型将 OSBlind 攻击成功率降至约 48%,几乎减半风险,同时在 OSHarm 上取得最低成功率,超越所有基线。这些结果表明 UI-Venus-2 能有效抵御显式威胁和良性执行中的安全盲点。UI-Venus-2 模型在 OSHarm 上取得最低攻击成功率,以显著优势超越最强基线。在 OSBlind 上,UI-Venus-2 将攻击成功率从超过 79%(基线)降至约 48%,几乎将漏洞减半。
评估涵盖移动 GUI 基准、真实 Web 导航、基础定位、CAPTCHA 推理和安全性攻击。通用视觉语言模型在移动任务上表现不均衡,没有单一模型占优,而 UI-Venus-2 在 Web 导航和需要将识别转化为可执行动作的 CAPTCHA 上建立新的最先进水平,其较小的 9B 变体常优于更大的通用系统。基础定位结果与强大通用模型竞争,但空间推理对所有系统仍是瓶颈。在安全性测试中,UI-Venus-2 相比现有模型将 OSBlind 攻击成功率几乎减半,展现出对显式威胁和安全盲点的鲁棒抵抗能力。