Command Palette
Search for a command to run...
OSReward:为跨平台计算机使用奖励模型建立标准化评估
OSReward:为跨平台计算机使用奖励模型建立标准化评估
摘要
计算机使用智能体(CUA)正在数字世界中快速进步。一条 CUA 轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是 CUA 评估、数据整理和强化学习的核心环节。人工编写的验证器与人工标注者均无法大规模提供此类验证,因此该领域越来越多地转向以视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个根本问题长期未被审视:这些 VLM 评判者是否足够可靠?为系统研究该问题,我们引入了 OSReward,一个用于评估 VLM 评判者在 CUA 轨迹上表现的现实且高质量的基准。轨迹来自不同智能体主干在跨平台上执行经人工验证的指令,随后通过多阶段人工标注被严格赋予真实裁决标签。在此基础上,我们进一步构建了 OSReward-Hard(一个聚焦真正困难案例的挑战集)和 OSReward-Multi(用于细粒度效率与对齐评分)。迄今为止对 VLM 评判者最全面的评估发现,即使是最先进的模型也未能达到理想评判者的水平,它们普遍存在系统性宽松偏差,会将失败运行误标为成功。少数足够可靠、值得信赖的模型因成本过高而无法大规模运行,而价格可承受的开源模型则远远落后。为弥合这一差距,我们构建并发布了 OS-Shepherd-100K,一个面向 CUA 社区、带有推理标注的轨迹判断开放语料库。基于该语料库,我们训练了 OS-Shepherd(9B 和 35B),这些开源奖励模型能够提供低成本、稳定且可靠的奖励信号,其性能可与商业评判者匹敌,而成本仅为前沿模型的 1/30 至 1/60。大量分析进一步为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点均可在 OSReward 主页获取。
一句话总结
香港大学和南京大学等提出 OSReward,一个用于评估对计算机使用 Agent 轨迹进行评判的视觉语言模型评判器的现实跨平台基准,发现即便在最先进的评判器中也存在系统性的宽容偏差,并发布 OS-Shepherd-100K 来训练开源的 OS-Shepherd(9B 和 35B)奖励模型,这些模型能以低至 30–60× 的成本达到商业水平的性能。
核心贡献
- 本文引入 OSReward,一个跨平台的计算机使用 Agent 轨迹基准,具有来自多阶段人工标注的真实判定,以及一个困难子集(OSReward-Hard)和一个多评分变体(OSReward-Multi)。
- 对视觉语言模型评判器进行全面评估,揭示了一种系统性的宽容偏差,该偏差会将不完整的轨迹错误地标记为成功,导致在 OSReward-Hard 上的性能降至接近随机水平。
- 这项工作构建了 OS-Shepherd-100K,一个开放的带推理注释的语料库,并训练了 OS-Shepherd(9B 和 35B),这两个开放的奖励模型能够以低至 30–60 倍的成本与商业评判器相匹敌,并在未见过的基准上保持去偏。
引言
操作网页、移动和桌面界面的计算机使用 Agent 需要可扩展的轨迹级验证来驱动评估、数据管理和强化学习。人工编写的验证器仅覆盖少数经过筛选的任务,无法处理静态语料库或先前收集的轨迹,而人工标注则无法跟上数据量的增长。实际做法是让视觉语言模型(VLM)充当评判器,但其可靠性在很大程度上仍未经过检验:先前的研究局限于单一平台,重复使用现成的、带有不完美真值的基准,并依赖于简短且狭窄的证据。作者通过构建 OSReward 来填补这一空白,这是第一个跨平台基准,具有从网页、移动、Ubuntu 和 Windows 的新鲜环境中收集的人工黄金轨迹,然后发布 OS-Shepherd,一个包含 10 万条带推理注释的评判的开放数据集,以及两个开放的奖励模型,它们能够以训练规模的预算达到昂贵的前沿评判器的水平。
数据集
作者构建了两个数据集:一个用于评估 CUA 评判器的黄金基准(OSReward),和一个用于训练 OS-Shepherd 奖励模型的大规模训练语料库(OS-Shepherd-100K)。两者均通过他们自建的跨平台基础设施收集,轨迹由一个任务指令、一系列步骤(截图、Agent 思考和动作)和一个判定结果组成。
OSReward 基准(黄金标签)
- 来源与组成
- 1019 条轨迹,横跨网页、Windows、Ubuntu 和移动环境。
- 任务由注释者在探索实际环境后编写;约 1500 个候选中,有约 800 个通过了同行筛选,该筛选移除了模糊或没有根据的指令。
- 每个经过验证的指令由一到三个来自不同骨架(Claude、Gemini、Kimi、Qwen 系列)的 Agent 执行,混合了仅 GUI 和 GUI+CLI 的动作空间,以反映现实中的 Agent 多样性。
- 存在严重收集问题(反爬虫封锁、网络故障、执行冻结)的运行在人工标注前被预过滤掉。
- 人工标注与标签制作
- 每条轨迹由三位标注者独立标注;一致的标签为最终标签,有分歧的情况则由高级审核员进行元评审。
- 标注成本:约 800 个人工小时。
- 标注者阅读完整的多模态上下文,并应用严格的规则:未通过环境获得/验证的答案,即便正确也标记为 FAIL。
- 失败的轨迹被标记上错误类别(推理、动作、感知、记忆)。
- 成功的轨迹在 OSReward-Multi 上带有两个子标签:对齐(2 个等级)和效率(3 个等级)。
- 子集
- OSReward(全集):1019 条轨迹,在各平台间保持平衡,SUCCESS/FAIL 比例为 43%/57%。推理与规划错误在失败原因中占主导(占失败运行的 86%)。
- OSReward-Hard:284 条轨迹,大多来自标注者最初意见不一的情况,并经过额外审核重新验证。SUCCESS/FAIL 比例为 30%/70%,旨在暴露评判器中的假成功漏洞。
- OSReward-Multi:全集中 440 条成功轨迹,带有对齐和效率评分;失败轨迹被排除。
- 用途
- 该基准用于评估评判模型;OSReward-Hard 隔离困难案例,而 OSReward-Multi 为成功运行提供更细粒度的质量轴。
OS-Shepherd-100K 训练语料库(自动标注)
- 构建与规模
- 为经济高效的训练构建了 10 万对轨迹-评判对。标签由多个强大的 VLM 评判器组成的集成自动分配,只保留那些多个评判器达成高度一致的轨迹。
- 该集成通过改变评判模型和截图设置来减少从众偏差;模糊的轨迹被丢弃,没有强制采用多数票标签进入语料库。
- 每个保留的样本都携带评判器的推理,而不仅仅是二值判定。
- 来源与组成
- 覆盖网页、Windows、MacOS、Ubuntu 和 Android。
- 轨迹来自五个模型系列(Claude、Gemini、GPT、Kimi、Qwen),使用多种执行框架、动作空间和步骤预算,以及开源的 Agent 栈。
- 约 46% 的 Ubuntu 数据将 GUI 动作与命令行步骤交错执行。
- 该语料库与 OSReward 基准轨迹不相交。
- 为达到规模,一部分指令是合成的:Ubuntu 和 Windows 指令中约 25% 为合成,网页指令中约 10% 为合成。
- 筛选与标签来源
- 一致性筛选保留了约 85% 的已评判轨迹;仅保留来自最强评判器的近乎一致输出。
- 最终标签由集成得出;保留的推理文本默认采用一个强评判器的输出,绝不与标签矛盾,偶尔会暴露其他评判器的推理以增强泛化能力。
- 成功/失败比例均衡,负样本主要从真实失败中收集,而非环境工件。
- 用途
- 仅用于训练 OS-Shepherd 奖励模型;训练配方未在本文公开,仅说明数据集的作用。
数据基础设施与处理
- 所有环境(网页、Windows、Ubuntu、移动)都通过日常应用、真实文件、种子数据库和干扰内容进行了丰富的初始化,以产生逼真、可评判的轨迹。网页任务在实际网站上运行。
- 跨平台的收集方式统一,生成了轨迹格式一致(指令、带 Agent 思考和动作的逐步截图),基准和训练语料库均采用该格式。
- 未应用裁剪策略;完整的屏幕内容得以保留,用于多模态评判。
方法
作者利用全面的流水线构建 OSReward,一个包含现实跨平台计算机使用 Agent 轨迹并配以可信黄金判定的语料库。数据收集基础设施横跨网页、Windows、Ubuntu 和移动环境,每个环境都通过日常应用、真实文件和种子数据库进行初始化,以确保逼真的状态。标注者探索这些环境来起草有根据的任务指令,这些指令经过严格的同行交叉检查,以消除模糊或无法回答的提示。幸存的指令随后由多种主流模型骨架(如 Claude、Gemini、Kimi、Qwen)驱动的 Agent 框架执行,生成捕获了不同动作习惯和失败模式的原始轨迹。
为了生成黄金标准标签,原始轨迹通过多阶段标注流水线处理。首先,自动预过滤会丢弃存在严重收集问题(如网络故障或反爬虫封锁)的运行。剩下的轨迹由三位人类标注者独立标注,他们审查完整的、包括每张截图、思考和动作在内的多模态上下文。严格的标准被应用:未经验证的正确答案会被标记为失败。当标注者一致同意时,判定为最终结果。分歧则会升级至由高级审核员进行的元评审。成功的轨迹在对齐和效率两个轴上进行评分,以形成 OSReward-Multi 集合,而失败则按错误类型分类。那些使标注者产生分歧的困难案例会经过进一步的重新验证,以创建 OSReward-Hard 集合。
为满足对可扩展奖励模型的需求,作者开发了 OS-Shepherd,并在 OS-Shepherd-100K 语料库上进行训练。由于对训练规模的数据进行人工标注成本过高,作者采用了一个由强视觉语言模型评判器组成的集成。该流水线从筛选自收集的指令并通过 Agent 执行开始,然后与选定的开源轨迹合并。每条轨迹由多个评判实例在不同的输入截图设置下评分。为了减轻评判偏差和从众效应,作者只保留那些多个强评判器独立达成近乎一致判定的轨迹,而丢弃模糊案例。这种跨模型一致性筛选确保了训练集包含可靠的标签和多样的推理痕迹,最终形成 OS-Shepherd-100K 数据集。
OS-Shepherd 模型从 Qwen3.5 基础模型开始,分两个阶段训练。在有监督微调阶段,基础视觉语言模型在经一致性筛选的 OS-Shepherd-100K 语料库上进行微调。这一步显著地纠正了基础模型固有的宽容性。随后,强化学习阶段利用组相对策略优化来针对假成功,即对奖励信号最具危害性的错误。通过挖掘这些案例并应用 RL,该模型进一步提高了区分正确行为与错误轨迹的能力。
实验
对 27 个用作计算机使用 Agent 评判器的 VLM 的基准测试表明,只有前沿模型接近可用准确率,但所有模型都存在主导性的宽容偏差,即它们过度接受失败的任务为成功,因为判定主要依赖于 Agent 的文本声明,而非视觉证据。分析显示,移除 Agent 的文本历史会导致准确率大幅下降,而改变视觉输入则几乎无关紧要;无论是额外的推理还是集成方法,都无法实质性地提高可靠性。该研究引入了 OS-Shepherd,一个小的开放奖励模型,其准确率与商业评判器相当,能抵抗宽容偏差,并在独立基准上以极低的成本实现泛化。
在 OSReward 基准上,只有前沿的闭源评判器接近训练时奖励所需的约 90% 准确率,而开源权重对应模型在全领域落后,最大的开源模型将差距缩小到几个百分点之内。OSReward-Hard 挑战集揭示,这种总体准确率很脆弱:每个评判器的性能急剧下降,最好的也退步至与平凡多数类预测器相当,宽容偏差显著扩大,许多评判器接受了几乎所有的欺骗性失败。在这一更困难的基准上,只有两个前沿模型在两侧的召回率上都保持相对准确且均衡,接近 70%,而一个经过去偏训练的小型开源模型(OS-Shepherd)则将这种抗性迁移到未见过的基准上,使其成为校准最好的开源评判器。前沿的闭源评判器在 OSReward 上的准确率略低于 90%,但当用平衡准确率而非原始准确率评估时,其排序会改变。开源权重评判器始终不如闭源评判器,但最大的开源模型接近前沿水平,差距在几个百分点。切换到更困难的 OSReward-Hard 集,导致每个评判器的准确率崩溃,最高跌幅达 43 个百分点,最好的评判器在倾斜的成功/失败比例上表现不优于常数预测器。宽容偏差在困难集上扩大:几个模型几乎召回零失败,而最宽容的模型几乎接受了所有困难失败,拉大了各评判器间失败召回率的范围。只有 Claude-Opus-4-8 和 GPT-5.5 在困难集中成功和失败的召回率都维持在约 70%,而其他接近对角线的评判器则是在牺牲两侧准确率的前提下来实现平衡的。OS-Shepherd 模型经过宽容抗性训练,将这种去偏特性迁移到分布外,在独立构建的基准上超越了所有通用的开源评判器,并缩小了与人工编写验证器的差距。
在 OSReward-Multi 基准上,质量分级被证明远弱于二值结果评判,即使最好的评判器也仅达到低 60 的 AUC。评判器对齐和效率等级的顺序排名始终优于其输出的分数,这揭示了校准偏差,其中对齐的偏差最严重,模型倾向于默认给出最高评分。开源的 OS-Shepherd 模型继承了这一弱点,尽管 35B 变体部分弥合了校准差距,而 9B 则仍接近常数级基线。表现最好的评判器在多轴上的总体 AUC 超过 66%,但其宏观召回率低于 59%,这说明了排名能力与评分校准之间的差距。对齐评分受到校准偏差的影响最大:一些评判器的对齐 AUC 超过 71%,但总体宏观召回率仍然很低,反映出不管轨迹质量如何,模型都倾向输出最高评分。OS-Shepherd-35B 将宏观召回率提升至 47.7%,相比 9B 的 44.1%,部分弥补了校准差距,但两者在 AUC 上都落后于前沿模型。
OS-Shepherd-100K 评判实例池包含超过 32 万个判定,横跨五个平台,其中网页交互占比最大。Ubuntu 轨迹贡献了约五分之一的池子,并且其中近一半结合了 GUI 和命令行动作。经高一致性集成筛选后,保留的训练样本集中在桌面和网页上,而移动端仅保留少量。网页实例以 37% 占据池子主导地位,而桌面平台(Windows、macOS、Ubuntu)合计提供了超过一半的评判实例。在 Ubuntu 子集中,46% 的轨迹将 GUI 与命令行交互交错,反映了对 GUI-CLI 组合行为的有意收集。
微调将一个宽容的基础模型转变为一个平衡的奖励模型,能够捕捉到更多的困难失败,同时保持在均衡线附近。9B 版本从领域的后三分之一移动到商业范围内,在全集上,成本仅为几分之一,而扩展到 35B 仅带来了微小的进一步增益,表明方法比参数数量更重要。训练 OS-Shepherd-9B 使其全集的平衡准确率从 79.4 提升至 86.3,困难集的平衡准确率从 55.9 提升至 61.9。在困难实例上,微调后的 9B 捕捉到了 57.6% 的假成功,而基础模型仅有 14.1%,同时保持成功召回和失败召回几乎相等。拥有四倍参数的 35B 模型,仅在困难集平衡准确率上比 9B 高出 2.4 个百分点,并在全集上与之持平。OS-Shepherd-9B 评判整个基准的成本约为 1.36 美元,比最接近的商业评判器便宜约三分之一,同时在困难子集上处于领先。学习的去偏特性迁移到了独立构建的 CUA 基准,其中 9B 比宽容的通用评判器捕捉到了更多的真实失败。
前沿闭源评判器在标准计算机使用奖励基准上接近 90% 的二值准确率,但在带有欺骗性失败的困难挑战集上性能崩溃,而 OS-Shepherd,一个低成本微调的开源模型,学习到了平衡的宽容抗性,并将去偏特性迁移到未见过的基准。多轴质量分级揭示了严重的校准偏差,尤其是在对齐方面,OS-Shepherd 部分缓解了这一问题。训练于来自多个桌面和网页平台、超过 32 万个判定,并保留高一致性样本,将一个宽容的基础模型转变为一个经济高效的 9B 评判器,在标准测试上与商业模型相匹敌,并在困难案例上处于领先地位。