HyperAIHyperAI

Command Palette

Search for a command to run...

Fara-1.5:面向计算机使用智能体的可扩展学习环境

摘要

从人类示范中收集计算机使用数据既昂贵又缓慢,这催生了对可扩展生成策略的需求。这需要两个关键要素:智能体能够行动的环境,以及能够判断其示范是否成功的验证器。我们提出了 FaraGen1.5,一个面向计算机使用智能体的可扩展数据流水线,由三个模块化组件构成:环境、求解器和验证器。FaraGen1.5 同时使用真实网站和合成环境,后者能忠实地模拟受身份验证限制或需要执行不可逆操作的领域。它采用了一个可由多种模型驱动的求解器框架,包括 GPT-5.4 等强大的前沿模型,并集成了用户模拟器以实现多轮交互推演。最后,FaraGen1.5 使用三个互补的验证器对生成的轨迹进行评分,分别覆盖任务正确性、效率和关键点遵循度。利用该流水线生成的数据,我们训练了 Fara1.5,这是一个基于 Qwen3.5(4B、9B 和 27B)构建的、包含三种规模的原生计算机使用智能体(CUA)系列。为训练这些模型,我们采用了一种监督微调(SFT)方案,通过迭代方法精心平衡来自 FaraGen1.5 的数据,以实现广泛覆盖、特定高价值任务以及针对目标模型缺陷的优化。每个模型都在其规模级别上于浏览器使用基准测试中创下了新的最优性能(SoTA):Fara1.5-9B 在 Online-Mind2Web 上达到 63.4%,在 WebVoyager 上达到 86.6%,而 Fara1.5-27B 在 Online-Mind2Web 上取得了 72.3% 的成绩,与规模大得多的闭源系统相比具有竞争力。我们还在 MIT 许可证下发布了 Fara1.5 模型的权重,使最优的计算机使用能力不再局限于封闭的纯 API 系统,让所有人都能获取。

一句话总结

微软研究人员推出 FaraGen1.5,一个可扩展的数据流水线,该流水线组合了需要通过身份验证或涉及不可逆操作的在线网站和合成环境,由 GPT-5.4 等模型驱动的多模型求解器及用于多轮交互轨迹的用户模拟器,以及三个互补的验证器对任务正确性、效率和关键点遵循度进行评分,用于训练 Fara1.5——一个基于 Qwen3.5 的原生计算机使用 agent 系列,涵盖 4B、9B 和 27B 规模,在浏览器使用基准上创下新的最优水平,其中 Fara1.5-9B 在 Online-Mind2Web 上达到 63.4%、在 WebVoyager 上达到 86.6%,Fara1.5-27B 在 Online-Mind2Web 上达到 72.3%,并以 MIT 许可证发布。

核心贡献

  • FaraGen1.5,一个可扩展的数据流水线,结合了在线和合成环境,一个支持多模型的求解器框架和一个用于多轮交互轨迹的用户模拟器,以及三个验证器,分别对轨迹的正确性、效率和关键点遵循度进行评分。
  • Fara1.5,一个建立在 Qwen3.5 基础上的三个原生计算机使用 agent 系列(4B, 9B, 27B),通过监督微调进行训练,迭代地平衡广覆盖数据、高价值任务数据和针对模型不足的数据。
  • 在浏览器使用基准测试中,Fara1.5-9B 在 Online-Mind2Web 上达到 63.4%,在 WebVoyager 上达到 86.6%,Fara1.5-27B 在 Online-Mind2Web 上达到 72.3%,各自在其规模级别创下了新的最优水平;所有模型权重以 MIT 许可证发布。

引言

大型语言模型越来越多地被部署为自动化网络任务的计算机使用 agent,但训练这些 agent 需要大量的交互演示和可靠的验证器。从在线网站收集此类数据具有挑战性,因为任务很快就会过时,无人监督的情况下处理需要凭证才能访问的内容存在风险,并且反机器人策略限制了自动化的数据收集。先前扩大数据生成规模的尝试一直在验证可靠性上挣扎,通常依赖于人类演示或可能产生幻觉的不完善的基于 LLM 的评判器。作者利用 FaraGen1.5 解决了这些瓶颈,这是一个改进的数据生成流水线,结合了更强的教师模型、重新设计的验证器以及完全合成的、沙盒化的网站。通过构建真实网站的完整前端和后端副本,绕开了在线网站的限制,并可以根据实际的网站状态而非仅仅是屏幕截图来验证 agent 轨迹。该流水线产生了高质量的交互数据,使作者能够训练出轻量级但功能强大的网页 agent 系列 Fara1.5。

数据集

作者通过组合来自两种环境类型的轨迹和几个辅助的开放数据集,为计算机使用 agent 构建了一个训练语料库。最终的混合数据集包含大约 157 万个轨迹步骤,其中源自 FaraGen1.5 的数据占混合数据的 85.3%。关键组成部分概述如下。

  • 在线网络轨迹(占混合数据的 60.0%)

    • 源自一个包含大量可公开访问 URL 的索引;任务是安全的、无需身份验证的,并且可以在开放互联网上完成。
    • 任务生成使用一个带有网站摘要的 LLM,沿着目标网站、复杂性、措辞风格和用户交互类型等维度进行采样。一种混合方案通过用户意图和用户画像,在有控制的覆盖范围与特定网站的真实性之间取得平衡。
    • 生成的任务需通过两阶段过滤:一个确定性检查用于检测表层故障,一个 LLM 评判器用于接受现实的、即使不够具体的指令。
  • 合成环境轨迹(占混合数据的 12.8%)

    • 来自六个手工制作的沙盒化网页应用(FaraEnvs):电子邮件、日历、媒体流、机器学习实验管理、电商市场和日程安排。每个环境都有一个完全受控的技术栈(前端, API, 数据库),因此每个任务都有一个可验证的真实状态谓词。
    • 环境通过一个半自动化的循环构建:将人类交互记录提供给一个编码 agent,该 agent 生成一个 React+FastAPI+SQLite 克隆版本,并通过 3-5 轮人工审查进行优化。
    • 任务提议 LLM 可以直接访问后端(SQLite 和 Playwright MCP 服务器),并根据人工编写的样本和用户画像生成任务。训练集和保留的测试集相互进行了去重处理。
    • 成功标准是预先计算好的:对于有数据变更的任务,通过 LLM 评判器验证数据库快照前后变化的行级 sqldiff;对于只读任务,则使用参考答案或 SQL 查询对最终输出进行评分。
  • 表单填写和用户交互轨迹(占混合数据的 12.5%)

    • 同样源自 FaraGen1.5;论文未详细说明单独的生成过程,但将其标记为与网络数据和合成数据并列的一个独立类别。
  • 定位数据

    • 来自 Jedi、GroundCUA 和 Click100k。每个示例都通过 GPT-5.2 依据四个标准进行过滤:唯一性(恰好有一个 UI 元素匹配查询)、相关性(屏幕截图显示被查询的界面)、清晰度(查询没有歧义)和准确性(真实坐标位于所描述的元素上)。仅保留通过所有过滤条件的示例。
  • 安全拒绝数据

    • 来自 Jedi 的定位式拒绝:将开源指令与不相关的屏幕截图配对;通过 GPT-5.2 过滤,仅保留真正无法执行的指令-图像对。
    • 来自 WebTailBench-Refusals 中危险任务的拒绝任务:一个 LLM 生成涵盖相同危害类别但措辞不同的变体,教会模型根据请求的性质而非记忆的字符串进行拒绝。
  • 图像理解数据

    • 来自 RICO-SCA 和 InfographicsVQA 的视觉问答对,用于增强屏幕信息提取能力并减少幻觉。

该语料库用于训练 Fara1.5 模型。整体分布表明在线网络数据占主导地位,但合成环境是经过特意设计的,旨在实现深度和可验证性,覆盖了开放网络收集无法提供的登录后任务、不可逆操作以及持久性的状态变化。所有 FaraGen1.5 轨迹均由求解器生成,并在纳入之前进行了验证。辅助数据集经过有针对性的过滤以确保质量和安全对齐。

方法

作者介绍了 FaraGen1.5,一个专为生成高质量交互轨迹以训练计算机使用 agent (CUA) 而设计的综合数据引擎。该系统通过将范围从开放网络扩展到包括需要身份验证和状态变更的任务,解决了先前数据流水线的局限性。

如下面的框架图所示,该流水线保留了三阶段组织结构,包括环境、求解器和验证器。

环境 第一阶段在两种不同的环境类型中实例化任务。在线网络环境利用一个包含大量可公开访问 URL 的索引为开放互联网生成任务。为了覆盖需要身份验证或具有不可逆副作用的的任务,作者开发了称为 FaraEnvs 的合成环境。这些是作者能控制前端、API、数据库和种子数据的完全沙盒化的副本。一个由编码 agent 驱动的半自动化方案创建这些克隆体,并通过人工审查迭代优化以确保功能正确性。

求解器 在第二阶段,一个求解器尝试执行每个提议的任务。与之前的多 agent 系统不同,作者采用了一个建立在 GPT-5.4 上的单一 agent,运行一个多轮工具调用循环。这种设计选择减少了教师求解器和学生模型之间的分布偏移。一个用户模拟器与求解器交互,以解决歧义或提供后续请求,有效地生成多轮训练数据。为了确保在线网站上的安全,一个轻量级的 LLM 关口限制模拟器授权执行具有现实后果的操作,例如账户创建或金融交易。

验证器 第三阶段通过三个独立的验证器过滤轨迹,以确保高质量。

  1. 任务正确性: 对于在线网络任务,一个集成的 LLM 评判器根据生成的评分标准对轨迹进行评分。对于合成任务,通过计算数据库状态的行级差异或将最终结果与预先计算的参考答案进行比较来验证正确性。
  2. 任务效率: 一个专门的 LLM 评判器识别冗余的点击和不必要的导航,并给出效率评级。只有评级高的轨迹才会被接受。
  3. 关键点遵循度: 此验证器确保 agent 在执行不可逆操作或缺少关键信息时暂停并向用户咨询。

数据分布 生成的训练语料库是这些来源轨迹的混合物。网络轨迹占大多数,并辅以合成环境数据以及用于定位和视觉问答的辅助数据集。

Fara1.5 模型架构 利用经过验证的数据,作者训练了 Fara1.5,一个原生 CUA 模型系列,参数规模分别为 4B、9B 和 27B。每个模型都作为一个单一的视觉-语言模型 (VLM) 策略运行。

该模型遵循一个观察-思考-行动循环。在每一步中,它都会将当前的浏览器状态作为渲染的屏幕截图和简短的 URL 前缀进行消费,避免使用 DOM 序列化或无障碍树。该模型生成一个思维链推理轨迹,然后是一个单一的原子动作。动作空间包括标准的鼠标和键盘控制、特定于网页的快捷方式以及元动作,例如记忆事实或向用户询问以进行澄清。为了管理上下文窗口,该模型保留了思想和行动的完整历史记录,但只保留最近的三张屏幕截图。

模型训练 作者从 Qwen3.5 骨干网络开始,通过监督微调 (SFT) 训练每个 Fara1.5 模型。训练目标是,在给定用户查询和交互历史的情况下,预测下一个思维和动作 token。

如训练图所示,损失屏蔽过程确保反向传播仅针对上下文窗口中与最近观察结果相对应的思维和动作 token 发生。较旧的屏幕截图会从输入中丢弃以限制上下文长度,而文本历史记录则被保留。作者发现,以 “instruct” 模式进行短思维链训练,其性能优于在推理时启用基础模型原生思维能力的做法。

实验

评估使用 WebVoyager、Online-Mind2Web 和更新版的 WebTailBench v1.5,在在线网络 agent 任务上评估 Fara1.5,并在一个处理关键点暂停和网站屏蔽的稳健协议下,与类似规模的开放权重的 CUA、更大的专有系统以及标记集 agent 进行比较。Fara1.5 模型相较于之前的 Fara-7B 有显著提升,其 9B 变体超越了之前所有的 7-9B agent,并与更大的专有系统表现相当,而 27B 模型则创下了新的最优水平;合成环境训练被证明是可学习的,并且能有效迁移到真实网站。定位性能表现强劲,特别是在采用两步缩放程序处理高分辨率屏幕时,并且模型保持了稳健的安全行为,能拒绝危险任务并在关键点暂停。总体而言,Fara1.5 证明了,仔细的数据规模化、合成环境以及从强大求解器进行蒸馏,可以产生功能强大且安全的浏览器 agent。

一个关键点遵循验证器根据三个二元维度对任务进行分类——是否已授权、是否完全指定、是否提供了个人身份信息 (PII)——以确定 agent 是否必须在行动前暂停并咨询用户。由此产生的八种组合各自规定了特定的延迟处理协议,确保 agent 在执行不可逆操作之前请求缺失的任务细节或明确的同意。安全评估显示,agent 在这些关键点的暂停率在不同模型规模之间保持一致,其暂停和延迟处理的倾向没有下降。agent 仅在三个条件全部满足时才提交不可逆操作;否则它会向用户询问缺失的信息或权限。如果没有明确授予权限,即使提供了所有其他细节,agent 也必须在完成任务前始终请求权限。在所有关键点类型上,该模型保持了与早期 Fara-7B 相同的暂停率,证实了增加的能力并未削弱其延迟处理行为。

Fara1.5 使用一个全面的动作空间,涵盖指针和键盘交互、浏览器导航以及三种元动作。元动作允许模型暂停以存储跨页面事实,在关键时刻向用户请求输入,或安全地处理不可逆步骤。标准指针动作包括左键单击、双击、右键单击、三击、拖动和悬停。agent 可以在当前光标焦点处输入文本以填写表单或输入查询。pause_and_memorize_fact 动作允许模型记住之前页面的信息以供后续比较。ask_user_question 动作将控制权交还给用户以进行授权或提供缺失的细节,支持安全操作。

Fara1.5 系列在网页 agent 基准测试中取得了强劲的结果,其 9B 模型优于其规模级别中的所有其他开放权重 agent,而 27B 模型在 WebVoyager 和 Online-Mind2Web 上均超过了规模大得多的专有系统。从之前的 Fara-7B 升级到 Fara1.5-9B,在 Online-Mind2Web 上取得了最大的改进,这表明合成轨迹和优化的任务流水线解决了之前困难的长尾行为。在 WebVoyager 和 Online-Mind2Web 上,Fara1.5-9B 的表现优于 7-9B 参数级别中的所有其他开放权重 agent,并在后一个基准测试中尤其大幅领先。Fara1.5-27B 超过了规模大得多的专有系统,包括在 WebVoyager 上的 OpenAI Operator 和在 Online-Mind2Web 上的 Yutori Navigator。

仅在开放互联网数据上训练的 Fara-7B,在六个合成环境上的平均成功率为 18.8%,这表明泛化到受限领域是具有挑战性的。Fara1.5-9B 在这些环境上训练后,成功率达到 71.8%,缩小了与 GPT-5.4 求解器 79.4% 成功率之间的大部分差距,并证实了这些任务是可学习的,且蒸馏是有效的。Fara-7B 在每个环境中的成功率在 11.5% 到 34.3% 之间,远低于求解器的性能。Fara1.5-9B 相较于 Fara-7B,平均成功率提高了约 53 个百分点。在邮件、日历、流媒体和机器学习环境上,Fara1.5-9B 的成功率超过 75% 并接近求解器。最大的剩余差距在日程安排上,Fara1.5-9B 的得分为 56.0%,而求解器为 75.0%。

添加来自目标网站合成副本的训练轨迹,相较于仅在其他领域上进行微调的基线模型,显著提升了性能。综合成功率提高了 10 个百分点,缩小了与在完整 FaraGen1.5 混合数据上训练的模型之间的很大一部分差距。这证明了合成环境可以成功迁移到真实的网络任务中。合成副本模型在每个领域都优于基线模型,其中在 HuggingFace 上的相对增益最大。这 10 个百分点的综合提升缩小了基线模型和完全训练的 Fara1.5-9B 参考模型之间大约一半的差距。在合成副本上进行训练,其性能更接近全数据上限,证实了合成环境数据的可迁移性。

评估涵盖了 Fara1.5 的安全检查、动作空间、基准性能以及合成数据迁移。一个关键点验证器能持续使 agent 在执行不可逆步骤前暂停以请求用户输入,并且在不同模型规模间延迟处理行为没有退化。在公共基准测试中,9B 模型在其权重级别中处于领先地位,而 27B 模型则超越了规模大得多的专有系统,同时扩展的动作空间及元动作支持了安全、长周期的任务执行。在目标网站的合成副本上进行训练,极大地提高了在受限领域上的成功率,缩小了与强大求解器之间的大部分差距,并证明了模拟环境可以有效地迁移到真实的网络任务中。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供