Command Palette
Search for a command to run...
OPENFORGE RL:在任意环境中训练原生执行框架智能体
OPENFORGE RL:在任意环境中训练原生执行框架智能体
Xiao Yu Baolin Peng Ruize Xu Hao Zou Qianhui Wu Hao Cheng Wenlin Yao Nikhil Singh Zhou Yu Jianfeng Gao
摘要
现代 AI 智能体依赖复杂的推理执行框架(如 Claude Code、Codex 和 OpenClaw)来驱动多轮推理、工具使用及外部系统访问。这些框架功能强大,但也使智能体难以借助开放基础设施进行端到端训练,因为现有的 SFT/RL 技术栈无法原生表达有状态、多进程的执行框架推理过程。为解决这一问题,我们提出 OPENFORGE RL,一个用于在多样化环境中端到端训练基于执行框架的智能体的开源框架。OPENFORGE RL 通过一个轻量级代理来服务执行框架的模型调用,并将其记录为标准 RL 代码库(如 veRL)的训练数据,同时利用 Kubernetes 编排器在各自的远程容器中运行每次 rollout,从而实现了在任意环境中对任意执行框架进行规模化训练。通过解耦训练与推理,OPENFORGE RL 使研究者能够轻松地在智能体实际部署所用的真实执行框架和环境中直接训练、研究和改进它们。我们在多种复杂的执行框架和环境上验证了该框架,涵盖基于工具/爪的智能体以及多模态 GUI 浏览器和计算机使用智能体。仅使用数百到数千个任务,OpenForge-Claw 在 ClawEval 上达到 31.7(pass³)和 55.9(pass@3),在 Qwen-ClawBench 上达到 33.7。OpenForge-GUI 在 OSWorld-Verified 上达到 37.7,在 Online-Mind2Web 上达到 63.0,在 WebVoyager 上达到 72.3。两者在几乎所有基准上均优于同等规模的开源基线,且在 GUI 场景下达到或超越了数倍规模的模型。除基准测试外,我们还分析了执行框架选择(如 ZeroClaw、OpenClaw、Codex)和 RL 如何塑造智能体行为。我们发现某些执行框架的学习难度显著高于其他框架,并且 RL 提升了智能体的可靠性,例如自我验证、工具覆盖率和完成多步计划的能力,但错误恢复等关键能力仍然薄弱。我们将发布代码、数据和模型,以促进基于执行框架的智能体研究。
一句话总结
哥伦比亚大学、达特茅斯学院和微软研究院提出 OPENFORGE RL,一个开源框架,通过一个代理记录模型调用用于标准 RL 的轻量级代理和一个用于远程 rollout 的 Kubernetes 编排器,将训练与推理解耦,从而端到端地训练基于 harness 的 agent,实现任何环境下的可扩展训练,并在包括基于工具/抓取和多模态 GUI 浏览器/计算机使用 agent 在内的多种 agent 上进行验证,在 ClawEval 上达到 31.7(pass3)和 55.9(pass@3),在 Qwen-ClawBench 上达到 33.7,在 OSWorld-Verified 上达到 37.7,在 Online-Mind2Web 上达到 63.0,在 WebVoyager 上达到 72.3,优于同等规模的开源基线,并在 GUI 场景中匹配或超越更大模型,同时揭示 harness 的选择显著影响学习难度,且 RL 提升了 agent 在自我验证、工具覆盖和多步规划方面的可靠性,尽管错误恢复仍然薄弱。
核心贡献
- 论文引入 OPENFORGE RL,一个开源框架,通过使用轻量级代理将模型调用记录为训练数据,并使用 Kubernetes 编排器在远程容器中运行 rollout,将训练与 harness 推理解耦,使任何 harness 都能与标准 RL 代码库兼容,从而直接在 LLM 和 VLM 基 agent 的真实推理 harness 内部进行端到端训练。
- 仅使用数百到数千个任务,该框架便产生了 OpenForge-Claw 和 OpenForge-GUI 模型,在几乎所有工具使用和 GUI 基准上超越同等规模的开源模型,其中 OpenForge-Claw 在 ClawEval 上达到 31.7 pass3,OpenForge-GUI 在 OSWorld-Verified 上达到 37.7,在 Online-Mind2Web 上达到 63.0,在 WebVoyager 上达到 72.3,并在 GUI 场景中匹配或超越规模大数倍的模型。
- 论文分析了 harness 选择和 RL 如何塑造 agent 行为,发现更简单、对齐更好的 harness 更容易学习,训练收益可迁移到未见过的 harness,且 RL 提升了 agent 的可靠性,如自我验证和工具覆盖,而错误恢复即使在 RL 后仍然具有挑战性。
引言
现代 AI agent 严重依赖推理 harness——管理多轮交互、工具调用和外部系统连接的编排脚手架——以在软件工程、网页浏览和桌面控制等复杂环境中有效执行。然而,对于开放研究社区而言,端到端地训练这些配备 harness 的 agent 仍然困难,因为现有的 RL 框架无法原生表达 harness 所需的有状态、多进程推理,且大规模运行 harness rollout 需要容器化环境,这些环境无法与训练节点共存。这些限制迫使研究人员使用简化的 harness 重实现进行训练,造成训练与部署之间的不匹配。作者引入 OPENFORGE RL,一个开放框架,通过轻量级代理将 harness 推理与训练解耦,并使用 Kubernetes 编排器在云提供商上弹性启动远程 rollout 容器,使任何 harness 都能在其真实部署环境中使用标准 RL 代码库进行训练。
数据集
作者描述了一个合成数据流水线,旨在解决非编码环境(如浏览器使用、计算机使用和日常工具使用)中训练任务稀缺的问题。该流水线为基于 harness 的 agent 生成监督微调(SFT)和强化学习(RL)任务。
数据集构成与来源
- 该流水线为数据稀缺领域生成任务,包括抓取/日常工具使用和计算机使用。
- 候选指令基于现实场景,来源于网络/X API 或参考资产和指令池。
各子集的关键细节
- 该流水线不生成预定义的子集;相反,它根据给定的目标域和指定数量的任务按需创建任务。
- 每个生成的任务包含一个可执行环境(由自定义 Dockerfile 定义)和一个验证脚本。
- 该流水线支持 Linux/CLI 任务和 GUI/计算机使用任务,使用 Xvfb 等工具进行虚拟显示,以及预安装的 harness,如 OpenClaw 和 Codex。
论文如何使用数据
- 合成的任务通过从更强模型的 rollout 中蒸馏来支持 SFT,也支持 RL 训练。
- 作者未在本节指定训练分割比例,但该流水线用于在不同环境中实验其框架。
处理细节
- 合成流水线通过五个并行阶段模拟人工任务策划:
- 提出基于现实场景的候选指令。
- 剪枝低质量和重复任务。
- 为每个任务构建可执行环境和验证脚本。
- 通过 rollout 一个独立的开源 LLM/VLM 来测试任务。
- 通过修补缺陷来优化任务,直到通过所有检查。
- 测试和优化阶段在任务进入数据集之前对其进行端到端验证。
- 该流水线自然扩展到不同环境,因为每个环境都由自定义 Dockerfile 定义。
方法
作者将在复杂、长周期环境中完成任务建模为马尔可夫决策过程。为解决端到端训练基于 harness 的 agent 的挑战,他们引入 OPENFORGE RL,一个即插即用的 rollout 接口,将流行的强化学习框架连接到分布式 harness rollout。
该框架通过将推理过程与训练解耦,解决了训练栈与部署 harness 之间的不匹配问题。给定一个推理服务器,OPENFORGE RL 启动一个 Kubernetes 编排器,在云提供商上创建、管理和删除 rollout 容器 Pod。这允许并发 rollout 的弹性扩展,而不会使训练节点过载。同时,一个代理服务器包装推理服务器,并拦截远程沙箱发出的所有生成请求。当 rollout 完成时,代理从容器收集终端奖励和提示-响应对。这些用于将训练样本重构为轨迹:
τ=(s0H,a0,r0),(s1H,a1,r1),…,(sTH,aT,rT);rt=γT−t⋅rT通常 γ=1.0。当使用基于组的算法进行优化时,通过比较同一组内不同轨迹的平均样本奖励来计算优势。
为确保稳健训练,系统实现了针对 rollout 编排、异步执行和错误处理的特定策略。对每个 rollout 作业施加挂钟超时,以防止无响应的 rollout 阻塞整个训练批次的收集。如果作业超过其超时时间,它将被终止,并返回错误信号,以便训练继续使用剩余的 rollout。此外,来自以与策略模型无关的错误结束的轨迹的样本将被丢弃,以避免注入误导性的训练信号。
为支持跨编码以外的多样化环境(如浏览器和计算机使用)的训练,作者还构建了一个数据合成流水线。
该流水线模拟人工任务策划。给定一个目标域和所需的任务数量,它并行生成 agent 以提出基于现实场景的候选指令。然后剪枝低质量和重复任务,为每个任务构建可执行环境和验证脚本,并通过 rollout 一个独立模型来测试任务。最后,通过修补缺陷来优化任务,直到通过所有检查。此测试和优化阶段在任务进入数据集之前对其进行端到端验证。由于每个环境由自定义 Dockerfile 定义,该流水线自然从 Linux/CLI 任务扩展到 GUI 和计算机使用任务,支持监督微调和强化学习。
实验
实验表明,跨不同 harness 和环境的 OPENFORGE RL 训练持续提升 agent 性能,在监督微调之上进行强化学习在基于文本的工具使用和多模态 GUI 基准上均带来显著增益。更简单的 harness 更易掌握,在多个 harness 上训练增强了向未见过的 harness 的泛化能力,同时 RL 教会 agent 偏好专用工具而非通用工具,并增强了错误恢复和自我验证能力。
表格报告了用于训练 Claw 和 GUI agent 的 SFT 轨迹和 RL 任务数量。浏览器使用 GUI 训练数据最大,拥有超过 1,400 条 SFT 轨迹和 900 个 RL 任务,而计算机使用 GUI 数据最小。Claw agent 在多个基于文本的 harness 上训练,而每个 GUI agent 使用单个 harness。浏览器使用 GUI 训练集显著大于计算机使用 GUI 集,SFT 轨迹数量约为其两倍,RL 任务数量超过其三倍。Claw agent 使用四种不同的 harness(ReACT、ZeroClaw、OpenClaw、Codex)进行训练,而 GUI agent 各自依赖单个 harness(计算机使用为 Kimi-Agent,浏览器使用为 MolmoWeb)。
最先进的大语言模型在 agent 基准上设定了强大的基线,Claude Opus 4.6 在 ClawEval pass³ 和 MCPAtlas 上领先,并在 ClawEval pass@3 上与 Gemini 3.1 Pro 持平。论文进一步表明,在多样化 harness 上进行监督微调后跟强化学习(SFT+RL)相比这些基线带来了显著增益,除了在 OpenClaw 上改进适中。在多个 harness 上训练提高了泛化能力,RL 通过从通用 shell 命令转向专用工具来优化工具使用,同时增强了错误恢复和自我验证。Claude Opus 4.6 在评估模型中取得了最高的 ClawEval pass³ 和 MCPAtlas pass@1。Gemini 3.1 Pro 在 ClawEval pass@3 上与 Claude Opus 4.6 持平,QwenClawBench 分数紧密聚集,Claude 略微领先。SFT+RL 训练在除 OpenClaw 外的每个 harness 上都比基础模型带来了巨大增益,在 OpenClaw 上增益仅为中等。在多个 harness(ZeroClaw、OpenClaw、Codex)上训练在所有评估的 harness 上均比在单个 harness 上训练产生更好的性能,在更复杂的 harness 上增益最大。RL 减少了对通用 shell 调用的依赖,增加了对专用工具的使用,同时提高了错误恢复和自我验证能力。
领先的视觉语言模型在 GUI-agent 基准上显示出广泛的性能范围,专有系统占据主导地位。Gemini 3.1 Pro 取得了最高的 OSWorld 准确率,而 GPT 5.4 在 OnlineMind2Web 上以大幅优势领先,Kimi K2.5 设定了最高的 WebVoyager 分数。开源替代品如 Qwen3-VL 和 OpenCUA-32B 显著落后,尤其是在具有挑战性的 OSWorld 任务上。GPT 5.4 在 OnlineMind2Web 上达到 92.8,远超下一个最佳模型 Claude Opus 4.6 的 84.0。在 OSWorld 上,Gemini 3.1 Pro(76.2)以微弱优势超越 GPT 5.4(75.0)和 Claude Opus 4.6(72.7)。开源权重模型 Qwen3-VL 在 OSWorld 上仅得 38.1,不到顶级专有模型准确率的一半。Kimi K2.5 是唯一报告 WebVoyager 结果超过 70 的模型,达到 74.3,而 Qwen3-VL 落后为 66.4。
模型在允许直接自定义工具集成的 harness 上取得最高性能,ZeroClaw 和 ReACT* 在所有训练阶段领先。通过 SFT 和 RL 进行微调在大多数 harness 上带来显著改进,但在 OpenClaw 上的增益适中,同时它导致更长的提示和上下文。最佳结果来自结合 SFT 和 RL,尤其是在具有更简单、设计良好的工具接口的 harness 上。支持直接自定义工具注册的 ZeroClaw 和 ReACT* 在 SFT+RL 后实现了最高的 pass@1 分数(分别为 48.5% 和 45.1%),远超 OpenClaw(20.9%)和 Codex(32.5%)。在 SFT 上增加 RL 显著提高了大多数 harness 上的 pass@1,但 OpenClaw 仅从 16.7% 增加到 20.9%,同时比其他 harness 需要更长的上下文。
在单个 harness(ZeroClaw)上训练已经可以迁移到未见过的 harness,在 OpenClaw 和 Codex 上比基础模型产生中等增益。在所有三个 harness 上一起训练在每个 harness 上都产生了最强的结果,在更复杂的 OpenClaw 和 Codex 评估上改进最大,甚至在 ZeroClaw 本身上也超过了仅 ZeroClaw 的训练。仅在 ZeroClaw 上训练的模型在未见过的 OpenClaw 上比未训练的基础模型提高了 3.3 分,在未见过的 Codex 上提高了 4.6 分,展示了跨 harness 泛化。在 ZeroClaw、OpenClaw 和 Codex 上进行联合训练在所有 harness 上实现了最高的 pass@1 分数,相对于基础模型,ZeroClaw 增益 16.0,OpenClaw 增益 9.5,Codex 增益 20.3。多 harness 训练将 ZeroClaw 性能提升至 48.5,超过了仅 ZeroClaw 训练达到的 46.0。多 harness 训练带来的最大绝对改进出现在更复杂的 harness 上,Codex 比基础模型提高了 20.3 分,OpenClaw 提高了 9.5 分。
此评估检查了基于文本的 Claw agent 和 GUI agent,将最先进的专有模型与微调变体进行比较。Claude Opus 4.6、Gemini 3.1 Pro 和 GPT 5.4 等专有模型设定了强大的基线,但在多样化训练 harness 上进行监督微调后跟强化学习带来了显著增益,特别是对于具有直接自定义工具集成的 harness。多 harness 训练提高了泛化能力,联合训练在所有评估中均优于单 harness 设置,强化学习通过从通用 shell 命令转向专用工具来优化工具使用,同时增强了错误恢复和自我验证。对于 GUI agent,专有视觉语言模型在基准上占据主导地位,开源权重替代品在如 OSWorld 等具有挑战性的任务上显著落后。