Command Palette
Search for a command to run...
ClawGym II:探索基于智能体执行框架的黑盒强化学习
ClawGym II:探索基于智能体执行框架的黑盒强化学习
摘要
智能体执行框架通过协调智能体与环境的交互,显著提升了长时程任务的表现。然而,通过复杂执行框架进行强化学习在很大程度上仍未被探索,因为将此类训练扩展到长时程智能体任务会带来根本性挑战。在本工作中,我们提出了一个统一的黑盒强化学习框架,用于通过复杂执行框架对通用智能体进行稳定且可扩展的优化。具体而言,我们首先构建了一个基于沙箱的执行基础设施,将任务环境和执行框架隔离在临时沙箱中,以支持大规模并发 rollout。随后,我们将策略优化与不透明的执行框架执行解耦,并在模型边界处放置一个服务代理以捕获模型调用。为了重建多轮轨迹并提高训练效率,我们将捕获的调用组织为前缀树,并进一步适配基于 critic 的 PPO 和无 critic 的 GRPO,以在恢复的树结构上进行优化。同时,我们在整个优化过程中保持训练与推理的一致性。最后,我们引入了混合执行框架训练,使单一模型能够由异构执行框架联合优化。使用 Qwen3-30A3B,黑盒强化学习通过 OpenClaw 和 Claude Code 分别将 ClawGym-Bench 上的 Pass@1 提升了 9.98 和 14.81 个百分点,同时在 200–400 个优化步骤内保持稳定。此外,该框架在 JobBench 和 OfficeQA 等更具挑战性的任务上也带来了一致的提升。总体而言,我们的框架能够通过黑盒执行框架对通用智能体进行有效、稳定且可扩展的优化,支持跨异构执行系统的统一训练。
一句话总结
中国人民大学与 IQuest Research 的研究人员提出一个统一的黑盒强化学习框架,将基于沙箱的并发 rollout、serving proxy 和前缀树重建相结合,使基于 critic 的 PPO 与无 critic 的 GRPO 适配复杂 Agent 执行框架;使用 Qwen3-30A3B 时,该框架在 ClawGym-Bench 上通过 OpenClaw 和 Claude Code 将 Pass@1 分别提升 9.98 和 14.81 个点,同时在 200 到 400 个优化步骤内保持稳定,并在 JobBench 和 OfficeQA 上带来进一步提升。
核心贡献
- 本文提出一个统一的黑盒强化学习框架,将复杂部署执行框架视为不透明的 rollout 引擎,并通过基于沙箱的执行隔离和位于模型边界的 serving proxy,将策略优化与执行框架执行解耦。
- 该框架将捕获的模型调用重建为前缀树,能够恢复多轮和分叉轨迹,并在保持训练与推理一致性的同时,在该结构上适配基于 critic 的 PPO 和无 critic 的 GRPO。
- 该框架支持混合执行框架训练,用于跨异构执行框架联合优化单一模型;使用 Qwen3-30A3B 时,黑盒强化学习在 ClawGym-Bench 上通过 OpenClaw 和 Claude Code 将 Pass@1 分别提升 9.98 和 14.81 个点,在 PinchBench 上分别提升 11.71 和 17.28 个点,并在 JobBench 和 OfficeQA 上带来一致的提升。
引言
Agent 执行框架已成为自主 Agent 的核心运行时层,在 Claude Code 和 OpenClaw 等系统中协调大型语言模型与工具、环境及长时程任务的交互。这些执行框架虽然能提升 Agent 性能,但其价值取决于底层模型是否经过训练以有效使用它们,而其不透明的内部控制流使标准强化学习变得困难。此前工作缺乏稳定、可扩展的黑盒强化学习方法,用于通过此类复杂执行框架优化通用 Agent。作者提出一个统一的黑盒强化学习框架,将每个执行框架视为未修改的 rollout 引擎,在沙箱中隔离任务执行,通过 serving proxy 和前缀树结构恢复多轮轨迹,并支持 PPO 与 GRPO 优化。该框架还支持跨异构执行框架的混合执行框架训练,作者在 OpenClaw 和 Claude Code 上验证了该方法,并取得一致的基准提升。
方法
作者提出一个统一的黑盒强化学习框架,通过未修改且不透明的 Agent 执行框架优化可训练模型,将策略优化与执行框架执行解耦。现代通用 Agent 通过成熟的执行框架部署,这些框架提供丰富的执行抽象,集成工具编排、上下文管理和失败恢复。在这一范式下,交互轨迹由模型和执行框架共同决定。
为实现可扩展的黑盒 rollout,作者建立了专用基础设施。对于每个任务,初始化任务特定环境,并在临时沙箱内启动所选执行框架,提供隔离的工作空间和运行时依赖。策略优化与执行框架执行解耦:训练引擎负责优化,而推理引擎提供当前策略服务。serving proxy 被放置在模型服务边界,以拦截每个模型请求。该代理调用 rollout 策略、返回响应,并记录准确的输入 token、生成的 token、rollout 对数概率和任务元数据,而无需插桩执行框架内部逻辑。
如下图所示:
在 rollout 完成后,验证器评估最终工作区状态以产生 rollout 级奖励。捕获的模型调用记录和奖励传入训练流水线,以重建可训练的多轮轨迹。
由于黑盒 rollout 期间捕获的模型调用是碎片化、分叉且可能冗余的,作者将其组织为 rollout 级前缀树。该树以初始任务提示为根,每个调用被附加到其累积历史构成输入上下文最长前缀的现有节点上。这种结构重建了共享交互历史,并恢复由执行框架引入的中间非模型内容。
前缀树中并非所有叶节点都对应主任务的完成。作者应用过滤以保留合适的轨迹。由重试或重新生成的响应产生的死叶被丢弃,每个交互段中仅保留具有最长有效延续的叶节点。过度分叉为过多叶节点的 rollout 被整体丢弃,这表明出现了重复或失败生成。此外,来自子 Agent 或上下文压缩的辅助轨迹被排除,以防止模糊的信用分配和噪声优化信号。
前缀树构建并过滤后,作者在恢复的多轨迹结构上优化策略。来自单个 rollout 的所有保留轨迹共享相同的终止奖励。对于 Group Relative Policy Optimization,优势在每次 rollout 中计算一次,并分配给所有可训练 token 节点,共享前缀仅计数一次。对于 Proximal Policy Optimization,采用一种简化变体:同一次 rollout 内的轨迹被独立处理,不进行时间折扣,使 Generalized Advantage Estimation 退化为 A^t=Ri−Vϕ(st)。
为保持训练与推理一致性,作者采用黑盒 token-in-token-out 准则。推理引擎生成的 token 直接嫁接到前缀树上,作为训练数据的唯一来源。为执行框架解码的结构化文本绝不会被重新编码回训练轨迹,从而确保交给训练引擎的序列与策略采样的序列完全一致。此外,为缓解推理引擎与训练引擎之间数值差异导致的离策略偏差,对每个训练 token 应用 token 级重要性采样比来缩放其损失:
wt=min(exp(logπold(at∣st)−logπrollout(at∣st)),cˉ)最后,为防止策略对单一执行框架特化,作者引入混合执行框架训练。该方法在同一训练运行中使用来自多个异构执行框架的 rollout 联合优化共享策略。同一任务在不同执行框架下的 rollout 在每个批次中随机混合,但其优势在独立的任务-执行框架组内进行归一化,以防止由执行框架相关的交互模式扭曲相对优势估计。
实验
实验通过在 OpenClaw 和 Claude Code 执行框架下训练 Qwen3 模型,并在 ClawGym-Bench 和 PinchBench 上测量 Pass@1 来评估该黑盒强化学习框架,同时额外测试了训练动态、混合执行框架优化、更具挑战性的 JobBench 和 OfficeQA 任务、冷启动初始化,以及与白盒 AgentLoop RL 的对比。黑盒强化学习在异构执行框架和不同模型规模上均持续优于初始策略,PPO 和 GRPO 都保持稳定且结果大体相当。混合来自多个执行框架的 rollout 未带来明显不稳定或性能下降,同一统一流水线无需针对任务修改即可扩展到更困难的任务分布。冷启动初始化可提高稳定性和最终性能,但并非必需;白盒 AgentLoop RL 仅能部分迁移到未见过的执行框架,且性能低于与执行框架匹配的黑盒训练。
结果比较了多个 Qwen3 变体和 ClawGym-8B 在 PinchBench 和 ClawGym-Bench 上的 Pass@1 表现。较大的 Qwen3 变体通常取得更高的平均分,其中 Qwen3-235A23B 在大多数 ClawGym-Bench 类别中领先,并报告了最强的平均分。ClawGym-8B 在 PinchBench 和软件开发上表现出色,而白盒 AgentLoop 训练在环内带来大幅提升,但仅能部分迁移到 OpenClaw 执行框架。ClawGym-8B 以明显优势取得最高的 PinchBench 分数,并在软件开发类别中领先,但在六个 ClawGym-Bench 类别中有五个落后于 Qwen3-235A23B。Qwen3-235A23B 在所列模型中报告最高平均分,并在大多数 ClawGym-Bench 类别中优于 ClawGym-8B。白盒 AgentLoop RL 在其 Qwen3-30A3B 初始化的环内表现有所提升,但在 OpenClaw 下仍不及同一评估执行框架下的直接黑盒训练。
白盒 AgentLoop RL 在自身训练环中测量时带来显著提升,在所有任务类别上均优于起始模型和黑盒 RL 模型。白盒训练模型还可以部分泛化到外部 OpenClaw 执行框架,相比其初始化有所提高,但未达到直接为 OpenClaw 训练的模型性能。在白盒 AgentLoop 执行框架下,WhiteBox-30A3B 在评估模型中取得最高的平均性能和任务级性能。WhiteBox-30A3B 在白盒评估执行框架下优于 Qwen3-30A3B 初始化和黑盒训练的 ClawII-OC-30A3B。在 OpenClaw 执行框架下,WhiteBox-30A3B 在大多数任务类别中相比其初始化有所提高,但仍落后于 ClawII-OC-30A3B,表明白盒到黑盒的迁移只是部分完成。
实验评估了多个 Qwen3 变体和 ClawGym-8B 在 PinchBench 和 ClawGym-Bench 上的 Pass@1 表现,并分别评估白盒 AgentLoop RL 在其环内执行框架和外部 OpenClaw 执行框架下的表现。较大的 Qwen3 模型通常平均得分更高,其中 Qwen3-235A23B 在大多数 ClawGym-Bench 类别中领先,而 ClawGym-8B 取得最佳 PinchBench 结果并领先软件开发,但在大多数其他类别中落后。白盒 AgentLoop 训练相对于其 Qwen3-30A3B 初始化和黑盒模型产生很强的环内提升,但这一优势仅部分迁移到 OpenClaw,在 OpenClaw 下相比初始化有所改进,但仍低于直接为该执行框架训练的模型。