Command Palette
Search for a command to run...
EnvACE:通过世界预演内化环境动态以实现智能体强化学习
EnvACE:通过世界预演内化环境动态以实现智能体强化学习
摘要
训练用于长周期工具使用的大型语言模型智能体通常依赖于与真实或合成的可执行环境进行交互,这些环境的构建与验证成本高昂,或依赖于难以对齐的外部模拟器。我们提出 EnvACE,一种智能体强化学习方法,在训练期间以世界预演取代外部环境交互。策略在行动与预演之间交替:它首先生成一个工具调用,然后扮演环境的角色以产生由该动作引发的响应,并基于预演的响应决定后续决策。两种角色均通过任务成功奖励进行端到端联合优化。通过世界预演,策略在其参数中内化了动作与其环境响应之间的关系,从而产生一个直接支持决策的智能体世界模型。在 BFCL-v4、τ2-Bench、VitaBench 和 FinMCP-Bench 上,EnvACE 取得了强大且可迁移的性能,在整体评估中优于环境扩展基线方法。对照研究进一步表明,世界预演在不同模型规模上均能持续改善策略学习。在测试时,内化的世界模型允许在正式执行前进行私有预演,在适度的预演预算下无需额外外部交互即可带来进一步提升。我们的发现将世界预演确立为一条超越外部环境限制、扩展 LLM 智能体训练的新路径。
一句话总结
上海交通大学、浙江大学、新加坡国立大学等机构的研究人员提出 EnvACE,一种 Agent 式强化学习方法,通过世界预演将环境动态内化。该方法中,策略交替生成工具调用并扮演环境响应角色,两者通过任务成功奖励联合优化,以替代外部环境交互,在 BFCL-v4、τ2-Bench、VitaBench 和 FinMCP-Bench 等长周期工具使用基准上取得了强大且可迁移的性能,同时优于环境扩展基线,并进一步支持在测试时进行私密预演,在适度计算预算下获得额外提升。
核心贡献
- 该工作引入了世界预演,一种单策略交替生成工具调用并模拟相应环境响应的训练范式,无需外部可执行环境即可内化环境动态。
- 提出 EnvACE 作为一种 Agent 式强化学习方法,通过共享模型参数并应用角色级 GRPO 与端到端任务成功奖励,在自我展开的轨迹中联合优化行动与预演。
- 在 BFCL-v4、τ²-Bench、VitaBench 和 FinMCP-Bench 上的实验表明,EnvACE 始终优于环境扩展基线;控制分析证实了世界预演在不同模型规模下的优势;测试时预演在适度预算下带来额外提升。
引言
大型语言模型越来越多地被部署为 Agent,需要在长交互序列中将对话与工具使用相结合。先前的训练方法要么依赖成本高昂、难以扩展的可执行环境,要么依赖基于 LLM 的模拟器,这些模拟器可能产生不准确的反馈,并且仍需要真实环境的基础。作者提出 EnvACE,一种训练单一策略同时执行行动和内联预演环境响应的方法,无需任何外部环境交互即可内化环境动态。通过任务成功奖励联合优化行动和环境建模,策略学会通过一种称为世界预演的过程自主展开轨迹。
方法
作者提出了 EnvACE,一个将 Agent-环境交互循环内化到单一策略中的框架。如下图所示:
EnvACE 包含三个核心组件:世界预演、角色级分组相对策略优化(GRPO)和测试时扩展。
在传统的 Agent 式强化学习中,外部环境在每次行动后提供观测。EnvACE 通过将观测生成分配给策略本身的预演角色来改变这一边界。任务被形式化为有限时间范围的部分可观测马尔可夫决策过程。在时间步 t,策略观测交互历史 ht 并生成行动 at。不是查询外部环境,策略交替进行行动和预演。行动角色生成面向环境的行动:
at∼πθ(⋅∣ht,ACT).以历史和生成的行动为条件,预演角色生成相应的环境响应:
o^t∼πθ(⋅∣ht,at,REHEARSE).生成的响应被追加到交互历史中,即 ht+1=ht⊕(at,o^t),行动角色据此做出下一步决策。这一统一的行为-预演过程使轨迹可以在没有外部环境的情况下展开,使策略能够内化环境动态,作为 Agent 世界模型。
为优化该过程,作者采用了角色级 GRPO。对于每条指令 x,EnvACE 采样一组 K 个展开,每个获得轨迹级奖励 Ri。展开中的每个策略输出都继承这一奖励。作者收集特定角色 r∈{ACT,REHEARSE} 下所有 K 个展开中产生的策略输出,形成组 Gx,r。为每个角色分别计算奖励基线:
μx,r=∣Gx,r∣1yj,n∈Gx,r∑Rj.输出 yi,m 的角色级优势 Ai,m 相对于该基线定义:
Ai,m=Ri−μx,ri,m.共享策略使用截断的 GRPO 目标进行优化:
θmaxJ(θ)=Ex,i,m,ℓ[min(ρi,m,ℓ(θ)Ai,m,clip(ρi,m,ℓ(θ),1−ϵ,1+ϵ)Ai,m)],其中 ρi,m,ℓ(θ) 是标准的 GRPO 似然比。虽然基线是分别计算的,但两个角色的输出共同更新共享策略参数 θ。
在测试时,EnvACE 利用世界预演在与外部环境交互之前扩展推理时的计算。给定一条新指令 x,策略进行 N 次私密预演尝试。这些尝试可以以两种模式进行。在并行模式下,所有尝试独立地从相同的上下文中生成。在顺序模式下,每次新尝试会观察之前的预演轨迹及其评估和修改建议,从而实现迭代优化。完成尝试后,EnvACE 将所有轨迹和自我评估总结为一个紧凑的预演记忆 mx。然后,行动角色在外部环境中的单次提交执行时,以 mx 为条件,而预演保持私密,不会改变外部状态。
实验
EnvACE 在四个 Agent 基准上进行了评估:BFCL-v4、τ²-Bench、VitaBench 和 FinMCP-Bench,涵盖函数调用、有状态服务交互以及金融工具使用,并与 Qwen3 模型和环境扩展基线进行比较。世界预演范式(单一策略联合行动并生成环境响应)始终优于标准 GRPO 及其他代表性方法,在有状态的多轮任务上优势尤为明显。行动角色与预演角色之间的参数共享有助于策略内化环境动态,且收益随模型容量扩展。测试时预演进一步在不依赖外部交互的情况下提升性能,证实世界预演是工具使用 Agent 的有效且可扩展的训练框架。
EnvACE 在环境扩展基线中取得了最强的总体结果,在异构基准上具有一致的优势。在 BFCL V4 上,它优于更大的 Qwen3-8B 基础模型;在 VitaBench 上,它领先所有 7B–8B 模型;在 τ²-Bench 上获得第二高评分。该方法随模型规模良好扩展,并且与测试时世界预演结合,可在标准推理之上带来进一步的收益。EnvACE 在总体平均分上超越了 EnvScaler-8B 和 AWM-14B,反映出广泛的鲁棒性。在 τ²-Bench 上,EnvACE 获得第二高的平均分,大幅领先多个环境扩展基线。从 1.7B 扩展到 8B,BFCL V4 平均分大幅提升,并扩大了对标准强化学习的优势。在测试时使用 EnvACE 进行世界预演,将总体得分提升至非预演基线之上,且训练好的 EnvACE 策略优于使用基础模型进行预演。
在 FinMCP-Bench 上,EnvACE-8B 通过结合最佳工具精确度和适中的召回率,取得了最高的 TF1 分数,相比召回率领先的 EnvScaler-8B 取得了更好的平衡。外部模拟器基线(Simulator-8B)得分大幅降低,证实了世界预演相比仅依赖模拟方法的优势。EnvACE-8B 取得了最高的 TF1(46.78%),由 54.04% 的精确度驱动,该精确度超过次优精确度超过 14 个百分点。EnvScaler-8B 在工具召回率上领先(49.35%),但其 TF1 因精确度低得多而落后于 EnvACE-8B 3.10 分。Simulator-8B 记录了最低的 TF1(15.95%)和召回率(11.36%),突显了仅依赖外部模拟器的局限性。
通过世界预演的测试时扩展,当预演策略是经过预演训练的模型(EnvACE)时,在各领域一致提升 Agent 性能。EnvACE 并行执行取得了最佳总体分数,而使用基础模型进行预演则收益微乎其微,甚至不如无预演基线。收益来自内化的环境响应知识,而非仅仅增加推理计算。EnvACE 的并行世界预演将总体得分从 36.7%(无预演)提升至 40.9%,创造了最高结果。当基础模型用于顺序模式预演时,总体性能降至 34.9%,低于无预演基线;而 EnvACE 预演将其提升至 38.5%。
EnvACE 在一系列异构 Agent 基准上进行了评估,可靠地超越了环境扩展基线乃至更大的基础模型。该方法受益于模型扩展和测试时世界预演,仅在使用经过预演训练的 EnvACE 模型而不是基础模型或外部模拟器时,才能显著提升性能。结果证实,内化的环境响应知识是 Agent 稳健性的关键,EnvACE 在精确度和召回率之间取得了有效的平衡,而其他方法则过度或不足地优先考虑某一方面。