Command Palette
Search for a command to run...
SPADE ♠:自适应合成可执行环境中的自博弈
SPADE ♠:自适应合成可执行环境中的自博弈
摘要
持续自我改进需要一个不断扩展的、由自我生成且多样化的自适应目标池。对于语言智能体而言,现有的训练环境池(人工整理、静态合成或冻结验证器)在学习者能力提升时仍保持目标分布不变。我们提出 SPADE(自适应合成可执行环境中的自博弈),这是一个自博弈强化学习框架,其中单个 LLM 扮演两种角色:环境设计者,以可执行代码形式编写完整的、长时程的训练环境,并提供 OpenAI Gym 风格的 reset()/step() 接口;以及推理智能体,学习在这些环境中行动。每个环境都是有状态的多轮环境(包含状态转移、奖励函数和验证代码),因此一个接口即可覆盖推理问题和多步智能体工具使用。推理智能体的遗憾通过其在使用和不使用特权提示时的奖励差距来估计;在优化这一遗憾信号的过程中,环境设计者学会将目标环境定位在智能体能力边缘,同时保持其可解性。通过大量实验,我们发现若干要素对成功至关重要:将环境设计者锚定在从大规模预训练语料中采样的文档上,并赋予其累积的环境记忆。扩展到 30B 参数模型后,SPADE 在八个留出的数学、科学、代码和推理基准上平均比最强的固定环境基线提升 +5.3,并在工具使用场景中将 BFCL v4 多轮提升 +5.7、ACEBench-Agent 提升 +13.9;在游戏场景中,相对最强基线的优势随模型规模增大而扩大。通过使环境设计本身成为可学习的组成部分,SPADE 向开放式自我改进迈出了具体一步。
一句话总结
来自华盛顿大学、斯坦福大学等机构的研究人员提出了 SPADE,这是一个自博弈 RL 框架,其中一个 LLM 扮演环境设计器,编写可执行的 Gym 风格 reset()/step() 环境,另一个推理 Agent 学习在其中行动,并使用带提示/不带提示的奖励遗憾来瞄准能力边缘的可行任务;SPADE 在八个基准上将固定基线提升 +5.3,在 BFCL v4 上提升 +5.7,在 ACEBench-Agent 上提升 +13.9。
核心贡献
- 论文提出了 SPADE,这是一个自博弈 RL 框架,其中一个 LLM 充当环境设计器,编写可执行的 Gym 风格 reset/step 环境,另一个推理 Agent 在其中学习行动,通过单一有状态接口统一推理和多步工具使用。
- 基于提示的遗憾奖励通过使用有特权提示和无特权提示行动之间的奖励差距,训练环境设计器瞄准推理 Agent 的学习前沿环境,使环境可行但具有挑战性,并以 minimax 遗憾理论为基础。
- 将环境设计建立在预训练语料库和累积环境记忆之上至关重要;在 Qwen3 模型 30B 参数规模下,SPADE 在八个留出的数学、科学、代码和推理基准上平均比最强固定环境基线高出 +5.3,并在 BFCL v4 多轮上提升工具使用 +5.7,在 ACEBench-Agent 上提升 +13.9。
引言
Agentic 语言模型通过与提供可验证奖励的环境交互而不断改进,这使得自适应训练环境的供给成为核心瓶颈。先前工作受到固定环境池、人工筛选缓慢、合成生成器冻结或自博弈只产生稀疏奖励任务而非完整多轮环境的限制。作者提出了 SPADE,一个让一个 LLM 扮演两个角色的框架:环境设计器生成完整的 Gym 风格马尔可夫决策过程作为可执行 Python 代码,推理 Agent 从这些过程中学习。环境设计器本身通过强化学习训练,使用基于提示的遗憾信号,瞄准推理 Agent 当前能力前沿附近可解决的环境。这形成了环境生成与 agent 能力之间的共同演化,统一了单轮和多轮任务,同时保持训练课程随着 agent 改进而自适应。
数据集
作者使用合成工具使用环境作为该领域的数据。关键细节:
- 来源:环境由环境设计器生成,环境设计器以包含 15k 文档的代码语料库为基础。不向环境设计器展示任何基准任务或数据。
- 组成:每个生成的环境包括 OpenAI 函数调用格式的模拟工具、后端状态,以及三到五条逐个到达的自然语言用户指令。每条指令都有对结果状态的检查。
- 规模:生成使用 k=8,因为工具环境的生成成本更高。
- 处理/验证:验证在游戏检查之外增加了两项检查:一个确定性 reset 门,在多个种子下对每个成功标准进行演练;以及一个 LLM 检查,验证每个成功标准都能由某个工具满足。
- 使用:推理 Agent 通过多轮调用工具来解决每个环境,只有完成每条用户指令后才会获得奖励。特权提示是分步计划,因此 agent 仍需通过工具调用找到准确参数。
- 评估:作者使用 BFCL v4 多轮、τ²-bench 和 ACEBench-Agent 进行评估,具体是 ACEBench-en 的 Agen 类别,并按领域报告结果。
方法
SPADE 是一个端到端自博弈框架,其中单个 LLM π 在生成可执行训练环境和学习解决这些环境之间交替。如框架图所示,系统包含两个主要角色:环境设计器(ED)和推理 Agent(RA)。ED 以环境记忆 M 和预训练语料库 C 为条件,输出可执行环境 e 和特权提示 h。然后,RA 在有 h 和没有 h 的情况下分别与环境 e 互动。这两次 rollout 之间的回报差距构成 ED 的基于提示的遗憾奖励 rD(e),而任务正确性作为 RA 的奖励。两种奖励都通过 Group Relative Policy Optimization (GRPO) 更新共享策略 π。
作者将自适应环境自博弈形式化为一个博弈,其中单个模型 πθ 通过角色特定的系统提示扮演两个角色。在环境设计器角色(πD)中,模型生成可执行环境 e∈E,作为实现 Gym 风格 reset/step API 的 Python 程序。转移函数 T(s′∣s,a) 和奖励函数 R(s,a) 编码在 step 实现中。ED 还生成特权提示 h,这是与任务相关的信息,例如部分解思路或使环境更容易解决的关键结构观察。在推理 Agent 角色(πA)中,模型通过顺序动作与 e 交互。这种代码即环境表示在单一接口下统一了单轮和多轮 agentic 设置。由于两个角色共享参数 θ,对任一角色的更新都会影响同一策略。
环境设计器生成环境 e 的奖励由基于提示的遗憾定义:
rD(e)=rˉA(e∣h)−rˉA(e)其中 rˉA(e∣h) 是 RA 在有特权提示 h 的情况下采样 G 次新 rollout 的平均回报,rˉA(e) 是没有提示时 G 次 rollout 的平均回报。高遗憾表示环境处于学习前沿(有提示可解,无提示不可解),而低遗憾表示已经掌握或环境不可解。这在没有单独对抗者的情况下实现了 minimax 遗憾目标。成对的轨迹揭示了回报差距的行为来源,因为提示缩小了 agent 的搜索空间或直接提供了关键结构观察。
为防止生成器发生模式坍缩,作者将外部语料库视为延长新颖性隐性约束的机制。每一轮,ED 以新采样的人类语料库为条件,该语料库为可执行 MDP 提供种子。这种语料库基础维持了环境多样性,t-SNE 可视化和 Vendi 分数证明了这一点,显示在去除语料库基础后多样性显著下降。此外,跨回合记忆缓冲区保存先前生成的环境,并标注遗憾分数和技能标签,防止 ED 重新提出已掌握的任务。该记忆确保每一轮从 RA 当前觉得困难的内容开始,使生成难度保持在 RA 的前沿并随前沿移动。
策略 πθ 通过可验证奖励强化学习(RLVR)使用 Group Relative Policy Optimization(GRPO)进行训练。对于每个输入提示 x,GRPO 采样一组 G 个响应 {y1,…,yG}∼πθ(⋅∣x),并计算组归一化优势:
A^i=std({rj}j=1G)ri−mean({rj}j=1G)策略通过带 KL 正则化的裁剪策略梯度进行更新:
L(θ)=−G1i=1∑Gmin(πold(yi∣x)πθ(yi∣x)A^i,clip(πold(yi∣x)πθ(yi∣x),1−εlow,1+εhigh)A^i)+βKL⋅KL[πθ∥πref]为稳定双角色联合训练,优势按角色独立归一化。ED 更新延迟 k 次 rollout,以便难度锚点在完整训练窗口内对每个环境的 RA 胜率进行评分。部署的 ED 奖励将下限遗憾与平顶难度锚点相结合。在这种训练方案下,相对于每个骨干模型基础的平均增益随模型规模增长,而固定环境 GRPO 保持在基线附近,证明了自适应课程在保持训练信号挑战性方面的有效性。
实验
SPADE 在三个 Qwen3 骨干模型上对游戏和工具使用环境设计进行评估,并与固定环境和冻结设计器基线进行比较。游戏实验表明,自适应生成的环境改善了留出的程序推理、科学和代码表现;工具使用实验则显示多步 agentic 基准上的提升。定性和消融结果表明,语料库基础维持多样性,环境设计器与推理 Agent 之间的共同自适应对改进是必要的,基于提示的遗憾奖励优于基于 EMA 的替代方案。扩展分析进一步表明,收益随模型规模和课程多样性增长。
在多样化的合成游戏环境上训练推理 agent,可在每个骨干模型规模上改善留出的推理和代码基准。自适应环境设计器优于固定环境基线,相对于基础模型的增益随着模型规模增大而增加,并且在所有认知技能类别上程序推理得到改善,同时竞赛数学表现保持不变。课程多样性贡献显著,因为减少到两个技能的课程只能捕获部分增益。SPADE 在每个骨干模型规模上改善了平均留出表现,相对于基础模型的增益从较小模型到最大测试骨干逐渐增大。固定环境基线的平均增益小得多,静态环境提供固定信号,较大模型很快拟合且无持续收益。程序推理在每个认知技能类别上均改善,而竞赛数学表现保持不变。完整的六技能课程比两技能课程产生更强的程序、科学和代码增益,表明增益随课程多样性扩展。在最大测试骨干上,SPADE 的套件平均分达到 58.3,比最强固定环境基线高出 5.3 分。
SPADE 生成的合成工具使用环境可与专用数据合成系统相媲美,并在需要有状态、多步交互的基准上表现最佳。增益在 ACEBench-Agent 和 BFCL v4 多轮上最大,其任务结构与生成环境高度相似,SPADE 在 30B-A3B 上在这两方面均超过参考合成环境 agent。该模式表明,结构性训练信号可以在仅靠领域特定数据收集无法达到的地方迁移。SPADE 在 30B-A3B 上于 BFCL v4 多轮和 ACEBench-Agent 上领先于所比较的专用数据合成系统。工具使用增益与任务结构相关,最大改进在 ACEBench-Agent,其次是 BFCL v4 多轮,然后是 τ²-bench。生成的环境改善了每个被评估的骨干模型,在有状态、多调用 agentic 任务上相对增益最强。
在游戏设置中,完整的自适应环境设计器配置在所有测试变体中取得了最高的套件平均性能。去除语料库基础或环境记忆,或冻结设计器,会降低最佳检查点分数,即使冻结的前沿模型设计器也无法缩小差距。比较结果表明,环境设计器的自适应训练是所观察到增益的核心。完整的自适应配置在未加权套件平均上优于所有部分配置和冻结设计器对照。去除语料库基础或环境记忆,或冻结环境设计器的消融实验均降低最佳检查点性能。
实验评估了在由自适应环境设计器生成的多样合成游戏环境中训练推理 agent,并与固定环境和专用数据合成基线进行比较。自适应方法在每个骨干模型规模上改善了留出推理和代码基准,增益随着模型规模增大和课程多样性增加而增长,同时工具使用性能在有状态、多步任务上提升最大。消融研究表明,环境设计器的自适应训练是关键,因为去除语料库基础、环境记忆或冻结设计器会降低最佳检查点性能。