Command Palette
Search for a command to run...
AgentOPSD:面向智能体强化学习的递归自蒸馏方法
AgentOPSD:面向智能体强化学习的递归自蒸馏方法
摘要
基于可验证奖励的强化学习(RL)能够构建轨迹级优势,但在长周期多轮次的智能体强化学习中,往往无法将功劳归于那些驱动结果的少数关键决策。近期一些工作将特权自蒸馏引入 RL 的功劳分配中,提供了更密集的监督信号,但此类局部信号应如何表达序列化的功劳分配仍不清楚。为此,我们提出 AgentOPSD,一种面向智能体强化学习的无评论家递归轮次级功劳分配方法。AgentOPSD 将令牌级的师生对数概率差聚合为轮次级证据,并在对数几率空间中递归更新贝叶斯信念状态。这提供了一种有原则的重加权方案,将稀疏的结果监督转化为轮次级功劳信号,并通过连续状态间的边际修正来识别关键轮次,同时完全兼容标准的策略优化,无需额外的轨迹采样。我们在 ALFWorld、WebShop 和 Search-QA 上使用两种规模的 Qwen 模型(3B 和 7B)对 AgentOPSD 进行评估。AgentOPSD 相比 GRPO 和强自蒸馏基线均有提升,在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,消融实验将性能提升归因于轮次级聚合和依赖历史的递归信念更新。我们的代码已开源,地址为 https://github.com/ZethWang/AgentOPSD。
一句话总结
清华大学、浙江大学和美团的研究人员提出了AgentOPSD,一种无critic的递归轮次级信用分配方法,它将token级师生对数概率差聚合为轮次级证据,在对数几率空间中递归更新贝叶斯信念状态,从而将稀疏的结果监督重新加权为轮次级信用信号,识别关键轮次,并在ALFWorld上使用Qwen2.5-7B达到89.1%的成功率,优于GRPO和自蒸馏基线。
核心贡献
- AgentOPSD将token级师生对数概率差聚合为轮次级证据,并在对数几率空间中递归更新贝叶斯信念状态,将稀疏的轨迹级奖励转换为轮次级信用信号。
- 该方法通过连续信念状态之间的边际修正来识别关键轮次,并重新分配轨迹级优势,无需额外的rollout或学习型critic。
- 在ALFWorld、WebShop和Search-QA上使用两种Qwen模型规模的实验表明,AgentOPSD持续优于GRPO和强大的自蒸馏基线,在ALFWorld上使用Qwen2.5-7B达到89.1%的成功率,消融实验将增益归因于轮次边界聚合和历史依赖的递归信念更新。
引言
在agentic强化学习中,大型语言模型必须在交互环境中跨多个轮次做出决策,但训练信号通常仅以稀疏的终端奖励形式出现。标准的组相对策略优化(GRPO)将统一的优势广播到整个轨迹,无法区分关键动作与常规步骤,尤其是在长horizon情况下。在线策略自蒸馏(OPSD)提供了更密集的token级监督,但其信号与环境轮次边界不对齐,且缺乏历史依赖的上下文。作者提出了AgentOPSD,该方法将token级师生对数概率差聚合为轮次级证据,并在对数几率空间中递归更新最终成功的贝叶斯信念状态。这种方法无需额外的rollout或学习型critic即可重新分配轨迹级优势,提供基于历史依赖信念修正的精确轮次级信用分配。
方法
作者介绍了AgentOPSD,一种通过贝叶斯证据视角用轮次级信用增强GRPO(组相对策略优化)优势的方法。整体流程通过引入自蒸馏对比来增强标准序列级奖励信号,该对比估计每个动作轮次对最终成功的支持程度,然后进行递归信念更新以考虑时间上下文。修改后的优势随后被输入PPO风格的裁剪目标。
Agent在K轮次episode中交互,从任务描述x和初始观察o0开始。在每个轮次k,策略πθ逐token生成动作ak:
ak=(yk,1,…,yk,Lk)∼πθ(⋅∣sk),其中sk是轮次k之前的交互历史。episode τ接收二元结果奖励R(τ)。GRPO为任务采样G条轨迹,并计算每条轨迹i的归一化序列级优势:
Aseq(i)=σR+ϵ0R(i)−Rˉ,其中Rˉ和σR是组内奖励的均值和标准差。该标量优势被均匀分配给轨迹的所有token,导致轮次级信用未得到解决。
为了将结果分解为每轮次的重要性,作者提出了一种可处理的事后近似,以逼近理想的贝叶斯轮次证据。理想证据是ak在成功条件与失败条件下的对数贝叶斯因子:
logp(ak∣sk,¬C)p(ak∣sk,C)=logp(C∣sk)p(C∣sk,ak),其中C表示最终成功。由于这些条件分布不可得,采用自蒸馏对比。对于每个轮次k,策略在两种模式下评估:标准学生分支,上下文为hk,t=(sk,yk,<t);教师分支,以检索到的技能描述c+为条件,该描述总结有用的子目标和动作模式:hk,t+=(sk,c+,yk,<t)。token级似然对比为
δk,t=logπθ(yk,t∣hk,t+)−logπθ(yk,t∣hk,t).轮次级证据ek为token之和:
ek=t=1∑Lkδk,t=logπθ(ak∣sk)πθ(ak∣sk,c+).该ek近似贝叶斯证据;其符号指示动作是增加还是减少对最终成功的信念。
仅凭原始每轮次证据无法捕捉该动作是关键的还是冗余的(考虑到之前的轮次)。因此,维护一个衰减证据累加器。从裁剪的先验信念B0=clip(Rˉ,ϵ0,1−ϵ0)开始(其中Rˉ为组成功率),对数几率递归更新:
c0=0,ck=γck−1+ek,ℓk=logit(B0)+ck,其中γ∈(0,1]是衰减因子,降低旧轮次的权重,且Bk=σ(ℓk)。轮次k的重要性是其边际修正:
ΔBk=Bk−Bk−1=σ(ℓk)−σ(ℓk−1).然后将该修正与序列级结果信号对齐,以获得带符号的信用:
qk=sign(Aseq)ΔBk.幅度∣ΔBk∣反映信念的偏移程度,而符号保留验证器结果信号的方向。
为防止大幅波动并使信用在轨迹内相对化,原始qk值在每episode内进行标准化。然后应用有界乘数:
μq(i)zk(i)=Ki1j=1∑Kiqj(i),σq(i)=Ki1j=1∑Ki(qj(i)−μq(i))2,=σq(i)+ϵ0qk(i)−μq(i),wk(i)=clip(1+bzk(i),1−b,1+b).重塑后的轮次级优势是原始序列级优势与加权版本的凸组合:
Ak(i)=Aseq(i)[(1−λ)+λwk(i)],其中b∈(0,1)控制裁剪范围,λ∈[0,1]设置重塑强度。轮次k中的每个token继承Ak(i)。
训练目标是标准PPO裁剪损失,但使用重塑后的优势:
LAgentOPSD(θ)=−G1i=1∑G∑tMi,t1t∑Mi,tmin(ri,tAκi(t)(i),clip(ri,t,1−ε,1+ε)Aκi(t)(i))+βLKL,其中ri,t是对rollout策略的重要性比率,κi(t)将每个token映射到其轮次,Mi,t是有效响应token的掩码,KL惩罚项以系数β添加。无需单独的蒸馏损失;自教师证据仅通过重塑优势影响学习。
实验
评估涵盖ALFWorld、Search-QA和WebShop环境,使用Qwen2.5-3B/7B模型,将AgentOPSD与无训练、组相对RL和自蒸馏基线进行比较,所有方法均在相同技能访问下进行。主要结果表明,增益源于通过信念修正构建的轮次级信用,而非特权技能,并且优势随着轨迹长度增长而增加,而均匀信用在长轨迹中退化更快。机制消融证实,轮次级信念跟踪、递归状态更新、带符号的结果对齐以及先验锚定各自都有贡献,超参数扫描表明该方法除信用重塑权重外具有鲁棒性。总体而言,该方法通过将师生差距累加到信念状态中,并根据信念修正分配信用,在长horizon任务中定位关键决策。
GRPO在ALFWorld、Search-QA和WebShop上取得了最佳整体性能,优于技能增强的Skill‑GRPO和vanilla基线。在推理时移除技能(OPSD)导致在Search‑QA和WebShop上崩溃,而信念先验锚点和重塑权重λ对于长horizon任务中的稳定信用分配至关重要。GRPO始终优于Skill‑GRPO,在ALFWorld上获得更高成功率,在Search‑QA上获得更高准确率,在WebShop上获得更高分数。在推理时没有技能,OPSD在Search‑QA和WebShop上失败,得分接近零,但保留了一些ALFWorld能力。经验先验B0至关重要:移除它使成功率降至78.9,表明锚定可稳定长horizon任务的信念修正。在超参数中,重塑权重λ影响最大;将λ从0.5降低会降低性能,而证据衰减和策略裁剪影响很小。
从AgentOPSD中移除任何单一组件都会使成功率从完整的89.1%下降,其中符号方向和状态先验锚点导致最大降幅。轮次级跟踪和递归状态修正提供较小但一致的增益,证实每个机制对方法性能的贡献。丢弃状态先验锚点使成功率降至78.9%,为最大降幅,表明其稳定早期信念更新的作用。移除符号方向而仅使用幅度使成功率降至80.5%,表明与结果对齐的符号至关重要。将轮次级信念跟踪替换为逐token累积使成功率降至85.9%,用原始局部差替换递归修正则降至82.8%。
GRPO始终优于Skill‑GRPO和vanilla基线,在ALFWorld、Search-QA和WebShop上均是如此,而在推理时移除技能(OPSD)导致在Search‑QA和WebShop上得分接近零,表明技能指导和信念先验锚点对于长horizon任务中稳定信用分配至关重要。经验B0锚点被证明至关重要:丢弃它使成功率降至78.9%,而重塑权重λ是最具影响力的超参数,从0.5降低会损害性能。对AgentOPSD的消融实验证实,状态先验锚点和与结果对齐的符号方向导致从完整的89.1%成功率中降幅最大,而轮次级跟踪和递归修正贡献较小但一致的增益,验证了每个机制的作用。