HyperAIHyperAI

Command Palette

Search for a command to run...

AgentOPSD:面向智能体强化学习的递归自蒸馏方法

摘要

基于可验证奖励的强化学习(RL)能够构建轨迹级优势,但在长周期多轮次的智能体强化学习中,往往无法将功劳归于那些驱动结果的少数关键决策。近期一些工作将特权自蒸馏引入 RL 的功劳分配中,提供了更密集的监督信号,但此类局部信号应如何表达序列化的功劳分配仍不清楚。为此,我们提出 AgentOPSD,一种面向智能体强化学习的无评论家递归轮次级功劳分配方法。AgentOPSD 将令牌级的师生对数概率差聚合为轮次级证据,并在对数几率空间中递归更新贝叶斯信念状态。这提供了一种有原则的重加权方案,将稀疏的结果监督转化为轮次级功劳信号,并通过连续状态间的边际修正来识别关键轮次,同时完全兼容标准的策略优化,无需额外的轨迹采样。我们在 ALFWorld、WebShop 和 Search-QA 上使用两种规模的 Qwen 模型(3B 和 7B)对 AgentOPSD 进行评估。AgentOPSD 相比 GRPO 和强自蒸馏基线均有提升,在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,消融实验将性能提升归因于轮次级聚合和依赖历史的递归信念更新。我们的代码已开源,地址为 https://github.com/ZethWang/AgentOPSD

一句话总结

清华大学、浙江大学和美团的研究人员提出了AgentOPSD,一种无critic的递归轮次级信用分配方法,它将token级师生对数概率差聚合为轮次级证据,在对数几率空间中递归更新贝叶斯信念状态,从而将稀疏的结果监督重新加权为轮次级信用信号,识别关键轮次,并在ALFWorld上使用Qwen2.5-7B达到89.1%89.1\%89.1%的成功率,优于GRPO和自蒸馏基线。

核心贡献

  • AgentOPSD将token级师生对数概率差聚合为轮次级证据,并在对数几率空间中递归更新贝叶斯信念状态,将稀疏的轨迹级奖励转换为轮次级信用信号。
  • 该方法通过连续信念状态之间的边际修正来识别关键轮次,并重新分配轨迹级优势,无需额外的rollout或学习型critic。
  • 在ALFWorld、WebShop和Search-QA上使用两种Qwen模型规模的实验表明,AgentOPSD持续优于GRPO和强大的自蒸馏基线,在ALFWorld上使用Qwen2.5-7B达到89.1%的成功率,消融实验将增益归因于轮次边界聚合和历史依赖的递归信念更新。

引言

在agentic强化学习中,大型语言模型必须在交互环境中跨多个轮次做出决策,但训练信号通常仅以稀疏的终端奖励形式出现。标准的组相对策略优化(GRPO)将统一的优势广播到整个轨迹,无法区分关键动作与常规步骤,尤其是在长horizon情况下。在线策略自蒸馏(OPSD)提供了更密集的token级监督,但其信号与环境轮次边界不对齐,且缺乏历史依赖的上下文。作者提出了AgentOPSD,该方法将token级师生对数概率差聚合为轮次级证据,并在对数几率空间中递归更新最终成功的贝叶斯信念状态。这种方法无需额外的rollout或学习型critic即可重新分配轨迹级优势,提供基于历史依赖信念修正的精确轮次级信用分配。

方法

作者介绍了AgentOPSD,一种通过贝叶斯证据视角用轮次级信用增强GRPO(组相对策略优化)优势的方法。整体流程通过引入自蒸馏对比来增强标准序列级奖励信号,该对比估计每个动作轮次对最终成功的支持程度,然后进行递归信念更新以考虑时间上下文。修改后的优势随后被输入PPO风格的裁剪目标。

Agent在K轮次episode中交互,从任务描述xxx和初始观察o0o_0o0开始。在每个轮次kkk,策略πθ\pi_\thetaπθ逐token生成动作aka_kak

ak=(yk,1,,yk,Lk)πθ(sk),a_k = (y_{k,1}, \dots, y_{k,L_k}) \sim \pi_\theta(\cdot \mid s_k),ak=(yk,1,,yk,Lk)πθ(sk),

其中sks_ksk是轮次kkk之前的交互历史。episode τ\tauτ接收二元结果奖励R(τ)R(\tau)R(τ)。GRPO为任务采样GGG条轨迹,并计算每条轨迹iii的归一化序列级优势:

Aseq(i)=R(i)Rˉσ^R+ϵ0,A_{\mathrm{seq}}^{(i)} = \frac{R^{(i)} - \bar{R}}{\widehat{\sigma}_R + \epsilon_0},Aseq(i)=σR+ϵ0R(i)Rˉ,

其中Rˉ\bar{R}Rˉσ^R\widehat{\sigma}_RσR是组内奖励的均值和标准差。该标量优势被均匀分配给轨迹的所有token,导致轮次级信用未得到解决。

为了将结果分解为每轮次的重要性,作者提出了一种可处理的事后近似,以逼近理想的贝叶斯轮次证据。理想证据是aka_kak在成功条件与失败条件下的对数贝叶斯因子:

logp(aksk,C)p(aksk,¬C)=logp(Csk,ak)p(Csk),\log \frac{p(a_k \mid s_k, C)}{p(a_k \mid s_k, \neg C)} = \log \frac{p(C \mid s_k, a_k)}{p(C \mid s_k)},logp(aksk,¬C)p(aksk,C)=logp(Csk)p(Csk,ak),

其中CCC表示最终成功。由于这些条件分布不可得,采用自蒸馏对比。对于每个轮次kkk,策略在两种模式下评估:标准学生分支,上下文为hk,t=(sk,yk,<t)h_{k,t} = (s_k, y_{k,<t})hk,t=(sk,yk,<t);教师分支,以检索到的技能描述c+c^+c+为条件,该描述总结有用的子目标和动作模式:hk,t+=(sk,c+,yk,<t)h_{k,t}^+ = (s_k, c^+, y_{k,<t})hk,t+=(sk,c+,yk,<t)。token级似然对比为

δk,t=logπθ(yk,thk,t+)logπθ(yk,thk,t).\delta_{k,t} = \log \pi_\theta(y_{k,t} \mid h_{k,t}^+) - \log \pi_\theta(y_{k,t} \mid h_{k,t}).δk,t=logπθ(yk,thk,t+)logπθ(yk,thk,t).

轮次级证据eke_kek为token之和:

ek=t=1Lkδk,t=logπθ(aksk,c+)πθ(aksk).e_k = \sum_{t=1}^{L_k} \delta_{k,t} = \log \frac{\pi_\theta(a_k \mid s_k, c^+)}{\pi_\theta(a_k \mid s_k)}.ek=t=1Lkδk,t=logπθ(aksk)πθ(aksk,c+).

eke_kek近似贝叶斯证据;其符号指示动作是增加还是减少对最终成功的信念。

仅凭原始每轮次证据无法捕捉该动作是关键的还是冗余的(考虑到之前的轮次)。因此,维护一个衰减证据累加器。从裁剪的先验信念B0=clip(Rˉ,ϵ0,1ϵ0)B_0 = \operatorname{clip}(\bar{R}, \epsilon_0, 1-\epsilon_0)B0=clip(Rˉ,ϵ0,1ϵ0)开始(其中Rˉ\bar{R}Rˉ为组成功率),对数几率递归更新:

c0=0,ck=γck1+ek,k=logit(B0)+ck,c_0 = 0,\quad c_k = \gamma c_{k-1} + e_k,\quad \ell_k = \operatorname{logit}(B_0) + c_k,c0=0,ck=γck1+ek,k=logit(B0)+ck,

其中γ(0,1]\gamma \in (0,1]γ(0,1]是衰减因子,降低旧轮次的权重,且Bk=σ(k)B_k = \sigma(\ell_k)Bk=σ(k)。轮次kkk的重要性是其边际修正:

ΔBk=BkBk1=σ(k)σ(k1).\Delta B_k = B_k - B_{k-1} = \sigma(\ell_k) - \sigma(\ell_{k-1}).ΔBk=BkBk1=σ(k)σ(k1).

然后将该修正与序列级结果信号对齐,以获得带符号的信用:

qk=sign(Aseq)ΔBk.q_k = \operatorname{sign}(A_{\mathrm{seq}}) \, \Delta B_k.qk=sign(Aseq)ΔBk.

幅度ΔBk|\Delta B_k|∣ΔBk反映信念的偏移程度,而符号保留验证器结果信号的方向。

为防止大幅波动并使信用在轨迹内相对化,原始qkq_kqk值在每episode内进行标准化。然后应用有界乘数:

μq(i)=1Kij=1Kiqj(i),σq(i)=1Kij=1Ki(qj(i)μq(i))2,zk(i)=qk(i)μq(i)σq(i)+ϵ0,wk(i)=clip ⁣(1+bzk(i),1b,1+b).\begin{aligned} \mu_q^{(i)} &= \frac{1}{K_i}\sum_{j=1}^{K_i} q_j^{(i)}, \quad \sigma_q^{(i)} = \sqrt{\frac{1}{K_i}\sum_{j=1}^{K_i} (q_j^{(i)} - \mu_q^{(i)})^2},\\[4pt] z_k^{(i)} &= \frac{q_k^{(i)} - \mu_q^{(i)}}{\sigma_q^{(i)} + \epsilon_0}, \quad w_k^{(i)} = \operatorname{clip}\!\Big(1 + b\,z_k^{(i)},\, 1-b,\, 1+b\Big). \end{aligned}μq(i)zk(i)=Ki1j=1Kiqj(i),σq(i)=Ki1j=1Ki(qj(i)μq(i))2,=σq(i)+ϵ0qk(i)μq(i),wk(i)=clip(1+bzk(i),1b,1+b).

重塑后的轮次级优势是原始序列级优势与加权版本的凸组合:

A~k(i)=Aseq(i)[(1λ)+λwk(i)],\widetilde{A}_k^{(i)} = A_{\mathrm{seq}}^{(i)} \big[ (1-\lambda) + \lambda\, w_k^{(i)} \big],Ak(i)=Aseq(i)[(1λ)+λwk(i)],

其中b(0,1)b \in (0,1)b(0,1)控制裁剪范围,λ[0,1]\lambda \in [0,1]λ[0,1]设置重塑强度。轮次kkk中的每个token继承A~k(i)\widetilde{A}_k^{(i)}Ak(i)

训练目标是标准PPO裁剪损失,但使用重塑后的优势:

LAgentOPSD(θ)=1Gi=1G1tMi,ttMi,tmin ⁣(ri,tA~κi(t)(i),  clip(ri,t,1ε,1+ε)A~κi(t)(i))+βLKL,\mathcal{L}_{\text{AgentOPSD}}(\theta) = -\frac{1}{G} \sum_{i=1}^{G} \frac{1}{\sum_t M_{i,t}} \sum_t M_{i,t} \min\!\Big(r_{i,t} \widetilde{A}_{\kappa_i(t)}^{(i)},\; \operatorname{clip}(r_{i,t}, 1-\varepsilon, 1+\varepsilon) \widetilde{A}_{\kappa_i(t)}^{(i)}\Big) + \beta \mathcal{L}_{\mathrm{KL}},LAgentOPSD(θ)=G1i=1GtMi,t1tMi,tmin(ri,tAκi(t)(i),clip(ri,t,1ε,1+ε)Aκi(t)(i))+βLKL,

其中ri,tr_{i,t}ri,t是对rollout策略的重要性比率,κi(t)\kappa_i(t)κi(t)将每个token映射到其轮次,Mi,tM_{i,t}Mi,t是有效响应token的掩码,KL惩罚项以系数β\betaβ添加。无需单独的蒸馏损失;自教师证据仅通过重塑优势影响学习。

实验

评估涵盖ALFWorld、Search-QA和WebShop环境,使用Qwen2.5-3B/7B模型,将AgentOPSD与无训练、组相对RL和自蒸馏基线进行比较,所有方法均在相同技能访问下进行。主要结果表明,增益源于通过信念修正构建的轮次级信用,而非特权技能,并且优势随着轨迹长度增长而增加,而均匀信用在长轨迹中退化更快。机制消融证实,轮次级信念跟踪、递归状态更新、带符号的结果对齐以及先验锚定各自都有贡献,超参数扫描表明该方法除信用重塑权重外具有鲁棒性。总体而言,该方法通过将师生差距累加到信念状态中,并根据信念修正分配信用,在长horizon任务中定位关键决策。

GRPO在ALFWorld、Search-QA和WebShop上取得了最佳整体性能,优于技能增强的Skill‑GRPO和vanilla基线。在推理时移除技能(OPSD)导致在Search‑QA和WebShop上崩溃,而信念先验锚点和重塑权重λ对于长horizon任务中的稳定信用分配至关重要。GRPO始终优于Skill‑GRPO,在ALFWorld上获得更高成功率,在Search‑QA上获得更高准确率,在WebShop上获得更高分数。在推理时没有技能,OPSD在Search‑QA和WebShop上失败,得分接近零,但保留了一些ALFWorld能力。经验先验B0至关重要:移除它使成功率降至78.9,表明锚定可稳定长horizon任务的信念修正。在超参数中,重塑权重λ影响最大;将λ从0.5降低会降低性能,而证据衰减和策略裁剪影响很小。

从AgentOPSD中移除任何单一组件都会使成功率从完整的89.1%下降,其中符号方向和状态先验锚点导致最大降幅。轮次级跟踪和递归状态修正提供较小但一致的增益,证实每个机制对方法性能的贡献。丢弃状态先验锚点使成功率降至78.9%,为最大降幅,表明其稳定早期信念更新的作用。移除符号方向而仅使用幅度使成功率降至80.5%,表明与结果对齐的符号至关重要。将轮次级信念跟踪替换为逐token累积使成功率降至85.9%,用原始局部差替换递归修正则降至82.8%。

GRPO始终优于Skill‑GRPO和vanilla基线,在ALFWorld、Search-QA和WebShop上均是如此,而在推理时移除技能(OPSD)导致在Search‑QA和WebShop上得分接近零,表明技能指导和信念先验锚点对于长horizon任务中稳定信用分配至关重要。经验B0锚点被证明至关重要:丢弃它使成功率降至78.9%,而重塑权重λ是最具影响力的超参数,从0.5降低会损害性能。对AgentOPSD的消融实验证实,状态先验锚点和与结果对齐的符号方向导致从完整的89.1%成功率中降幅最大,而轮次级跟踪和递归修正贡献较小但一致的增益,验证了每个机制的作用。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供