HyperAIHyperAI

Command Palette

Search for a command to run...

SEED:面向智能体强化学习的自进化在线策略蒸馏

摘要

大型语言模型越来越多地被训练为交互式智能体,用于涉及多轮交互、工具使用和环境反馈的长期任务。基于结果的强化学习提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策的指导有限,导致回合级结果与令牌级策略学习之间存在监督差距。我们提出SEED(自进化在线策略蒸馏),这是一个自进化框架,将完成的在线策略轨迹转化为训练时的后见技能,并将其行为效果蒸馏回策略模型。SEED首先微调策略,使其分析已完成的轨迹并生成自然语言技能,捕捉可复用的工作流程、决定性观察或避错规则。在强化学习过程中,当前策略既收集轨迹,又充当分析器从中提取后见技能。因此,策略更新同时改善后续决策和技能分析,使后见监督随策略共同进化。随后,SEED在普通和技能增强的上下文中对采样动作重新评分,将技能引起的概率偏移转化为密集的令牌级在线策略蒸馏信号。该信号与基于结果的强化学习联合优化,保持辅助监督与当前轨迹分布一致。在基于文本和基于视觉的智能体任务上的大量实验表明,SEED持续提升性能和样本效率,并展现出对未见场景的鲁棒泛化能力。

一句话总结

清华大学、浙江大学等提出 SEED(SElf-Evolving On-Policy Distillation,自进化同策略蒸馏),一个自进化框架,将已完成的同策略轨迹转化为自然语言的事后技能,并将其行为效应蒸馏为密集的 token 级监督信号,与基于结果的强化学习联合优化,从而弥合监督差距,显著提升智能体任务中的性能和样本效率。

核心贡献

  • SEED 是一个自进化的同策略蒸馏框架,将已完成的同策略轨迹转化为事后技能,并将其行为指导蒸馏回策略中,使决策和技能分析在智能体强化学习过程中共同进化。
  • 一种策略同步的事后同策略蒸馏机制,将技能引起的采样动作对数概率偏移转化为密集的 token 级监督,并将该信号与基于结果的 RL 联合优化。
  • 在具身交互、网页导航、基于搜索的问答以及视觉推理与规划基准上的实验表明,与代表性基线相比,任务性能、样本效率和鲁棒性均有一致提升。

引言

大语言模型 agent 越来越多地运行在多轮环境中,需要长时间地进行推理、行动、使用工具并融入环境反馈。强化学习已成为这些 agent 的关键后训练范式,因为它直接针对任务级结果优化策略。然而,基于结果的 RL 仅提供稀疏的轨迹级奖励:它只指示一个 episode 是否成功,却无法识别哪些中间决策、工具调用或观察是有效的。这就在粗粒度的 episode 结果与细粒度的 token 级策略学习之间留下了监督差距。先前的事后学习方法试图利用已完成的轨迹获得更丰富的反馈,但它们通常将事后信息视为静态经验、外部记忆或固定的推理时提示,无法随着策略的改进和遇到新状态与失败模式而自适应。

作者提出 SEED(SElf-Evolving On-Policy Distillation,自进化同策略蒸馏),一个将已完成的同策略轨迹转化为自然语言事后技能,并通过自进化训练循环将其行为指导蒸馏回策略的框架。在 RL 过程中,同一模型收集轨迹并对其进行分析,提取可重用工作流、决定性观察和避免失败规则。由于策略和分析器共享同一个检查点,决策和事后监督共同进化。SEED 随后利用提取的技能,在普通上下文和技能增强上下文下对采样动作重新评分,产生密集的 token 级同策略蒸馏信号,并与基于结果的 RL 目标联合优化。这使得策略能够内化可重用指导,无需外部记忆或额外的推理时提示。在具身交互、网页导航、基于搜索的问答和视觉推理上的评估显示,任务性能、样本效率和鲁棒性均有一致提升。

方法

作者提出 SEED,一个面向智能体强化学习的自进化同策略蒸馏(OPD)框架。SEED 的动机在于,已完成的 agent 轨迹包含丰富的事后信息。即使奖励稀疏,完整轨迹通常也能揭示出有用的行为模式、失败原因和可重用策略,而这些在中间决策步骤无法直接获得。SEED 将此类事后信息转化为事后技能,并将其行为效应蒸馏回普通策略。

如下图所示,SEED 包含两个主要训练阶段。首先,事后技能监督微调(SFT)使单一策略模型具备分析已完成轨迹的能力。其次,当前策略快照既收集同策略轨迹,又将其分析为事后技能。然后,在普通上下文和技能增强上下文下对相同的采样动作重新评分,构建 token 级 OPD 信号,并与 RL 联合优化。

问题形式化 作者将长时程智能体任务建模为部分可观察马尔可夫决策过程 (S,A,O,T,Ω,R,γ)(\mathcal{S}, \mathcal{A}, \mathcal{O}, \mathcal{T}, \Omega, \mathcal{R}, \gamma)(S,A,O,T,Ω,R,γ)。在时间步 ttt,agent 接收到观察 otOo_t \in \mathcal{O}otO 并维护交互历史 ht=(o0,a0,o1,a1,,ot)h_t = (o_0, a_0, o_1, a_1, \dots, o_t)ht=(o0,a0,o1,a1,,ot)。策略根据 atπθ(ht)a_t \sim \pi_\theta(\cdot \mid h_t)atπθ(ht) 生成下一个动作。一条完整轨迹记为 τ={(ot,at,rt)}t=0T1\tau = \{(o_t, a_t, r_t)\}_{t=0}^{T-1}τ={(ot,at,rt)}t=0T1,并有一个 episode 级结果 R(τ)RR(\tau) \in \mathbb{R}R(τ)R。在许多智能体环境中,R(τ)R(\tau)R(τ) 是稀疏的,仅在任务完成后才可获得。标准强化学习目标为 J(θ)=Eτπθ[R(τ)]J(\theta) = \mathbb{E}_{\tau \sim \pi_\theta}[R(\tau)]J(θ)=Eτπθ[R(τ)]。SEED 通过从轨迹完成后提取的事后技能中导出辅助的训练时 token 级信号,弥合轨迹级反馈与 token 级决策之间的粒度差距。

事后技能监督微调 第一阶段赋予策略分析完整交互历史并将可重用行为指导表达为自然语言事后技能的能力。作者首先使用不含技能增强的基础策略收集离线轨迹池。对于一组训练任务 Qsft={qj}j=1M\mathcal{Q}_{\text{sft}} = \{q_j\}_{j=1}^MQsft={qj}j=1M,用基础策略 πθbase\pi_{\theta_{\text{base}}}πθbase 执行 K0K_0K0 次 rollout,形成离线轨迹池 B\mathcal{B}B。每条轨迹包含任务描述、观察、动作、奖励和最终结果,收集时决策上下文中不含任何事后技能。

给定一条已完成轨迹 τ\tauτ,外部分析器 AextA_{\text{ext}}Aext 产生事后技能标注 sτ=Aext(τ)s_\tau = A_{\text{ext}}(\tau)sτ=Aext(τ)。对于成功轨迹,sτs_\tausτ 捕捉可重用策略或工作流;对于失败轨迹,它编码纠正或避免的指导。仅当标注格式正确时才保留,形成可接受的 SFT 集 Dsft\mathcal{D}_{\text{sft}}Dsft。然后使用标准负对数似然目标对策略模型进行微调,以从已完成轨迹预测事后技能: Lsft(θ)=E(xτ,sτ)Dsft[=1sτlogπθ(sτ,xτ,sτ,<)]\mathcal{L}_{\text{sft}}(\theta) = - \mathbb{E}_{(x_\tau, s_\tau) \sim \mathcal{D}_{\text{sft}}} \left[ \sum_{\ell=1}^{|s_\tau|} \log \pi_\theta(s_{\tau, \ell} \mid x_\tau, s_{\tau, < \ell}) \right]Lsft(θ)=E(xτ,sτ)Dsft[=1sτlogπθ(sτ,xτ,sτ,<)] 得到的检查点 θsft\theta_{\text{sft}}θsft 初始化后续的 RL 策略。在 RL 过程中,轨迹分析器直接从当前策略检查点实例化,使得同一模型既能在环境中行动,又能生成事后技能,无需单独训练的分析器。

自进化同策略蒸馏 第二阶段进行智能体 RL,并加入额外的 token 级 OPD 信号。在每次更新开始时,SEED 将当前策略冻结为 πθold\pi_{\theta_{\text{old}}}πθold。该快照收集轨迹,并参数化提取其事后技能的分析器。一个可训练策略 πθ\pi_\thetaπθπθold\pi_{\theta_{\text{old}}}πθold 初始化,然后同时使用环境驱动的 RL 和 OPD 目标进行优化。

对于每个任务提示 qqq,SEED 使用冻结策略采样一组 NNN 条轨迹:Gq={τq(1),τq(2),,τq(N)}\mathcal{G}_q = \{\tau_q^{(1)}, \tau_q^{(2)}, \dots, \tau_q^{(N)}\}Gq={τq(1),τq(2),,τq(N)}。从同一策略快照 πθold\pi_{\theta_{\text{old}}}πθold 实例化的分析器 agent 分析每条已完成轨迹,并生成事后技能 sq(n)=Aθold(xτq(n))s_q^{(n)} = A_{\theta_{\text{old}}}(x_{\tau_q^{(n)}})sq(n)=Aθold(xτq(n))。这种共享参数化形成了自进化循环,刷新 θold\theta_{\text{old}}θold 会同时改变 actor 遇到的轨迹和用于技能分析的模型能力。

为构建蒸馏目标,SEED 保持原始同策略动作不变,并在技能增强上下文下对其重新评分。设 HHH 为确定性上下文增强函数。在轨迹 τq(n)\tau_q^{(n)}τq(n) 的时间步 ttt,技能增强历史为 h~q,n,t=H(hq,n,t,sq(n))\tilde{h}_{q,n,t} = H(h_{q,n,t}, s_q^{(n)})h~q,n,t=H(hq,n,t,sq(n))。同一策略在相同的采样动作 token 上计算两个 token 级对数概率。技能条件的教师分支对数概率通过技能增强历史对采样动作重新评分获得: q,n,t,skill=logπθ(aq,n,t,h~q,n,t,aq,n,t,<)\ell_{q,n,t,\ell}^{\text{skill}} = \log \pi_\theta(a_{q,n,t,\ell} \mid \tilde{h}_{q,n,t}, a_{q,n,t,<\ell})q,n,t,skill=logπθ(aq,n,t,h~q,n,t,aq,n,t,<) 普通学生分支在原始交互历史下的对数概率为: q,n,t,θ=logπθ(aq,n,t,hq,n,t,aq,n,t,<)\ell_{q,n,t,\ell}^{\theta} = \log \pi_\theta(a_{q,n,t,\ell} \mid h_{q,n,t}, a_{q,n,t,<\ell})q,n,t,θ=logπθ(aq,n,t,hq,n,t,aq,n,t,<) 作者定义去梯度后的技能引起的对数概率偏移 Δq,n,t,=sg[q,n,t,skillq,n,t,θ]\Delta_{q,n,t,\ell} = \text{sg}[\ell_{q,n,t,\ell}^{\text{skill}} - \ell_{q,n,t,\ell}^{\theta}]Δq,n,t,=sg[q,n,t,skillq,n,t,θ],其中 sg[]\text{sg}[\cdot]sg[] 表示停止梯度。该偏移被映射为置信门 gq,n,t,=σ(βopdΔq,n,t,)g_{q,n,t,\ell} = \sigma(\beta_{\text{opd}} \Delta_{q,n,t,\ell})gq,n,t,=σ(βopdΔq,n,t,)。OPD 损失定义为置信门控的采样 token 蒸馏目标: Lopd(θ)=Eq,n,t,[mq,n,t,gq,n,t,(sg[q,n,t,skill]q,n,t,θ)]\mathcal{L}_{\text{opd}}(\theta) = \mathbb{E}_{q,n,t,\ell} \left[ m_{q,n,t,\ell} \cdot g_{q,n,t,\ell} \cdot (\text{sg}[\ell_{q,n,t,\ell}^{\text{skill}}] - \ell_{q,n,t,\ell}^{\theta}) \right]Lopd(θ)=Eq,n,t,[mq,n,t,gq,n,t,(sg[q,n,t,skill]q,n,t,θ)] 由于门控和教师对数概率均被去梯度,最小化该目标会提高普通策略对教师认可的 on-policy token 的似然,从而内化技能的行为效应。

除了 OPD,SEED 还使用组相对 RL 目标优化策略。对于每个组 Gq\mathcal{G}_qGq,轨迹级组相对优势计算为 Aq,nrl=(R(τq(n))μq)/(σq+ϵ)A_{q,n}^{\text{rl}} = (R(\tau_q^{(n)}) - \mu_q) / (\sigma_q + \epsilon)Aq,nrl=(R(τq(n))μq)/(σq+ϵ)。最终训练目标结合环境驱动的智能体 RL 与事后技能 OPD: LSEED(θ)=Lrl(θ)+λopdLopd(θ)\mathcal{L}_{\text{SEED}}(\theta) = \mathcal{L}_{\text{rl}}(\theta) + \lambda_{\text{opd}} \mathcal{L}_{\text{opd}}(\theta)LSEED(θ)=Lrl(θ)+λopdLopd(θ) 更新后的策略随即成为下一次迭代的 πθold\pi_{\theta_{\text{old}}}πθold,闭合自进化循环。在推理时,部署的 agent 仅从普通交互历史中行动 atπθ(ht)a_t \sim \pi_\theta(\cdot \mid h_t)atπθ(ht)。所有事后技能仅用作训练时指导,意味着部署时无需分析器、无需技能库、无需检索模块,也无需增强决策提示。

实验

SEED 在三个长时程智能体基准——ALFWorld、WebShop 和基于搜索的问答——上进行了评估,涵盖具身控制、网页导航和工具增强问答。与仅使用结果的 RL 和静态蒸馏基线相比,SEED 来自自进化轨迹分析器的密集 token 级事后监督在所有领域均带来一致提升。实验表明,通过蒸馏内化技能比将其作为提示提供更有效,该方法加速收敛并减少无效探索,同时实现了更高的样本效率和对未见环境的泛化。消融实验证实,每个组件——事后技能 SFT、自进化同策略蒸馏和同策略技能提取——都至关重要,其中同策略技能最为重要。

SEED 通过提供密集 token 级事后监督,相比仅使用结果的强化学习有显著提升,在 ALFWorld、基于搜索的问答和 WebShop 上均获得一致增益。将技能内化到策略中比在评估时作为提示提供带来更好的性能,且从策略自身轨迹中自进化蒸馏优于静态蒸馏方法。SEED 在所有三个长时程基准上均优于 GRPO 和 Skill-GRPO,在 ALFWorld 和 WebShop 上的优势尤为明显。自进化事后蒸馏能够适应策略行为的变化,比使用固定技能库更有效。

在 ALFWorld 上的消融实验表明,SEED 的三个核心组件对其强劲的平均性能都不可或缺。最大的性能下降来自将同策略技能蒸馏替换为静态离线库,平均下降超过 7 个百分点。移除事后技能 SFT 或自进化 OPD 也会导致约 5–6 个百分点的显著下降,证实初始轨迹分析和来自进化策略的持续蒸馏都至关重要。用静态离线库替代同策略技能导致最大性能下降,平均值从 91.8 降至 84.4。移除事后技能 SFT 使平均值下降 5.8 个百分点,表明初始轨迹分析能力为自进化提供了重要基础。

评估使用三个长时程基准——ALFWorld、基于搜索的问答和 WebShop——验证 SEED 的密集 token 级事后监督和自进化技能蒸馏。将技能内化到策略中优于作为提示使用,且从策略自身轨迹中自进化蒸馏优于静态方法。消融研究确认,三个核心组件(同策略技能蒸馏、事后技能 SFT 和自进化 OPD)都必不可少,其中用静态库替代同策略技能导致的下降最大。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供