Command Palette
Search for a command to run...
基于强化学习的渐进式智能体技能生成方法
基于强化学习的渐进式智能体技能生成方法
Junhao Shen Zhanqiu Zhang Yiwen Guo Hong Cheng
摘要
近期的大语言模型智能体常将外部技能作为模块化的过程单元,用以调节推理并提升复杂任务的求解能力。因此,从文档或经验中自动生成高质量技能已成为一个重要问题。现有的技能生成方法大多依赖启发式规则或流水线式的整合策略,需要针对不同证据来源进行专门设计。相比之下,基于学习的方法为跨异构来源的技能生成建模提供了更统一的途径。然而,基于学习的技能生成仍面临挑战,因为技能缺乏基于相关性或正确性的自然监督信号;其价值在很大程度上只能通过它们是否改善智能体在下游任务上的行为来确定。为应对这一挑战,我们提出 Skill-α,一种用于渐进式生成高质量智能体技能的强化学习方法。具体而言,我们将技能生成形式化为一个序列化编辑过程,将技能构建分解为可单独评估的编辑操作,并引入一种新颖的回滚奖励机制,通过比较在锚定查询上使用原始技能与编辑后技能的下游执行效果来评估每次编辑。大量实验表明,在文档到技能和经验到技能两种设定下,Skill-α 生成的技能均比基于启发式或流水线的方法更有效。在以 GPT-4o 作为主执行器的条件下,Skill-α 在 CL-Bench 上将平均下游成功率相较于最强技能生成基线提升了 3.3 个百分点,在 tau2-bench 上提升了 6.7 个百分点。进一步的消融实验验证了回滚奖励和渐进式生成的重要性。
一句话总结
香港中文大学和LIGHTSPEED的研究者提出Skill-α,一种强化学习方法,将技能生成建模为一个带有新颖回滚奖励的序列化编辑过程。该回滚奖励通过在锚定查询上对比原始技能与编辑后技能的下游执行效果,对每次编辑进行评价,在CL-Bench和tau2-bench上显著优于启发式和流水线基线方法。
核心贡献
- Skill-α将技能生成建模为一种渐进式序列编辑过程,把技能构建分解为可单独评估的编辑操作,并作用于同一个持续演化的技能产物。
- 该方法引入回滚奖励,通过对比在锚定查询上原始技能与编辑后技能的下游agent执行情况,对每次编辑进行评价,从而提供基于执行过程的训练信号。
- 在CL-Bench、SpreadsheetBench和tau2-bench上的实验表明,Skill-α在文档到技能和经验到技能两种设定下,均能产出比启发式和流水线基线更有效的技能,平均成功率最高提升6.7个百分点,消融实验证实了回滚奖励和渐进式生成的重要性。
引言
处理复杂任务的大语言模型agent通常依赖外部技能来约束其推理、工具使用和规划。从文档或执行经验中自动生成这些技能对可扩展部署至关重要。先前的方法依赖启发式策略或针对不同证据类型设计分离的流水线,缺乏来自下游性能的学习信号,限制了证据改善技能的方式。研究者引入Skill-α,一个将文档到技能和经验到技能生成统一为渐进式局部编辑序列的强化学习框架。通过引入回滚奖励,隔离每次编辑在固定锚定查询上的效果,Skill-α学会了基于执行反馈添加、修订、合并或移除内容,从而生成比基于流水线的基线更有效的技能。
方法
研究者提出Skill-α,一个专为渐进式技能生成设计的可训练框架。其核心目标是学会如何从源证据中构建技能,使固定的worker agent在预留的目标查询上改善行为。由于无法获得理想的教师行为分布,该框架通过间接奖励信号和局部编辑决策来近似这一目标。
如下图所示,该框架分为推断和训练两个阶段。在推断阶段,模型顺序读取证据并应用一系列局部编辑动作,从初始状态渐进式生成最终技能。在训练阶段,技能生成器采样一组候选动作,构建对应的编辑后技能,并借助基准专用的验证器与控制基线进行对比,计算回滚奖励以用于GRPO更新。
为了克服一次性技能生成的局限性,比如上下文窗口溢出和信用分配困难,研究者将过程分解为渐进式局部编辑。生成器从初始技能状态z0开始,顺序读取证据单元xt并逐步更新技能。在每一步t,基于当前技能状态zt−1和证据xt采样出一个局部编辑动作At,并应用它得到下一状态zt=Edit(zt−1,At)。该表述将文档到技能和经验到技能的设定统一为同一个局部决策问题。
编辑动作空间定义为A={CREATE, UPDATE, MERGE, PRUNE, NOOP},允许模型添加、修正、合并、移除或保留技能内容。为给这些局部决策提供监督信号,研究者引入了回滚奖励机制。直接依据下游任务表现奖励某次编辑是不够的,因为成功可能源于worker的固有能力或查询的简单性。相反,回滚奖励通过在证据相关的锚定查询qtanc上对比worker在原始技能和编辑后技能下的表现来分配信用。固定的worker πψ生成控制动作和编辑动作atctrl∼πψ(⋅∣qtanc,zt−1)和atedit∼πψ(⋅∣qtanc,zt),这些动作由验证器Vt评估,得到标量反馈rtctrl和rtedit。
在训练阶段,研究者使用指令微调的Qwen3-8B模型初始化技能编辑策略πϕ。训练流程包括监督微调预热阶段和随后的强化学习。在预热阶段,策略在合成编辑轨迹上进行训练,学习动作语法和基于证据的编辑行为。随后,使用分组相对策略优化(GRPO)对策略进行优化,而worker agent固定为GPT-4o。对于给定的局部编辑状态,旧策略采样一组G个候选动作。为每个候选计算回滚奖励,并用于计算组内相对优势Ai。然后使用截断的GRPO目标来优化策略:
JGRPO(ϕ)=E[G1i=1∑G(min(ρi(ϕ)Ai,clip(ρi(ϕ),1−ϵ,1+ϵ)Ai)−βDKL(πϕ∥πref))]其中ρi(ϕ)是新旧策略的概率比值。这种设计使得奖励分配与渐进式生成紧密对齐,在局部编辑状态上训练策略,而不是直接优化整个生成轨迹。
实验
Skill-α在文档到技能和经验到技能两种设定下,在同一worker和跨worker迁移场景中均进行了评估,一致优于先前方法,因为它生成的是可复用、可迁移的技能,而非仅仅上下文压缩或轨迹记忆。消融实验表明,使用回滚奖励和结构化的编辑操作(如技能合并与剪枝)进行训练对于构建鲁棒的技能至关重要,而仅基于提示或仅使用SFT的方法会带来不稳定且减弱的增益。进一步分析显示,该框架对证据顺序具有较强的鲁棒性,但适中的证据批量大小能带来益处,这个大小需在模式抽象和局部编辑专注之间取得平衡。总体而言,Skill-α能够在不同证据来源和下游worker之间泛化,捕捉到真正的任务解决知识,而非worker特定的捷径。
Skill-α将文档压缩为可复用的技能,在留出的CL-Bench任务上提高了性能。在GPT-4o下,它在程序化任务执行上有大幅提升,在推理类别上达到最佳或接近最佳得分,在规则系统应用上接近无技能基线。迁移到Claude-Sonnet-4.5后,Skill-α在全部四个类别中领先,并录得最高平均分,展现出鲁棒的跨骨干技能复用能力。在GPT-4o下,Skill-α将程序化任务执行通过率从4.30(无技能)提升至9.68,远超次优基线(Anthropic Skill-Creator的5.38)。在领域知识推理和经验发现方面,Skill-α在GPT-4o下为最佳或接近最佳,而在规则系统应用上则接近无技能基线21.82。在Claude-Sonnet-4.5骨干下,Skill-α在所有四个CL-Bench类别中均为最佳或并列最佳,并取得最高的总体平均分。
Skill-α在经验到技能的设定下带来巨大且一致的提升,在SpreadsheetBench和tau2-bench上均优于基于提示和先前基于经验的方法。在GPT-4o下,它将航空任务通过率从40%提升至65%,SpreadsheetBench从18%提升至28%,而学到的技能能够有效迁移到Claude-Sonnet-4.5,在此骨干下Skill-α在大多数任务上仍保持最佳或并列最佳。仅用提示的基线表现出剧烈的不稳定性,凸显了对训练有素的技能编辑策略的需求。Skill-α使GPT-4o的航空任务性能提升25个百分点,SpreadsheetBench相比无技能基线提高近10个百分点。它在所有已报道方法中取得了最高的GPT-4o tau2-bench平均分(55.83)。技能可跨worker迁移:使用GPT-4o生成的技能,Claude-Sonnet-4.5配合Skill-α在SpreadsheetBench、航空、电信以及总tau2-bench平均分上均领先。基于提示的基线十分脆弱:Anthropic Skill-Creator在电信任务上降至7.50,低于无技能基线12.50;Progressive Prompt Skill在Claude-Sonnet-4.5下的SpreadsheetBench上跌至无技能基线以下。Skill-α在任务和骨干模型之间展现的稳定增益,与迭代式提示方法形成对比,表明训练技能编辑策略至关重要。
完整的Skill-α模型在所有基准上均取得最高的通过率,显著超越仅SFT的基线。移除回滚奖励后性能跌至接近仅SFT的水平,可见它是学习有效编辑的关键信号。排除MERGE/PRUNE导致tau2-bench大幅下降,说明技能合并与删除是必要的;而去除NOOP仍可获得较强但一致降低的结果,表明放弃编辑的能力有用但非必要。完整Skill-α在每个基准上均大幅超越仅SFT基线。没有回滚奖励时,通过率跌至仅SFT基线附近,揭示它是关键的奖励信号。消融MERGE/PRUNE在tau2-bench上造成显著下降,证实显式的技能合并与删除可防止冗余。去除NOOP仍留下一个相对较强的模型,但完整模型始终更优,表明经过校准的放弃编辑能减少不必要的修改。
证据顺序对通过率仅有轻微影响,打乱顺序略微降低了tau2-bench的性能,而逆序的表现则与源顺序类似。相比之下,证据批量大小对下游质量有很强的控制作用:每步单元过少会导致短视的过拟合,过多则会加重编辑器的负担,而适中的批量大小4能在抽象和局部控制之间达到最佳平衡。打乱的证据顺序将tau2-bench通过率从55.8%(源顺序)降至51.7%,而逆序的57.5%依然可比,表明具有鲁棒性,并伴有局部连续性的小幅益处。每步仅使用1个证据单元时,tau2-bench通过率跌至47.5%,远低于最佳4单元设定,因为编辑器变得短视并使技能碎片化。
Skill-α将文档压缩为可复用技能,并在CL-Bench、SpreadsheetBench和tau2-bench任务上评估。它在GPT-4o和Claude-Sonnet-4.5上均带来一致的性能增益,展示出鲁棒的跨骨干技能迁移能力,同时远胜过时常表现不稳定的基于提示的基线。消融实验揭示,回滚奖励信号对学习有效编辑至关重要,而显式的技能合并与删除可防止冗余。该方法很大程度上不受证据顺序的影响,而适中的证据批量大小能在抽象和局部控制间达到最佳平衡,这凸显了对训练有素的技能编辑策略的需求。