HyperAIHyperAI

Command Palette

Search for a command to run...

3 小时前
LLM
模型训练

Skill Self-Play:以协同进化技能推动大语言模型能力前沿

摘要

大语言模型的训练正从人工设计与标注转向交互驱动的自我进化。然而,现有的自我进化方法在任务多样性与验证可靠性之间面临根本性困境:环境绑定的方法能获得精确反馈,但将学习限制在狭窄领域;开放式自我生成拓宽了任务空间,却缺乏可靠验证,导致误导性奖励污染训练循环。我们发现,智能体技能是调和这一张力的有力中间地带:每项技能确保在特定场景中可被深度、可验证地执行,而跨技能的动态路由则保持了开放式的任务多样性。基于这一洞察,我们提出了 Skill Self-Play(Skill-SP),一个由提议者、求解器和动态技能控制器组成的协同进化框架。这些组件通过强化学习循环编排,在持续的自博弈循环中协同进化:提议者以动态采样的技能为条件生成具有挑战性的任务;求解器探索候选解决方案以突破其能力边界;技能控制器收集执行反馈以更新和扩展技能库。这种交互式协同进化有效弥合了结构化验证与开放式探索之间的鸿沟。在工具使用和推理基准上的实证评估表明,Skill-SP 作为一个稳健的进化引擎,能够持续推高已有能力基座模型的性能上限,同时促使初始对齐不佳的模型实现显著逆转。

一句话总结

阿里巴巴与合作方的研究人员提出Skill Self-Play (Skill-SP),一种利用agent技能平衡有界环境反馈与开放式生成的共进化框架,使提议者、求解器和技能控制器通过强化学习共同进化,从而连接结构化验证与探索,并持续提升LLM在工具使用和推理基准测试上的表现。

核心贡献

  • Skill Self-Play (Skill-SP)框架在强化学习循环中共同进化提议者、求解器和动态技能控制器,控制器不断更新可重用技能库,以条件化任务生成并提供可验证的执行边界。
  • 该框架将不断进化的技能库视为主动的训练时接口,利用技能条件化生成引导提议者朝向求解器学习前沿的高保真课程,同时保持任务多样性和严格验证。
  • 在工具使用基准(API-Bank、BFCL)和逻辑推理(ZebraLogic)上的实证评估表明,Skill-SP在工具任务上可获得高达+42.9分的绝对提升,在推理任务上高达+12.0分,始终优于无引导自博弈,并使初始偏差模型实现性能扭转。

引言

自博弈方法让大型语言模型通过生成任务并借助多agent强化学习进行学习,从而自主提升推理、搜索和工具使用能力。然而,以往的工作要么将训练限制在狭窄的、外部验证的环境中,要么依赖无引导的任务生成和被动过滤,这容易遭遇不适定任务、模板过拟合和迭代过程中合成数据崩溃的问题。作者提出了Skill Self-Play (Skill-SP),该框架演化一个模块化技能包库,以主动引导任务生成、执行严格验证并控制课程难度。这一设计弥合了僵化的环境绑定博弈与混沌开放式生成之间的鸿沟,在不牺牲验证可靠性的前提下实现了持续自我提升。在工具调用和逻辑推理基准上的评估表明,Skill-SP大幅优于无引导自博弈,展示了共进化技能如何将模型训练锚定在学习前沿,并为无界 LLM 自我进化开辟了结构化路径。

方法

作者提出了Skill Self-Play (Skill-SP),一种训练时框架,将通用的自博弈转化为主动的课程构建过程。在每次迭代中,Skill-SP协调提议者策略 πpropose\pi_{\mathrm{propose}}πpropose 和求解器策略 πsolve\pi_{\mathrm{solve}}πsolve 的联合优化,以及一个管理进化技能库 S\mathcal{S}S 的技能控制器。

参考框架图:

该框架将可验证的agent任务形式化为一个元组 (x,c)(x, c)(x,c),其中 xxx 是标准提示,ccc 是隐藏的验证契约。为了驱动持续改进,提议者瞄准求解器学习前沿。然而,为了防止提议者合成不适定契约导致的奖励欺骗,作者引入了一种门控课程奖励。它包含一个二值任务质量过滤器,仅保留结构健全的候选契约:

Rpropose(x,c;πsolve)=1{(x,c) is valid}(12νsolve(x,c;πsolve)12)\mathcal{R}_{\text{propose}}(\boldsymbol{x}, \boldsymbol{c}; \pi_{\text{solve}}) = \mathbb{1}_{\{(\boldsymbol{x}, \boldsymbol{c}) \text{ is valid}\}} \cdot \left(1 - 2 \left| \nu_{\text{solve}}(\boldsymbol{x}, \boldsymbol{c}; \pi_{\text{solve}}) - \frac{1}{2} \right| \right)Rpropose(x,c;πsolve)=1{(x,c) is valid}(12νsolve(x,c;πsolve)21)

其中 νsolve\nu_{\text{solve}}νsolve 是求解器的预期成功率。Skill-SP 被形式化为一个双层优化问题,外层目标联合优化技能库和提议者,内层目标则要求求解器最大化执行成功率。

为实现外层目标,提议者通过技能条件化生成合成有效且瞄准前沿的任务。技能 sSs \in \mathcal{S}sS 作为结构性接口,提供流程规则、生成提示和可执行验证器。提议者根据历史使用统计动态采样技能,平衡利用与探索。同时,一个无技能约束的开放式探索流作为补充,以防止模式坍塌。生成的候选任务经过严格的合法性验证,确保模式合规、契约有效且探针一致。然后,通过组相对策略优化(GRPO)更新提议者策略,以最大化期望门控奖励。

对于内层目标,求解器在动态课程上进行优化。作者通过从技能流和探索流中挑选最具挑战性的任务构建高质量训练池。候选任务按提议者奖励排序,以定位求解器学习前沿,并根据混合比例 α\alphaα 选择得分最高的任务。随后,求解器策略通过 GRPO 更新,以最大化在该构建课程上的环境验证奖励。

为防止课程停滞,技能库与策略动态共进化。该进化包括三个操作。第一,技能精炼更新跟踪统计信息并分析无效尝试的执行轨迹,以自动优化核心技能内容。第二,技能修剪识别并归档那些一贯产生琐碎任务的饱和技能,从而节省生成预算。第三,技能归纳从探索流中提取满足最低前沿奖励阈值的新候选。技能控制器从这些候选中抽象出潜在的任务模式,将其转化为新技能,并根据现有库进行结构完整性和语义新颖性过滤。活跃技能库通过移除被修剪的技能并添加新归纳的技能进行更新,将训练反馈蒸馏为可复用的结构化先验,用于后续任务生成。

实验

在工具使用和逻辑推理基准测试中,Skill-SP在所有测试基座上相对于基模型和无引导自博弈均持续提升,尤其挽救了初始偏差的模型,这些模型在朴素自博弈下停滞不前。消融研究验证了主动技能编排、混合开放式探索和自适应路由对于泛化和避免模式坍塌至关重要。诊断结果进一步表明,该框架通过动态进化的技能库构建了一个多样化、瞄准前沿的课程,技能库稳步扩展活跃和有效技能,防止生成器依赖少数主导模式。

Skill-SP在所有难度级别和编程语言上均持续提升工具调用性能,整体增益大于无引导自博弈。对于 Qwen3-8B,无引导自博弈在 BFCL Live 上引入了小幅回归,而 Skill-SP 在所示两个模型的每个子任务上都提供了严格的正增益。Skill-SP 将 Qwen3-4B-Instruct 的整体平均分提高了 6.5 分,将 Qwen3-8B 的整体平均分提高了 2.8 分,增益大致是无引导自博弈的两倍。无引导自博弈导致 Qwen3-8B 在 BFCL Live 上性能下降(‑0.1),而 Skill-SP 将其提高了 0.8 分,并提升了其他所有指标,没有出现任何负面变化。

Skill-SP 在 ZebraLogic 基准测试上提升了所有五款测试模型的逻辑推理准确率。对于初始较弱的模型,在中、小规模谜题上增益最大,网格级准确率从接近零提升到有意义的水平,而较强的模型则实现稳定但较小的改进。在搜索空间极大的极端谜题规模上,即使是 Skill-SP,弱基座模型也几乎没有任何进展。所有骨干模型的整体网格级准确率均有所上升,绝对增益从强模型的约 1.4 分到较弱模型的超过 8 分不等。在小规模谜题上,Skill-SP 为逻辑偏误模型带来了超过 35 分的增益,而强模型准确率已超过 97%。单元格级准确率普遍受益,从极低基线开始的模型改进幅度最高可达 20 分。在 Large 和 X-Large 谜题规模上,基座性能接近零的模型即使在 Skill-SP 之后仍接近零,这表明极端搜索空间存在一个启动阈值。

消融实验表明,完全移除技能编排(无引导自博弈)会导致最大的性能倒退,而用统一路由或冻结技能等静态策略替代动态课程分配也会持续降低结果。这些发现证实,性能增益依赖于自适应课程和持续进化的库,而不仅仅是固定结构约束的存在。无引导自博弈的整体准确率降幅最大,表明结构引导对于防止早期训练高原至关重要。统一路由和冻结技能变体均不及完整系统,表明静态技能分配和非进化库无法与动态编排相媲美。

冻结任务提议者会导致整体性能显著下降,而冻结反馈求解器则带来更大的降幅。完全禁用两个更新则产生最严重的退化,证明两个策略的持续协同适应对于有效课程生成至关重要。冻结提议者使整体准确率下降 2.1 分,表明生成器必须适应不断进化的技能库。冻结反馈求解器导致整体下降 3.0 分,突显了过时的难度信号会严重削弱提议者的训练。冻结两个组件导致了 3.2 分的最大降幅,证明相互共进化对于主动课程设计的必要性。

评估在多个模型上比较了 Skill-SP 与无引导自博弈在工具调用(BFCL)和逻辑推理(ZebraLogic)基准上的表现。Skill-SP 一贯优于无引导自博弈,在工具调用上提供严格正增益,并显著提高推理准确率,尤其是对较弱模型在小规模谜题上的提升。消融研究确认,自适应技能编排和持续库进化至关重要,静态分配或冻结技能会导致严重退化。此外,任务提议者和反馈求解器的协同适应十分关键,禁用任一组件都会导致显著的性能下降,凸显动态课程生成驱动了该方法的有效性。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供