Command Palette
Search for a command to run...
SFT 冲突,RL 共存:大语言模型多任务学习范式的理论与实证分析
SFT 冲突,RL 共存:大语言模型多任务学习范式的理论与实证分析
Kejian Zhu Zhuoran Jin Shangqing Tu Hongbang Yuan Yushi Bai Kang Liu Juanzi Li Jun Zhao
摘要
监督微调(SFT)与强化学习(RL)在增强大语言模型(LLM)的多任务推理能力时,表现出根本性的行为差异。我们的初步实验揭示了一个现象:SFT 在多阶段训练下会遭遇严重的任务冲突,而 RL 则能使不同任务稳定共存。在实证层面,我们将此现象追溯至参数层面,观察到 RL 在不同任务上产生的更新是稀疏且近似正交的。我们通过分析多任务梯度干扰,为这一机制提供了理论解释。我们的结果揭示了一种区别:SFT 中的干扰受限于范数,与梯度绝对大小成比例;而 RL 中的干扰受限于方差,其界限由优势归一化和在策略优化所引发的梯度方差决定。这一较小的方差界限使得不同任务间的优化方向近乎正交。基于此洞见,我们提出了 Parallel-RL,一种解耦多任务训练的范式,显著提升了效率与灵活性。
一句话总结
作者提出了Parallel-RL,这是一种针对大语言模型的多任务训练范式,利用强化学习因方差限制的干扰而产生稀疏、近似正交的梯度更新,与监督微调中受范数限制的冲突形成对比,从而解耦任务,提高效率和灵活性。
核心贡献
- 多阶段监督微调(SFT)导致各任务性能严重下降(平均比基础模型低23.1%),而多阶段强化学习(RL)则取得稳定、累积的提升(平均增益24.9%),表明RL在多任务场景下具有共存特性。
- 梯度干扰分析揭示了不同机制:SFT干扰受范数限制,且与绝对梯度大小成正比;RL干扰受方差限制,由优势归一化和在线策略优化得到的低梯度方差所约束,产生稀疏、近似正交的更新,从而避免任务冲突。
- 提出Parallel-RL范式,基于近似正交的RL更新独立训练各任务来解耦多任务训练。实验表明,它能匹配单任务性能,提高训练效率,消融研究证实了任务特定能力的有效解耦。
引言
通过监督微调(SFT)和强化学习(RL)提升大语言模型的推理能力,是追求稳健多任务能力的核心,但先前工作大多在单任务设置中研究这些方法,其多任务行为未被充分探索。现有实践通常对SFT采用混合数据训练以避免遗忘,而RL常采用多阶段、逐任务的方式;这种差异的原因及其影响尚未被系统理解。作者通过经验与理论相结合的分析填补这一空白,揭示多阶段SFT因参数更新冲突而导致严重性能崩溃,而RL产生近乎正交的更新,能够共存并实现跨任务的稳定累积增益。基于RL的梯度干扰受方差限制而非范数限制这一发现,他们引入Parallel-RL范式,独立训练任务并合并更新,实现高效强健的多任务性能。
方法
作者首先为所提方法建立理论基础,分析监督微调(SFT)和强化学习(RL)不同的参数更新行为。他们证明RL更新在不同任务间表现出稀疏性、小幅值和近似正交性。这种正交性源于类似GRPO等RL算法中的两个关键机制。第一,优势函数起到滤波器作用,去除稠密平均梯度方向,仅留下组内残差。第二,RL的在线策略特性确保这些残差保持最小。因此,SFT中的梯度干扰受范数限制且易发生稠密冲突,而RL干扰严格受组内采样多样性的方差限制。
为验证此几何特性,作者分析了训练过程中采样的得分函数分布。
如上图所示,RL得分函数在不同任务上形成明显可分离的群簇,表明RL更新占据近似正交的子空间。相比之下,SFT分布大量重叠,证实SFT遭受稠密冲突的更新,而RL自然地解耦任务优化。
受此启发,作者提出Parallel-RL,一种利用RL更新正交特性的解耦后训练范式。在该框架下,一组不同的推理任务独立优化。形式上,给定任务集合 T={T1,…,TN},作者启动 N 个并行的RL训练进程。每个进程 i 产生特定任务的参数更新 ΔWi。最终模型参数 Wfinal 通过合并这些独立更新得到:
Wfinal=Wbase+M(ΔW1,…,ΔWN)其中 M 表示合并函数,如线性平均或奇异值分解。此方法允许不同任务更新在单个模型内和谐共存,避免了多任务SFT中常见的干扰。
实验
本研究在数学、科学、代码和逻辑任务上,对Qwen模型比较了SFT与RL(GRPO)。多阶段SFT导致灾难性遗忘,而RL因其更新稀疏、微小且跨任务近乎正交,从而避免干扰,支持稳定增长。这种天然的解耦特性使Parallel-RL成为可能:任务特定的RL更新可以合并,冲突极小,轻量适应后甚至超越单任务性能。
在多任务训练中,监督微调期间混合数据能带来小幅提升,但按顺序逐个训练任务则导致严重的性能崩溃,尤其是在逻辑任务上。相反,强化学习在混合数据和顺序策略下均受益,且顺序多阶段方法带来最大增益,尤其在科学和逻辑任务上。多阶段监督微调造成灾难性遗忘,逻辑准确率暴跌远低于基础模型,而混合数据微调避免了崩溃。强化学习在所有策略下都表现出稳健性:多阶段训练在每个任务上均取得最高准确率,科学和逻辑提升尤为显著。混合数据强化学习改善了所有任务,但被多阶段方案超越,后者展现出累积增长而非干扰。
单任务训练后,监督微调(SFT)改进了目标任务,但导致其他任务明显衰退,而强化学习(RL)不仅更大幅度地提升目标任务,还在所有其他评估任务上带来小幅且一致的增益。单任务SFT导致非目标准确率下降高达21个百分点(科学SFT后的逻辑任务)。数学RL提升了数学能力,同时将科学准确率提高了7个点以上,展现正向的跨任务迁移。
监督微调(SFT)产生的得分函数向量具有大幅度和中等的任务间余弦相似度,表明稠密而重叠的更新。相反,强化学习(RL)生成的得分函数幅度小得多,残差项有界,且余弦相似度接近零,表明RL更新近乎正交,跨任务天然解耦。SFT得分函数的L2范数约为7.1,而RL降至约0.1,反映出更新幅度的显著减小。RL的任务间余弦相似度约为0.001,而SFT约为0.1,确认RL梯度占据近乎正交的子空间。
并行强化学习(RL)合并特定任务更新时的冲突远小于监督微调(SFT):简单求和合并保留了单任务RL性能的95%,而SFT仅为66%。通过TIES和SVD等稀疏化策略,可将保留率进一步提升至96–98%,合并后轻量适应步骤使性能超越单任务模型(102.8%保留率),且相对基础模型平均提升9.4%。朴素并行RL(求和)保留95%的单任务RL性能,而并行SFT(求和)仅保留66%,表明RL更新更兼容。使用TIES或SVD稀疏化RL更新能将保留率提高至96–98%,减少任务干扰。经过轻量合并后微调的Adapted Parallel-RL超越单任务模型(102.8%保留率),较基础模型提升9.4%。
从朴素Parallel-RL合并模型中移除某一任务的更新会导致该任务准确率大幅下降(平均-7.1%),而其余任务性能保持稳健,甚至平均小幅提升0.6%。这表明Parallel-RL产生了强解耦的任务表征,允许选择性移除模块而不损害不相关的能力。剔除数学更新导致MATH500准确率下降3.6个点(从86.4到82.8),而其他三个基准平均上升0.9个点。剔除科学更新导致MMLU下降10.5个点(从48.0到37.5),但其他任务得分几乎不变,平均仅下降0.1个点。
实验在单任务、顺序多阶段和并行合并策略下评估了监督微调(SFT)和强化学习(RL)在数学、科学和逻辑任务上的表现。RL更新天然解耦且跨任务近似正交,避免了灾难性遗忘,并实现了正向跨任务迁移,而SFT产生稠密、相互干扰的更新,导致非目标能力严重下降。并行RL合并通过简单求和即可保留高达95%的单任务性能,稀疏化加轻量适应可产生超越单任务对应方案的模型,而移除单个任务模块则证明了完全隔离的任务表征。