HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
模型训练

知何时不复用:自主 LLM 后训练中的条件化经验迁移

Tingyun Li Wenfeng Feng Weiqing Li Abudukelimu Wuerkaixi Guohua Liu Yuewei Zhang

摘要

大语言模型具备广泛的能力,但使其适应不断演变的领域、工具和需求通常需要反复进行后训练。自主系统通过提出更新方案、训练候选模型并利用评估反馈来选择后续方案,从而自动化这一过程的部分环节。随着证据的积累,一个核心问题浮现:在后续训练已改变父模型之后,哪些过去的更新证据仍然具有可操作性?一次更新的效果取决于其父模型、所用数据及训练阶段。将过去的成功视为无条件的许可会浪费计算资源。若由此产生的子模型被提升为主模型,还可能损害后续的训练轨迹。我们将此问题形式化为条件化经验迁移,并提出边界校准干预迁移(Boundary-Calibrated Intervention Transfer, BCIT)方法,该方法在改变权重的训练之前对经验复用进行授权。BCIT 将观察到的效果与其来源上下文绑定,检查适用条件,对存在已命名硬冲突的候选方案予以否决,并在必要时通过一次有界训练试验获取当前状态下的证据。完全训练好的候选方案仍需遵循统一的采纳规则,且仅当事件被观察到时才会扩展记忆。在一个 4B 模型上,我们使其依次适应金融推理、文本到 SQL 和函数调用三个领域,候选更新在所评估的上下文中展现出异质的目标效果与保留效果。在候选方案、证据和计算资源均匹配的条件下,BCIT 比所评估的替代方法授权了更少的有害更新,并在相同预算下取得了更高的最终模型质量。这些结果支持将经验授权视为自主后训练中的一个独立问题。

一句话总结

阿里云提出边界校准干预迁移(BCIT),一种用于自主LLM后训练的条件经验迁移方法,该方法验证复用条件、否决硬冲突,并通过有限试验获取当前状态证据,从而减少有害更新,并在4B模型上跨金融推理、文本到SQL和函数调用任务提升最终模型质量。

核心贡献

  • 论文将条件经验迁移定义为自主LLM后训练中的一个独特问题,即过去的更新成功在父模型发生变化后并非普遍适用。
  • 引入边界校准干预迁移(BCIT),该方法将观察到的效果绑定到源上下文,检查适用条件,否决硬冲突,并使用有限训练试验收集当前状态证据,然后才授权完整训练。
  • 在适配金融推理、文本到SQL和函数调用任务的4B模型上的实验表明,BCIT授权更少的有害更新,并在同等预算下比评估的替代方案获得更高的最终模型质量,支持基于经验条件的计算分配。

引言

在许多持续学习和多任务设置中,模型通过后训练计算顺序更新,但一个上下文中的改进可能无意中损害其他上下文上的性能。先前方法通常无条件分配计算,假设过去的成功证明进一步修改是合理的,这有可能引入冲突并降低整体能力。作者提出BCIT,一种根据当前上下文证据来调节后训练计算分配的方法。它拒绝硬冲突,针对父模型验证候选更新,并应用冻结规则授予完整训练预算,然后使用策略共享的采纳规则来提升或回滚每个子模型。这种基于证据的策略授权更少的有害更新,同时保留有益的更新,从而比共享模型替代方案获得更高的跨任务性能。

实验

BCIT策略实现了最强的权衡,授权的有害结果远少于任何其他策略,同时仍保留大多数有益结果。从BCIT中移除候选特定适用性会导致其有害授权率增加三倍,回到仅源证据基线的水平。像additive+veto这样的策略也减少了有害授权,但牺牲了比BCIT更多的有益结果。BCIT仅授权四分之一的有害结果,同时保留90%的有益结果,产生最低的有害比例。如果没有候选特定适用性,BCIT的有害授权率跃升至75%,与仅源证据策略持平。仅源证据保留了90%的有益结果,但仍授权了四分之三的有害结果。平坦加性和仅适用性策略都保留了80%的有益结果,并授权了近三分之二的有害结果。

在固定的36 GPU小时预算下,Add. + veto方法实现了最高的跨任务平均值和相对于基础模型的最大最小改进,同时在共享模型中提供了最佳的指令遵循得分。单任务专家在各自任务上超越共享模型,但每个任务消耗全部预算,计算成本高昂。多任务方法在所有任务上一致地改进基础模型,且不超出预算。Add. + veto在共享模型方法中产生了最高的跨任务均值(46.1)和最大的相对于基础模型的最小增益(+2.7分)。单任务专家在TAT-QA上达到39.6,BIRD上49.3,BFCL上65.1,优于最佳共享模型,但每个需要36 GPU小时。与其他共享模型相比,Add. + veto的指令遵循(IFEval)得分最高(提示级别76.0,指令级别82.1)。

在安全评估中,BCIT策略在有害和有益授权之间实现了最佳权衡,大幅减少有害结果,同时保留大多数有益结果;这一优势依赖于候选特定适用性,没有它,有害授权急剧上升。在固定计算预算下的多任务训练中,Add. + veto方法在共享模型中产生了最高的跨任务平均值和指令遵循得分,而单任务专家实现了更高的单任务性能,但计算成本高得多。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供