HyperAIHyperAI

Command Palette

Search for a command to run...

LLM-as-a-Coach:面向不可验证任务的体验式学习

Tianzhu Ye Li Dong Guanheng Chen He Zhu Xun Wu Shaohan Huang Furu Wei

摘要

在开放式任务上进行强化学习(RL)时,会将大语言模型(LLM)基于评分量表的评估压缩为一个标量奖励,丢弃了丰富的文本反馈,并混淆了具有不同质量特征的响应。我们提出体验式学习(EL),将反馈模型从“LLM 作为评判者”重新定位为“LLM 作为教练”。该教练将其对每个在策略响应的评估提炼为可迁移的体验知识,这些知识用于调节一个教师模型,并通过在策略上下文蒸馏被策略模型内化。与标量奖励相比,这种更高带宽的反馈通道提供了密集的监督,并保留了高质量响应之间的细粒度偏好。在两个策略家族中,无论反馈来自策略自身还是来自一个闭源模型,EL 在留出和未见过的开放式任务上均一致优于基于评分量表的 RL。值得注意的是,EL 在训练分布之外展现出更好的泛化能力,并缓解了奖励黑客现象。这些发现确立了体验知识作为一种更丰富、更可泛化的学习信号,适用于不可验证任务的后训练阶段。

一句话总结

来自微软研究院、清华大学和北京大学的研究人员提出了体验学习(Experiential Learning, EL),该方法将LLM-as-a-Judge转变为LLM-as-a-Coach,将丰富的文本评估提炼为可迁移的体验知识,通过在线策略上下文蒸馏提供密集、高带宽的反馈,在开放式任务上优于基于评分标准的强化学习,提高泛化能力并缓解奖励破解。

核心贡献

  • 体验学习将LLM-as-a-Judge重新用作LLM-as-a-Coach,将基于评分标准的评估提炼为可迁移的体验知识。这些知识通过在线策略上下文蒸馏内化,提供更高带宽的反馈信号,保留高质量响应之间的细粒度偏好。
  • 在两种策略家族中,无论是使用策略自身还是专有模型提供反馈,EL在保留的测试集和未见过的开放式任务上始终优于基于评分标准的强化学习,同时在训练分布之外展现出更强的泛化能力,并缓解奖励破解。
  • 提炼后的体验知识比原始评论或评分标准更有效,迭代教师更新和在通用领域提示上的在线策略蒸馏能够提升任务性能,并防止分布外能力的遗忘。

引言

作者们致力于解决将强化学习应用于开放式语言任务所面临的挑战,这类任务中质量是多维的,且没有单一正确答案。先前的工作依赖于LLM-as-a-Judge评估,它们会生成丰富的文本反馈以及一个标量奖励,但标准的强化学习丢弃了文本分析,仅使用最终分数,这形成了一个信息瓶颈,使得原本不同的高质量响应变得难以区分。作者提出了体验学习(EL),它将评估器重新用作LLM-as-a-Coach,从基于评分标准的评估中提取可复用、可迁移的指导。然后,EL通过在线策略上下文蒸馏内化这些体验知识,将自然语言反馈转化为密集的逐token监督,使策略能在开放式任务上超越标量奖励的限制而改进。

方法

作者们解决了在不可验证的开放式任务上训练语言模型策略的挑战,这类任务没有标准答案,质量由另一个模型评判。给定提示 xxx 和一组评分标准 Rx\mathcal{R}_xRx,这些标准将期望的质量分解为可检查的准则,策略 πθ\pi_\thetaπθ 生成响应 yyy。反馈语言模型 MMM 随后评估该响应,生成详细的评估 M(x,y,Rx)M(x, y, \mathcal{R}_x)M(x,y,Rx)。其核心思想是将该评估从标量奖励转化为更丰富的、基于文本的指导信号。

在标准的强化学习基线中,MMM 充当 LLM-as-a-Judge:仅保留标量奖励 r=Extract_Reward(M(x,y,Rx))r = \text{Extract\_Reward}(M(x, y, \mathcal{R}_x))r=Extract_Reward(M(x,y,Rx)),丢弃所有其他文本分析。策略通过最大化数据集 D\mathcal{D}D 上提示和评分标准的期望奖励来训练,如公式 (1) 所示。作者使用 Group Relative Policy Optimization (GRPO) 实现此方法。

maxθE(x,Rx)D,yπθ(x)[r]\max_\theta \mathbb{E}_{(x, \mathcal{R}_x) \sim \mathcal{D}, y \sim \pi_\theta(\cdot \mid x)} \left[ r \right]θmaxE(x,Rx)D,yπθ(x)[r]

体验学习(EL)复用相同的反馈模型 MMM,但将其提升为 LLM-as-a-Coach。教练不会将评估压缩为标量,而是分析基于评分标准的评估,并将可迁移的见解提炼为体验知识文本块 e=Extract_Knowledge(M(x,y,Rx))e = \text{Extract\_Knowledge}(M(x, y, \mathcal{R}_x))e=Extract_Knowledge(M(x,y,Rx))。然后通过最小化策略自身分布与以上下文为条件的教师分布 πteacher(e,x)\pi_{\text{teacher}}(\cdot \mid e, x)πteacher(e,x) 之间的反向 KL 散度来优化策略。损失函数如公式 (2) 所示,是一个 token 级别的蒸馏目标,通过在线策略样本反向传播 eee 中包含的丰富信息。

L(θ)=E(x,Rx)D,yπθ(x)[1yt=1yDKL(πθ(x,y<t)πteacher(e,x,y<t))],where e=Extract_Knowledge(M(x,y,Rx))\begin{aligned} \mathcal{L}(\theta) = \mathbb{E}_{(x, \mathcal{R}_x) \sim \mathcal{D}, y \sim \pi_\theta(\cdot \mid x)} \left[ \frac{1}{|y|} \sum_{t=1}^{|y|} D_{\mathrm{KL}} \left( \pi_\theta(\cdot \mid x, y_{<t}) \| \pi_{\text{teacher}}(\cdot \mid e, x, y_{<t}) \right) \right], \\ \text{where } e = \text{Extract\_Knowledge}(M(x, y, \mathcal{R}_x)) \end{aligned}L(θ)=E(x,Rx)D,yπθ(x)y1t=1yDKL(πθ(x,y<t)πteacher(e,x,y<t)),where e=Extract_Knowledge(M(x,y,Rx))

教师可以是初始冻结的策略检查点,也可以是迭代更新的版本:每个 epoch 结束时的策略检查点成为下一个 epoch 的教师。这使得 EL 成为一个在线策略上下文蒸馏过程,将教练的分布指导直接内化到策略权重中。

裁判与教练接口的根本区别在于优化器利用的反馈带宽。来源于离散 1-10 量表的标量奖励最多携带 log2(10)3.3\log_2(10) \approx 3.3log2(10)3.3 比特/样本的信息;即使学习到的投影头输出 bfloat16 奖励,理论上限也仅为 16 比特。相比之下,教练产生的体验知识 eee 是一个最多包含 LLL 个 token 的文本上下文,这些 token 来自大小为 V|\mathcal{V}|V 的词汇表,理论带宽上限为 Llog2(V)L \cdot \log_2(|\mathcal{V}|)Llog2(V) 比特。在典型值下(L=1024L = 1024L=1024, V=150,000|\mathcal{V}| = 150,000V=150,000),该带宽超过标量奖励的 10410^4104 倍。在涉及多个质量维度、风格偏好和细微权衡的不可验证任务上,这一宽得多的通道使策略能够捕捉到标量奖励饱和后无法区分的细粒度偏好。因此,EL 绕过了基于裁判的 RL 的信息瓶颈,能够以更高保真度逼近由反馈模型定义的目标分布。

实验

实验比较了体验学习(EL)与标准强化学习(RL)在不可验证任务上的表现,使用评分标准评估开放式响应。EL 使用 LLM-as-a-Coach 生成丰富的文本反馈,而 RL 则使用 LLM-as-a-Judge 的标量奖励。结果表明,EL 在保留测试数据上始终优于 RL,并能更好地迁移到未见过的基准测试,因为更丰富的反馈通道缓解了奖励破解,并促进了更可泛化的行为。消融实验表明,迭代教师更新结合通用提示蒸馏有助于保留分布外能力,且从教练的评论中提取体验知识是最有效的上下文格式。一个玩具分析进一步说明,标量奖励丢失了细粒度区分,而文本指导更高的反馈带宽能够实现忠实于分布的匹配。

当使用相同的反馈模型和评分标准时,将其视为裁判只能得到标量分数和低带宽学习信号,而将其视为教练则可提取高带宽的体验知识,提供更细粒度的指导。一个受控的分布匹配实验证实,当目标需要超过两个奖励等级时,标量奖励会丢失信息,产生量化伪影,而高带宽反馈则避免了这一问题。使用 LLM-as-a-Judge 会将丰富的基于评分标准的评估压缩为单一标量,提供低带宽学习信号。当目标分布具有超过两个奖励等级时,标量反馈会导致量化伪影,抹去细粒度区分,而高带宽的体验指导则保留了这些区分。

体验学习(EL)在大多数基准测试上优于强化学习(RL),在 AlpacaEval v2.0 和 WildBench 上增益尤为显著。当反馈模型是初始冻结的策略或 GPT-4o 时,优势依然存在,表明 EL 更丰富的信息通道是改进的驱动力。使用 GPT-4o 作为反馈模型进一步提高了两种方法在 WildChat 上的得分。EL 在几乎所有评估基准上均优于 RL,在 AlpacaEval v2.0 和 WildBench 上尤其表现出大幅提升。无论反馈模型是冻结的策略检查点还是 GPT-4o,性能差距依然存在,说明收益来自 EL 更丰富的反馈信号,而非特定的反馈大语言模型。将反馈模型切换为 GPT-4o 相比使用初始策略检查点,能同时提升 RL 和 EL 在 WildChat 上的得分。

在体验学习中迭代更新教师可提高分布内聊天质量(WildChat 得分),但会导致分布外指令遵循准确率(IFEval)大幅下降。从初始冻结教师添加通用提示 OPD 可恢复大部分 OOD 损失,同时保持聊天质量的提升。迭代教师更新将 WildChat 得分从 80.0 提升至 80.7,但将 IFEval 准确率从 83.1 降至 74.9。将通用提示与迭代教师更新混合使用,可在不牺牲 80.7 WildChat 得分的前提下,将 IFEval 准确率恢复至 79.9。

对教师上下文进行消融实验显示,默认的体验学习(EL)格式在 WildChat 得分和分布外 IFEval 准确率上取得了最佳组合。仅提供完整评论或评分标准可提高域内得分,但会降低 IFEval 准确率至低于基础模型,表明存在遗忘。默认 EL 在这两项指标上恢复并超越了所有其他变体。默认 EL 达到最高的 WildChat 得分(68.6)和最高的 IFEval 准确率(68.8),优于所有其他上下文配置。完整评论和仅评分标准将 WildChat 得分从基础模型的 64.8 提升至更高,但导致 IFEval 准确率分别降至 64.6 和 65.6,低于基础模型的 68.0。仅 RL 将得分从 64.8 提升至 67.7,同时 IFEval 准确率从 68.0 略微降至 67.6。多选上下文在微调变体中获得了最低的 WildChat 得分(66.3),但保持了较高的 IFEval 准确率(68.5),接近基础模型。

强化学习提供每个样本的标量奖励,带宽恒定为 O(1),这会模糊获得相同分数的 token 之间的细粒度区别。相比之下,从更强教师获得的在线策略蒸馏带宽随响应长度以 O(N) 增长,而来自教练知识上下文的体验学习带宽随教练体验上下文长度以 O(L) 增长,两者都携带更丰富的每 token 信息。一个受控的分布匹配实验证实,将反馈量化为标量等级会导致策略在奖励平台内坍塌 token 概率,而直接分布指导则能完整保留目标分布,没有此类伪影。强化学习反馈是序列级别的标量,带宽有限,不随响应或上下文长度增长。在线策略蒸馏反馈带宽随响应长度增长,体验学习带宽随教练的体验上下文长度增长,提供更丰富的信号。在一个玩具示例中,标量奖励导致所有共享相同最高奖励等级的 token 出现相同的概率,丢失了分布匹配所保留的细粒度区分。

实验比较了使用标量、低带宽反馈的标准强化学习(RL)与提取高带宽教练知识的体验学习(EL)。当目标分布超过两个等级时,标量奖励会坍塌细粒度区分,形成量化伪影。跨基准测试,EL 优于 RL,尤其在 AlpacaEval v2.0 和 WildBench 上,优势源于更丰富的反馈通道而非反馈模型。迭代教师更新提升了分布内聊天质量,但降低了分布外指令遵循能力,这一权衡可通过混合通用提示恢复,而默认 EL 上下文在域内和域外性能上取得了最佳平衡。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供