Command Palette
Search for a command to run...
FlowBalance:基于验证器的在线策略推理经验自我改进
FlowBalance:基于验证器的在线策略推理经验自我改进
Zixun Huang Kishan Panaganti Haitao Mi Leowei Liang
摘要
推理模型可以从自身的在线策略经验中改进,但这一内部循环是脆弱的:终端验证器提供可靠但稀疏的监督,而密集的同模型指导可能强化错误信心或将学习过度集中于狭窄的解决方案模式。我们提出 FlowBalance,一种基于验证器的自我改进方法,它学习完整响应的归一化分布。对于每条在线策略轨迹,同一策略的冻结训练时视图利用特权上下文生成词元级对数概率增益,这些增益被聚合为轨迹级自我指导分数。FlowBalance 使用验证器派生的组优势来校准该分数:在正优势轨迹上保留指导,在负优势轨迹上反转指导,当回滚组不提供结果偏好时禁用指导。由此产生的能量以指数方式重新加权参考策略,而轮廓轨迹平衡通过每个回滚组的一个对数配分估计来拟合归一化目标。这通过轨迹平衡实现了结果校准的自我指导,无需单独的词元级模仿损失。我们的分析建立了组内对比保持、最小变化反向 KL 特征、目标奖励的单调验证器控制,以及对被拒绝响应上假阳性自我指导的精确修正。在数学推理方面,FlowBalance 在 Qwen3-4B 和 Qwen3-8B 上均优于 FlowRL 的平均性能,同时提高了训练速度和稳定性,避免了直接 OPSD 的响应长度崩溃,并在受控 AIME24 诊断中表现出更高的正确策略多样性。
一句话总结
腾讯HY LLM前沿团队与宾夕法尼亚大学的研究者提出FlowBalance,一种基于验证器锚定的自我改进方法。该方法通过轨迹平衡,利用验证器派生的组优势校准token级自我引导分数,从而在完整响应上学习归一化分布,并对参考策略进行重加权。在Qwen3-4B和Qwen3-8B上,该方法相较于FlowRL提升了数学推理能力,同时提高了训练速度和稳定性,避免了响应长度坍缩,并在AIME24中增加了正确策略的多样性。
核心贡献
- 提出FlowBalance,一种基于验证器锚定的自我改进方法。该方法将冻结的特权事后自我引导分数与验证器派生的组优势相结合,在完整响应上学习归一化分布。对于正优势轨迹保留引导,对负优势轨迹反转引导,并在无结果偏好时禁用引导。
- 通过profiled trajectory balance拟合参考策略支持的target,每个rollout组仅需一次log-partition估计,无需单独的token级模仿损失。理论分析建立了组内对比保持、最小变化反向KL特征、验证器对目标奖励的单调控制,以及对被拒绝响应的精确反自我确认修正。
- 在数学推理任务上,FlowBalance在五个基准上均优于FlowRL,覆盖Qwen3-4B和Qwen3-8B。该方法比GRPO更早达到AIME24验证阈值,保持训练稳定性,避免直接OPSD的响应长度坍缩,并在受控AIME24诊断中展现出更高的正确策略多样性。
引言
推理模型的后训练旨在通过从自身采样解中学习来改进,但这种自我改进循环面临两个核心挑战。首先,基于可验证奖励的强化学习(RLVR)仅提供稀疏的终止反馈作为可靠的结果信号,无法捕捉长推理路径中的细粒度证据。其次,来自策略冻结副本的密集自我引导,虽然使用仅训练上下文对每个token打分,成本低廉但不可信:它可能偏向被拒绝的轨迹、缩短推理过程,或强化模型自身的错误,导致自我确认偏差。
为解决这些问题,作者提出FlowBalance,一种分布性自我改进算子,将验证器锚定的优势与结果校准的特权事后引导相结合。核心创新在于一个轨迹级能量函数,其中验证器决定改进方向,密集自我引导仅在验证器确认成功时细化该方向,在失败时反转方向。该能量定义了一个参考策略支持的Gibbs目标,通过profiled trajectory balance拟合,保留所有组内概率对比,并作为参考策略的最小变化更新。
作者提供了理论保证,表明FlowBalance将假阳性的自我引导转化为验证器锚定的修正,保持验证器对目标奖励的单调控制,并通过每个rollout组仅profiling一个标量partition实现信息高效。实验上,在Qwen3-4B和Qwen3-8B上,FlowBalance在数学推理基准上优于GRPO、OPSD、RLSD和FlowRL,比GRPO更快达到AIME24验证准确率,在扩展训练中保持稳定,并保留更高的语义策略多样性,避免了直接密集引导方法下的响应长度坍缩。
方法
FlowBalance是一种自我改进流程,将模型自身采样的一组推理轨迹转化为归一化的下一策略目标。核心设计结合了稀疏验证器信号与密集的特权事后自我引导信号,并通过轨迹平衡拟合所得分布。作者在可训练策略πθ(y∣x)的背景下构建问题,该策略在token级别上因子化,其中token t处的状态为提示词和先前生成的token。每次训练迭代开始时,当前参数被快照为θ−,冻结的rollout策略πθ−生成经验。固定参考策略πref(初始检查点的副本)用于控制漂移并为目标分布提供支持。
对于每个提示词,冻结策略采样一组N个响应。验证器根据最终答案正确性为每个响应分配终止奖励Ri。作者为每个响应计算停止梯度的组相对优势:
Ai=σR(x)+ϵRi−μR(x),其中μR(x)和σR(x)是采样组内奖励的均值和标准差。该归一化确保优势相对于模型在该特定提示词上的当前表现,提供有依据但稀疏的结果信号。
为获得密集的token级引导,作者引入特权事后视角。每个训练提示词与仅训练上下文c(如参考解或任务反馈)配对。冻结快照通过两个视角进行评估:rollout视角πroll(⋅∣st)=πθ−(⋅∣x,y<t),在生成响应时不观察c;特权事后视角πH(⋅∣st,c)=πθ−(⋅∣x,c,y<t),仅在响应采样后看到c。该事后视角对已采样的相同token打分,但不生成替代轨迹,也不接收梯度。此构造与on-policy self-distillation相关,但在FlowBalance中作用更窄:它提供停止梯度的密集特征以定义轨迹级目标,而非作为独立的token级模仿损失进行优化。
密集自我引导量化为裁剪后的token级事后增益:
δtH(y;x,c)=clip(logπH(yt∣st,c)−logπref(yt∣st),−B,B),该增益在完整响应上聚合,形成轨迹级特征:
GH(y∣x,c)=T1t=1∑TδtH(y;x,c).该特征衡量特权事后视角相对于固定参考策略,对平均采样token对数概率的提升或降低程度。所有量均停止梯度,且不从πH重新采样任何token。
由于密集自我引导可能有用,但仍可能对验证结果判断错误,FlowBalance使用组相对优势校准其方向。轨迹能量定义为:
EFlowBalance(y∣x,c)=ηAA(y)+βGGH(y∣x,c)sgn(A(y)),其中ηA,βG≥0。若A(y)>0,正引导增加轨迹能量,强化该响应。若A(y)<0,正引导被反转,防止高置信失败成为自我强化的监督信号。若A(y)=0,密集分支被禁用。这种结果校准的能量定义了未归一化目标:
pFlowBalance(y∣x,c)=πref(y∣x)exp(τEFlowBalance(y∣x,c)),该目标在实现的rollout组上归一化,形成目标分布:
pFlowBalance,G⋆(y(i)∣x,c)=∑j=1Nπref(y(j)∣x)exp(EFlowBalance(y(j)∣x,c)/τ)πref(y(i)∣x)exp(EFlowBalance(y(i)∣x,c)/τ).参考策略保持支持,优势提供验证过的结果方向,事后增益提供密集的轨迹内证据。partition项将相对轨迹能量转化为概率守恒的目标,使自我引导在验证器方向内细化分布,而不成为独立的局部损失。
作者通过轨迹平衡拟合该目标。完整轨迹平衡方程为:
τlogZFlowBalance(x,c)+τlogπref(y∣x)πθ(y∣x)−EFlowBalance(y∣x,c)=0,对应采样响应的残差为:
ΔTB(y(i);x,c)=τlogZFlowBalance(x,c)+τlogπref(y(i)∣x)πθ(y(i)∣x)−EFlowBalance(y(i)∣x,c).在零残差处,partition在成对概率比中抵消,意味着能量控制模型自身采样经验间的相对偏好,而log-partition仅吸收共同的提示级偏移。主要损失为均方残差:
LFlowBalance(θ)=E(x,c)∼D[2N1i=1∑NΔTB(y(i);x,c)2].梯度仅通过可训练策略的对数概率传播;奖励、优势、自我引导分数、partition估计和采样响应均停止梯度。
同一原理可扩展到子轨迹。设ZFlowBalance(s)表示从状态s开始的续接partition,其中ZFlowBalance(sterm)=1。定义逐token的shaped增量:
rtFlowBalance=τlogπref(yt∣st)+TβGδtHsgn(A)+ηAA1{t=T}.对于区间i:j,子轨迹残差为:
Δi:j=τlogZFlowBalance(si)+τt=i∑j−1logπθ(yt∣st)−τlogZFlowBalance(sj)−t=i∑j−1rtFlowBalance.最小化期望平方子轨迹残差为长响应提供更密集的拟合目标,但论文中的实验默认使用完整响应实现,除非另有说明。
对于partition,作者使用profiled组估计器而非学习的提示条件估计器。每个响应隐含一个估计:
logZi(x,c)=τEFlowBalance(y(i)∣x,c)−logπref(y(i)∣x)πθ(y(i)∣x),组估计为平均值:
logZFlowBalance(x,c)=N1i=1∑NlogZi(x,c).该估计的梯度被停止。自我改进循环是明确的:冻结快照首先在无特权上下文的情况下生成经验,然后在相同轨迹上提供仅训练的事后分数。验证器锚定分数方向,轨迹平衡将所得归一化分布内化到下一策略快照中。
实验
FlowBalance在Qwen3-4B和Qwen3-8B上针对数学推理进行评估,与GRPO、OPSD、RLSD和FlowRL基线比较。该方法在五个基准上持续提高平均准确率,最大增益出现在AIME24 Pass@16上,同时加速早期收敛,在更长训练中保持稳定性,并避免直接蒸馏中出现的响应长度坍缩。消融实验确认验证器锚定和引导强度均对性能有贡献。一项独立的LLM评判诊断显示,FlowBalance比GRPO或RLSD产生更多样化的正确解题策略,示例中它发现隐藏的矩形盒嵌入而非标准Cayley-Menger行列式方法。
FlowBalance在Qwen3-4B和Qwen3-8B骨干上均持续提升数学推理准确率,优于GRPO、OPSD、RLSD和FlowRL,最大增益出现在Qwen3-8B上。该方法还展现出更快的收敛速度和更好的训练稳定性,同时避免OPSD中的响应长度坍缩。FlowBalance在两个骨干上均取得最高平均准确率,在Qwen3-4B上比GRPO提高约2个百分点,比OPSD提高超过10个百分点;在Qwen3-8B上比OPSD提高超过26个百分点。在Qwen3-8B上,FlowBalance在每个报告基准上均取得最佳均值,而OPSD显著差于所有其他方法。FlowBalance在约100步内达到给定的AIME24验证准确率,而GRPO约需143步;FlowBalance在400步内保持接近峰值准确率,而GRPO在第180步后下降。FlowBalance维持明显更长的推理轨迹,而OPSD迅速坍缩为短响应。
消融研究在默认设置附近扫描验证器系数和引导系数,最高平均准确率出现在最大验证器系数处。默认配置使用验证器系数15和引导系数1,在测试值中取得最佳聚合性能。将验证器系数从5提高到15,五个基准的平均值从65.65提升至67.61。默认引导系数1与最佳验证器系数配对,表明默认设置在扫描范围内为最优。
该表对比了一个AIME几何问题的两种正确解题策略:一种使用标准Cayley-Menger行列式方法,另一种利用隐藏的矩形盒嵌入简化体积计算。两者得出相同最终答案,但不同数学表示说明FlowBalance可产生超越单一主导模板的多样化正确策略。GRPO的正确轨迹使用基于成对距离的标准Cayley-Menger行列式路径。FlowBalance的正确轨迹从边长识别出隐藏的4x5x8盒嵌入,然后使用标量三重积计算体积。两种策略得出相同最终答案,但依赖不同的数学表示和工具。
FlowBalance在Qwen3-4B和Qwen3-8B的数学推理任务上优于GRPO、OPSD、RLSD和FlowRL,最大增益出现在较大骨干上,展现出更快的收敛、更好的稳定性,并避免响应长度坍缩。消融实验确认默认验证器和引导系数为最优,更高的验证器强度可提高准确率。案例研究表明FlowBalance能发现多样化的正确解题策略,例如利用隐藏的几何嵌入,而GRPO则遵循标准方法。