Command Palette
Search for a command to run...
自适应奖励路由:通过前向过程 RL 实现联合音视频扩散的动态多奖励优化
自适应奖励路由:通过前向过程 RL 实现联合音视频扩散的动态多奖励优化
Songlin Yang Xiaotong Zhao Jiacheng Zhang Zhe Wang Toyota Li Eric Liu Alan Zhao Anyi Rao
摘要
多奖励引导的强化学习(即 RL)为在多个目标上改进联合音视频扩散模型提供了一条有前景的途径,这些目标包括模态特定质量、跨模态语义对齐和时间同步。然而,其有效性取决于训练过程中变化的两个量:奖励驱动的更新应作用于何处,以及相互竞争的奖励应如何协调。现有方法往往依赖固定的路由和奖励权重,无法跟踪不断演化的模型功能。为解决这些局限,我们提出自适应奖励路由,在联合音视频扩散模型的前向过程 RL(即 DiffusionNFT)中同时自适应地调整更新位置和奖励协调。该方法由两个部分组成。(i)跨模态影响引导路由(局部化更新):我们使用双向交叉注意力响应作为不断演化的跨模态影响的高效代理变量,动态重新加权 token 感知损失并在跨模态层间缩放梯度,而无需额外的模型干预。(ii)偏好保持的模态感知重加权(协调奖励):我们保留预定义权重作为偏好先验,并将分支特定的奖励-梯度交互用作预热后的残差校正。这解决了不断演化的冲突,同时不会让占主导地位的奖励压制较弱但必要的目标。大量实验表明,相较于强 RL 基线,在模态质量、语义一致性和音视频同步方面均取得一致提升。消融实验和机制分析进一步验证了自适应更新路由与奖励协调的互补收益。
一句话总结
腾讯视频和香港大学的研究者提出了 Adaptive Reward Routing,一种在联合音视频扩散模型的前向过程 RL(DiffusionNFT)中联合调整更新位置和奖励协调的方法,通过跨模态影响引导路由和保偏好模态感知重新加权,从而在模态质量、语义一致性和音视频同步性方面优于强 RL 基线。
核心贡献
- Adaptive Reward Routing 是一种用于联合音视频扩散模型中多奖励强化学习的动态信用分配方法,在前向过程 RL 中同时自适应基于奖励的更新位置以及相互竞争的奖励信号如何协调。
- 该方法引入了跨模态影响引导路由,利用双向交叉注意力响应动态重新加权 token 感知损失并缩放跨模态层的梯度,并引入了保偏好模态感知重新加权,将预定义的奖励权重保留为先验,并在预热后添加分支特定的奖励梯度校正。
- 在双流 LTX 和统一 JavisDiT++ 骨干上的实验表明,在模态质量、语义一致性和音视频同步性方面相较强 RL 基线有一致提升,同时消融和机制分析验证了自适应更新路由与奖励协调之间的互补收益。
引言
作者研究联合音视频扩散模型的后训练问题,其中生成内容必须同时满足模态特定的质量、跨模态语义对齐和时间同步。奖励引导的扩散 RL 很有吸引力,因为多个奖励信号可以表达这些要求,但先前工作依赖静态更新路由或固定奖励权重,随着模型演化和奖励冲突变化而变得过时。作者提出 Adaptive Reward Routing,利用双向交叉注意力响应动态定位奖励驱动的更新,并将奖励协调自适应为用户定义偏好权重的残差校正。实验表明,在不同骨干网络上,模态质量、语义对齐和音视频同步性均有一致提升。
方法
作者提出 Adaptive Reward Routing,一种前向过程强化学习框架,用于奖励引导的联合音视频扩散模型后训练。该方法通过动态自适应奖励优先级和路由位置来处理多模态、多奖励优化。
整体流程由五个顺序阶段组成:采样、评估、重新加权、路由和损失计算。在采样阶段,基础模型在共享时间步下处理分离的音频流和视频流。这些流通过双向交叉注意力机制(即音频到视频和视频到音频通路)交换信息,使模型能够预测联合速度场。随后使用一组视频、音频和跨模态奖励对生成样本进行评估。
为了有效组合这些多样化的奖励,框架采用了保偏好模态感知重新加权模块。作者并未仅依赖预定义的静态权重或纯基于梯度的系数,而是将两种方法结合。每个奖励通过其对应的模态分支进行探测。在初始预热阶段之后,平滑的冲突感知系数对先验权重提供残差校正。这确保了先验偏好建立非零下限,而残差项动态适应当前的梯度冲突。重新加权后的奖励被聚合,为每个模态分支 m∈{v,a} 计算单独的优势 Am。
重新加权之后,框架应用跨模态影响引导路由来确定优化更新应作用于何处。该路由在两个不同层级上运行。在 token 级别,模型通过评估门控前响应范数来测量跨模态注意力的方向性影响。这些响应在中间到后期去噪时间步上取平均,并归一化以产生各个 token 的正损失权重 λm,i。在层级别,同样的响应在 token 上取平均以计算层得分。该得分被转换为软解耦系数,用于缩放交叉注意力 key 和 value 的反向梯度。因此,影响强的层保留更多梯度流,而弱耦合层逐渐被解耦,同时不改变前向传播值。
最后,训练目标整合了这些自适应机制。token 路由权重被应用于负向感知损失函数:
ℓm,i=rmwm++ε∥vθ,m,i+−um,i∥22+(1−rm)wm−+ε∥vθ,m,i−−um,i∥22其中 rm 是由分支优势推导出的最优性概率,wm± 表示相应策略的分离平均绝对残差。最终损失结合音频和视频分支的策略损失,并通过 Kullback-Leibler 散度项将其正则化到固定参考策略。这一综合设计确保优化过程尊重用户偏好,同时动态解决多模态冲突。
实验
实验在 LTX-2 和 LTX-2.3 音视频扩散骨干网络上评估自适应奖励路由,使用 VGGSound 派生的训练集和 JavisBench 基准。主要结果表明,所提方法在音视频质量、文本一致性、跨模态一致性和同步性方面的提升优于固定奖励协调、冲突感知聚合和静态多模态路由基线。消融实验确认 token 级和层级路由是互补的,保偏好奖励协调处理了不同的失效模式。额外验证表明,跨模态影响代理能够可靠识别功能重要的层和 token,而冻结的路由图在训练过程中会变得过时。
在报告的 LTX-2 比较中,所提方法在视觉质量、音频质量、文本对齐、音视一致性和同步性方面相较基础模型和现有基线有显著提升。GDPO 和 MARBLE 提供了部分收益,但可能牺牲同步性或文本对齐。完整模型实现了最强的整体平衡,在报告的指标上得分领先,并且失同步分数最低。所提方法在比较的 LTX-2 配置中获得了最高的视觉质量、音频质量、文本一致性、音视一致性和 JavisScore,同时实现最低的失同步分数。仅使用 GDPO 相比基础模型改善了视觉质量,但增加了失同步,说明没有完整方法的奖励优化可能牺牲音视时序。OmniNFT 相较于早期基线大幅改善了音视一致性和同步性,而所提方法进一步提升了这些对齐指标和整体质量。
在 LTX-2 骨干网络消融中,将 token 加权与层缩放相结合能产生最强的纯路由配置,改善音视频质量、语义一致性和同步性,同时降低失同步。孤立的奖励协调链表明,分支感知平衡、残差混合和预热逐步改善整体平衡,其中预热显著提高音频质量并降低失同步。路由和加权处理互补的失效模式,完整模型整体表现最佳。token 加权和层缩放是互补的:它们的结合在质量、一致性和同步性指标上产生最强的纯路由结果。在孤立的奖励协调变体中,在分支感知平衡和残差混合基础上加入预热可获得最佳音频质量和最低失同步,但中间收益并不在每个指标上都单调。
实验将所提方法与 LTX-2 基线和消融配置进行评估,显示在视觉质量、音频质量、文本对齐、音视一致性和同步性方面均有一致提升,同时实现最低失同步分数。GDPO 和 MARBLE 等基线方法提供了部分收益,但可能牺牲同步性或文本对齐;OmniNFT 改善了一致性和同步性,但仍低于完整模型。消融表明,token 加权和层缩放对路由是互补的,而分支感知平衡、残差混合和预热逐步改善整体平衡,其中预热尤其提高了音频质量并降低了失同步。