Command Palette
Search for a command to run...
自梯度强制:原生长视频外推
自梯度强制:原生长视频外推
摘要
近期自回归视频扩散方法越来越多地建立在自强制(Self Forcing)之上,学生模型在由自身 rollout 产生的历史上进行训练,而非使用真实视频上下文。这减少了曝光偏差,但历史键值缓存仍仅作为冻结的 rollout 状态被未来帧使用。因此,未来损失无法监督早期生成的潜变量应如何被写入更有用的键和值,以服务于后续视频潜变量的生成。我们将此称为历史上下文-梯度鸿沟。我们提出自梯度强制(Self Gradient Forcing,SGF),一种双阶段训练策略,在不通过完整串行 rollout 进行反向传播的情况下恢复这一缺失的监督信号。第一阶段执行无梯度的自回归 rollout 以匹配推理过程,并在采样的去噪退出步记录自生成的上下文和输入模型的含噪潜变量。第二阶段对记录的退出步执行并行上下文-梯度重建。生成的上下文用作停止梯度的干净潜变量输入,同时模型重新计算上下文 KV 表示和未来到上下文的因果注意力。由此,SGF 在原生自回归训练目标内提供了缺失的记忆写入监督,利用未来视频潜变量上的损失来训练模型将上下文编码为更有效的因果记忆。在不同初始化条件下的大量长时域逐帧和逐块实验中,SGF 实现了比自强制更强的原生长视频外推能力,尤其在主体身份、背景/布局一致性和时间稳定性方面表现突出。值得注意的是,仅使用 5 秒的训练窗口,SGF 即可外推至持续数分钟的视频。代码和模型将在项目页面 https://zhuang2002.github.io/SelfGradientForcing 发布。
一句话总结
来自京东探索研究院的研究人员提出了自梯度强制(Self Gradient Forcing,SGF),一种双阶段训练策略。该方法通过反向传播未来帧损失来监督上下文记忆的写入,而无需完整的 rollout 梯度,从而弥合了自回归视频扩散模型中存在的历史上下文-梯度缺口。这使得模型仅用 5 秒的训练窗口,就能显著提升长视频外推至数分钟的能力,并改善主体身份一致性、背景/布局一致性和时序稳定性。
核心贡献
- 本文指出了 Self Forcing 中存在的一个历史上下文-梯度缺口:未来损失无法监督自生成的视频潜变量如何被编码到键值缓存中,以供后续帧使用。
- 提出了自梯度强制(SGF),一种双阶段训练策略,将自回归 rollout 与并行上下文-梯度重建解耦。这使得未来损失能够优化自生成历史的记忆写入过程,而无需完整的 rollout 反向传播。
- 在逐帧和逐块生成、多种初始化以及长时域上的实验表明,SGF 在 5 秒窗口上训练后,能够外推至数分钟长的视频,并在身份、布局一致性和时序稳定性方面优于 Self Forcing。
引言
自回归视频扩散模型通过将每个新块的条件设定为先前生成的内容来生成长视频。然而,标准的教师强制训练使用真实上下文,导致模型在推理时必须以自身输出为条件时产生曝光偏差。Self Forcing 通过使用自生成的历史进行训练来弥合这种不匹配,但它截断了流经历史 KV 缓存的梯度:未来损失可以监督后续块如何读取缓存,但无法反向传播到将自生成帧写入 KV 记忆的干净时间步计算。这种历史上下文-梯度缺口使得记忆写入缺乏监督,导致在长时外推过程中身份、布局和时序一致性逐渐下降。作者提出了自梯度强制(SGF),一种双阶段训练策略,该策略首先记录无梯度的串行 rollout,然后并行重建相同的计算,从而允许梯度流经干净历史 KV 表示和未来到上下文的注意力。SGF 恢复了缺失的记忆写入监督,而无需通过 rollout 进行完整的反向传播,并在匹配短时域质量的同时,大幅提升了原生长视频外推能力。
方法
作者解决了自回归视频扩散中一个被称为历史上下文-梯度缺口的关键限制。在标准的自回归生成中,潜变量块是顺序生成的。在第 j 个块,因果生成器通过关注历史 K/V 缓存而非原始过去的潜变量来对 zjt 进行去噪。当块 i<j 生成后,其预测的干净潜变量 x~i 在干净上下文时间步 tctx=0 被处理,生成的 K/V 条目被追加到缓存中。缓存写入的计算是循环的:
KVi0(θ)=Cθ(x~i,tctx;KV<i0),tctx=0.在冻结缓存的 Self Forcing 中,这些历史 K/V 条目被视为被截断的 rollout 状态。因此,未来损失不会监督产生这些条目的 tctx=0 计算,从而为自生成潜变量如何被编码到 K/V 记忆中留下了一个缺失的监督路径。虽然保持串行历史 K/V 缓存完全可微在理论上可以弥合这一缺口,但这对于长时域自 rollout 来说是不切实际的,因为反向图会随着 rollout 长度增长,导致严重的内存瓶颈。
为了解决这个问题,作者引入了自梯度强制(SGF),它恢复了缺失的记忆写入监督,而无需通过完整的自 rollout 打开一个循环 autograd 图。SGF 可以通过一种等效的 Self Forcing 双阶段视角来理解。
在第一阶段,模型执行普通的无梯度自 rollout,并记录一个采样的退出状态。在第二阶段,SGF 并行地重建对应的因果计算。与冻结缓存的 Self Forcing 将重建的上下文 K/V 路径视为被截断的记忆不同,SGF 移除了该路径上的停止梯度边界。上下文潜变量 X~ctx 本身保持为停止梯度输入,确保采样的 rollout 轨迹不被优化。然而,模型在 tctx=0 时重新编码这些固定的自生成潜变量,并且当未来的目标 token 关注它们时,生成的 K/V 条目保持可微。这使得未来的分布匹配蒸馏损失能够同时监督目标端去噪和干净上下文 K/V 写入:
∇θLDMD(X^tar)⊃∂KVctxrec∂LDMD∂θ∂KVctxrec.第二阶段的重建旨在恢复第一阶段采样的退出计算。通过确定性层、匹配的位置索引和相同的因果重建几何结构,重建的目标 X^tar 在理论上与记录的预测上下文潜变量相同。这种双阶段设计避免了直接可微缓存的内存爆炸,因为第一阶段是串行但无梯度的,而第二阶段是梯度启用的,但具有固定窗口和并行性。
对于逐帧流式生成,作者采用了 sink-plus-FIFO 上下文策略。他们维护一个固定的 sink 前缀和一个包含最近潜变量的 FIFO 窗口,以隔离 SGF 而非上下文选择的影响。对于视频 VAE,使用特定的 sink 潜变量来保留由其非对称分组模式引起的时序边界前缀。
实验
评估将所有模型在 5 秒窗口上训练,并测试 60 秒和 240 秒的原生外推能力,在相同的提示、种子和推理几何结构下,将 SGF 与匹配的 Self Forcing 基线进行比较。SGF 持续改善长时域质量和一致性,减少了身份漂移和背景变化等漂移伪影,并明显受到人类评估者的偏好。训练开销适中,这证实了使用梯度学习重建自生成上下文能够产生更稳定的长视频记忆,而不会牺牲短时域性能。
在 60 秒和 240 秒的逐帧生成中,SGF 在质量和一致性指标上始终优于匹配的 Self Forcing 基线,特别是在美学质量、背景一致性、成像质量、运动平滑度和主体一致性方面有显著提升。动态程度是主要的例外,Self Forcing 可以获得更高的分数,但这与场景跳跃、相机几何结构破坏和物体变形等不连贯的运动伪影有关,而非更好的运动质量。SGF 在所有初始化和两种时域长度下,都产生了更高的美学质量、背景一致性、成像质量、运动平滑度和主体一致性。Self Forcing 通常获得更高的动态程度,但这种提升归因于身份漂移、裁剪漂移和布局变化等破坏性伪影,这些伪影在不提升感知运动质量的情况下夸大了该指标。
对于 60 秒的逐块视频生成,SGF 在大多数质量和一致性指标上持续优于 Self Forcing,包括美学质量、背景一致性和主体一致性。唯一的例外是动态程度,Self Forcing 得分更高,但定性分析将其归因于不连贯的运动伪影,而非真正的运动质量。在 TF 初始化下,SGF 在美学质量、背景一致性和主体一致性方面均优于 Self Forcing,主体一致性从 0.951 提升到 0.982。Self Forcing 获得了更高的动态程度(TF 初始化下为 0.909 对比 0.634),但这一优势是由场景跳跃、相机破坏和物体变形驱动的,这些因素夸大了表观运动。
一项盲测偏好研究表明,评估者持续偏好 SGF 而非 Self Forcing 用于长时域视频生成,所有 GSB 分数均为正。这一优势在 TF 初始化下最为显著,其中 240 秒的逐帧生成达到了最高偏好度。更长的时域通常会增强对 SGF 的偏好,反映了其改善的时序稳定性。所有 GSB 分数均为正,表明在测试的每种设置和时域下,对 SGF 的偏好是一致的。TF 初始化产生了对 SGF 最强的偏好,尤其是在更长时域的逐帧生成中。与 60 秒生成相比,更长的时域(240 秒)倾向于增加偏好差距。对于相同的初始化,逐块生成显示的偏好分数略低于逐帧生成,但偏好仍然显然是正面的。
通过 SGF 进行上下文梯度恢复的训练是可行的,这与直接通过 KV 缓存进行微分不同,后者会导致内存耗尽。SGF 带来了适度的峰值内存增加和轻微的运行时开销,但实际上减少了稳定内存占用。双阶段设计隔离了梯度计算,防止了可微缓存的循环内存爆炸。启用整个历史 KV 缓存的梯度会耗尽内存,而 SGF 成功完成了训练。相对于冻结缓存的 Self Forcing,SGF 将峰值内存提高了约 10%,但将稳定内存降低了约 19%。每五个训练步骤的实际时间增加了约 13%,这是一个适度的开销。SGF 将梯度计算限制在无梯度的第一阶段 rollout 之后的并行第二阶段重建中,避免了在直接可微缓存训练中导致内存不足的串行缓存形成图。
评估将 SGF 与 Self Forcing 在短时域和长时域下的逐帧和逐块视频生成中进行了比较,使用了自动质量指标和盲测人类偏好。SGF 持续产生更高的美学质量、背景一致性和主体一致性,并受到评估者的偏好,这一优势在更长时域下更大。Self Forcing 有时得分更高的唯一指标是动态程度,这是由场景跳跃和物体变形等不连贯伪影驱动的,而非真正的运动质量,而 SGF 的训练方法以适度的内存和时间开销实现了基于梯度的上下文恢复,避免了完全可微缓存的内存爆炸。