Command Palette
Search for a command to run...
DuoMatching:面向少步视频生成的联合-边缘分布匹配
DuoMatching:面向少步视频生成的联合-边缘分布匹配
Jiahao Zhan Yan Wang Yongrui Ma Qunliang Xing Ruchang Yao Runtao Liu Shijie Zhao Tianfan Xue
摘要
流式视频生成已经受益于分布匹配蒸馏(DMD),该方法将视频帧的联合分布与视频教师对真实视频分布的近似相匹配。尽管这种联合匹配缓解了自回归推演过程中的漂移,但在视觉质量和语义对齐方面仍然存在局限。为了解决这些局限,我们提出了 DuoMatching,这是一个通过统一的联合-边缘分布形式来近似真实视频分布的分布匹配框架。在现有联合分布匹配形式的基础上,额外的边缘分布匹配目标从图像生成器提供专门的帧级监督,从而迁移其互补的视觉和语义先验。为了在视频生成中应用这种帧级监督,我们引入了 LatentBridge,以解决视频学生模型与图像教师模型之间潜在表示不匹配的问题。Latent Variation Sampling 进一步将此类帧级监督分布到不同时间片段,从而减少冗余。实验表明,DuoMatching 改善了视觉质量、构图和语义对齐,同时基本保持了运动动态。人工评估显示,相较于所有被评估基线,其总体偏好率超过 80%。
一句话总结
来自 MMLab、香港中文大学、字节跳动、香港科技大学和 InnoHK 旗下 CPII 的研究者提出了 DuoMatching,这是一个用于少步视频生成的联合-边缘分布匹配框架,通过 LatentBridge 增加帧级图像教师模型监督,以解决潜在表示不匹配,并通过 Latent Variation Sampling 减少时间冗余,从而提升视觉质量、构图和语义对齐,同时保持运动动态,并在人类偏好评估中相对所评基线取得超过 80% 的偏好率。
核心贡献
- DuoMatching 是一个统一的联合-边缘分布匹配框架,用于少步视频生成,在现有联合视频分布匹配的基础上增加来自图像教师模型的帧级监督。
- 在 DuoMatching 中,LatentBridge 解决视频学生模型与图像教师模型之间的潜在表示不匹配,而 Latent Variation Sampling 将边缘监督分配到不同的时间段,以减少冗余。
- 实验表明,在因果和双向生成中,细粒度视觉质量、视觉构图和语义对齐均有提升,同时基本保持时间质量;人类评估报告相对所有被评估基线,总体偏好率超过 80%。
引言
近期视频生成模型取得了较强的视觉质量和时间连贯性,但需要大量顺序去噪步骤,限制了交互式世界模拟和数字娱乐等实时应用。分布匹配蒸馏将多步扩散或流模型压缩为少步生成器,但现有联合 DMD 方法主要匹配完整视频分布,并未显式监督单帧分布。这导致细粒度外观和语义对齐方面存在不足。作者提出 DuoMatching,一个统一的联合-边缘分布匹配框架,将基于视频教师模型的联合 DMD 与基于图像教师模型的边缘 DMD 相结合,以加强帧级监督。此外还引入 LatentBridge 解决时间压缩视频隐空间的不匹配问题,并引入 Latent Variation Sampling 减少冗余监督。实验表明视觉质量、构图和语义对齐得到改善,同时基本保持时间动态。
方法
作者将视频生成形式化为分布匹配问题,目标是使生成器的输出分布与真实数据分布对齐。由于真实分布的分数不可得,先前工作使用预训练视频教师模型来近似它,从而得到联合分布匹配目标。在该设置中,每个 latent 切片的分数都以所有其他切片为条件。因此,如果对单个帧的改进会引入与相邻帧的不一致,就可能被抑制。如下图所示,仅依赖联合匹配会导致视觉质量和语义对齐方面的局限,例如生成帧中缺失细粒度细节。
为克服这些局限,作者提出 DuoMatching,一个从联合和边缘两个视角重新构建分布匹配的统一框架。该框架保留视频教师模型,通过联合匹配约束跨帧依赖关系,同时引入图像教师模型提供直接的帧级边缘监督。组合目标在视频教师模型的联合分布估计与图像教师模型的互补边缘估计之间取得平衡。
利用图像教师模型的一个关键挑战是视频与图像隐空间之间的结构不匹配。视频 VAE 通常采用时间压缩,将单个 latent 切片映射到多个 RGB 帧,而图像 VAE 将单个 latent 映射到单帧。为解决该问题,作者引入 LatentBridge,一个轻量可微模块。如框架图所示,LatentBridge 将视频 latent 切片在前一 latent 切片和特定局部帧索引的条件下映射到图像教师模型隐空间中的逐帧表示。该模块使用成对的视频和图像 latent 以 L1 重建损失进行预训练,使边缘匹配目标的梯度能够高效传播到学生生成器。
为进一步优化边缘匹配过程,作者设计了 Latent Variation Sampling。对随机采样的帧进行监督可能在缓慢变化区域导致冗余计算,并可能抑制运动动态。该采样策略改为计算相邻干净视频 latent 切片之间的均方差异来衡量时间变化。序列根据变化最大的位置被划分为连续片段。通过从每个片段均匀采样一个 latent 切片,该方法确保有限监督预算分布在不同时间区域,从而改善时间覆盖并减少帧级监督的冗余。
实验
实验评估了使用 DMD 训练的因果和双向视频生成模型,在匹配的推理预算下将 DuoMatching 与自回归和双向基线进行比较。VBench 和人类偏好测试结果表明,DuoMatching 提升了视觉质量、语义对齐和构图,同时保持运动质量,且没有额外推理成本。消融实验证实,显式边缘匹配、更强的图像教师先验(如 Qwen-Image)以及 LatentBridge 对这些提升有贡献,并且 latent variation sampling 比均匀采样或分层采样更有效地分配帧级监督。
在双向全视频生成和因果自回归生成中,DuoMatching 相对匹配基线均提升了整体 VBench 表现。在双向模式下,语义、美学、成像和动态得分均有提升,而平滑度几乎不变。在因果模式下,它提升了视觉质量和语义对齐,同时基本保持运动质量,且不增加推理计算。在匹配 NFE 的双向全视频生成中,DuoMatching 在总分上优于 CausVid,并在语义、美学、成像和动态指标上有所提升,平滑度相近。在因果自回归生成中,DuoMatching 在一步、两步和四步设置下均获得更高的视频生成质量,在视觉质量和语义对齐方面提升明显,同时运动质量基本保持。所有报告提升均无需增加推理计算,从而保持了因果基线的实时生成能力。
在所有基线对比中,DuoMatching 在整体质量上均更受偏好,每项配对中的总体偏好率都超过 80%。其优势主要集中在视觉质量和语义对齐,而时间和运动偏好在接近或高于持平水平,表明运动质量基本得到保持。总体偏好率明显偏向 DuoMatching,且相对每个基线均有清晰优势。视觉质量和语义对齐偏好始终偏向 DuoMatching,而时间和运动偏好保持接近或高于持平水平。
使用 Wan2.1-14B 作为图像教师模型时,所有报告的视频学生指标均优于无教师基线。在 SDXL、FLUX.2-4B 和 Qwen-Image 中,教师 HPSv3 分数越高,语义、美学和成像得分越一致地提升,而动态程度和运动平滑度保持相对稳定。Qwen-Image 在所比较的图像教师模型中取得最强的语义、美学、成像和总分结果。与无教师基线相比,Wan2.1-14B 作为图像教师模型提升了所有报告指标。对于 SDXL、FLUX.2-4B 和 Qwen-Image,更高的教师 HPSv3 分数与语义、美学和成像得分的一致提升相对应,而动态程度和运动平滑度保持相对稳定。
启用带直接 latent 映射的边缘 DMD 可提升语义和视觉质量,但会显著降低动态质量。LatentBridge 恢复动态质量,同时进一步提升语义和成像得分,并且相比直接基线仅小幅增加内存。在本文训练配置下,Decode-Encode 因内存不足而不可行。将边缘 DMD 直接应用于时间压缩视频 latent,相比无边缘 DMD 基线可提升语义和成像得分,但会降低动态得分。LatentBridge 在可行配置中取得最佳语义和成像结果,同时基本保持动态质量。Decode-Encode 会出现内存不足,而 LatentBridge 相比 Direct 基线仅增加很小的峰值内存开销。
将采样的 latent 切片数量从 2 增加到 4,会提高均匀随机采样和 Latent Variation Sampling 的总分,但进一步增加到 8 会降低动态得分和总分。在所有测试的切片数量下,Latent Variation Sampling 始终优于均匀随机采样,并且在四个切片时也超过时间分层采样。结果表明,适中的切片数量配合 Latent Variation Sampling 能更好地平衡时间质量和整体性能,同时限制计算成本。在所有测试采样策略中,Latent Variation Sampling 在 K=4 时取得最高的动态得分和总分。将 K 从 2 提高到 4 会提升总分,而将 K 提高到 8 会降低动态得分和总分。在每个测试 K 值下,均匀随机采样均落后于 Latent Variation Sampling。在 K=4 时,时间分层采样在动态和总分指标上介于均匀随机采样和 Latent Variation Sampling 之间。
实验在双向全视频生成和因果自回归生成中评估了 DuoMatching,结果显示视觉质量和语义对齐持续提升,同时保持时间平滑度和推理成本不变,人类评估也证实了明显的整体偏好和运动质量持平。额外消融验证了使用 Wan2.1-14B 作为图像教师模型可改善各基线下的学生指标,并且用 LatentBridge 替代直接边缘 DMD 可恢复动态质量,同时提升语义和成像得分,且仅带来适度的内存开销。最后,在 Latent Variation Sampling 下使用适中的 latent 切片数量,尤其是四个切片,相比均匀采样或分层采样,能在时间质量和整体性能之间取得最佳平衡。