HyperAIHyperAI

Command Palette

Search for a command to run...

DynamiCrafter:基于视频扩散先验的开放域图像动画生成

Jinbo Xing Menghan Xia Yong Zhang Haoxin Chen Wangbo Yu Hanyuan Liu Xintao Wang Tien-Tsin Wong Ying Shan

一键部署 DynamiCrafter

跳转至 Notebook

摘要

为静态图像赋予动态效果能够带来引人入胜的视觉体验。传统的图像动画技术主要聚焦于具有随机动态的自然场景(如云和流体)或特定领域的运动(如人的头发或身体动作),因而限制了其对更广泛视觉内容的适用性。为克服这一局限,我们探索了为开放域图像合成动态内容,将其转换为动画视频。核心思路是利用文本到视频扩散模型的运动先验,将图像作为引导融入生成过程。给定一张图像,我们首先使用一个查询变换器将其投影到一个与文本对齐的丰富上下文表示空间中,这有助于视频模型以兼容的方式理解图像内容。然而,生成的视频中仍难以保留部分视觉细节。为补充更精确的图像信息,我们进一步将完整图像与初始噪声拼接后馈入扩散模型。实验结果表明,我们提出的方法能够生成视觉上令人信服、逻辑更自然合理的运动,并与输入图像保持更高的一致性。对比评估证明了我们的方法相较于现有方案具有显著优势。

一句话总结

DynamiCrafter 由香港中文大学、腾讯 AI Lab 和北京大学的研究者提出,利用文本到视频扩散先验为开放域图像注入动态:通过 query transformer 将输入图像投影到文本对齐的上下文表征,并将完整图像与初始噪声拼接以保留细节,从而生成视觉上具有说服力且与原始图像高度保真的动态效果。

核心贡献

  • DynamiCrafter 利用预训练文本到视频扩散模型的运动先验来为开放域图像注入动态,突破了此前方法被限制在狭窄领域内的局限。
  • 提出双流图像注入机制:query transformer 将静态图像投影到文本对齐的上下文表征,同时将完整图像与初始噪声拼接以保留精细视觉细节。
  • 实验结果表明,生成的视频具有更合理自然的运动、更高的输入图像一致性,并显著优于现有方法。

引言

作者致力于解决将静态图像转化为具有自然运动且保留原始视觉细节的视频这一问题,该任务在叙事、内容创作和视觉特效等应用中具有重要价值。现有方法大多局限于狭窄的物体类别或简单的往复运动,而近期的文本到视频扩散模型在基于图像条件时,由于图像注入策略不当,要么丢失细节,要么产生时序不连贯的运动。主要贡献是 DynamiCrafter 框架,该框架引入双流图像条件机制,将用于语义理解的文本对齐上下文特征与直接视觉细节通路相结合,使预训练视频扩散模型能够为开放域图像生成生动且细节一致的动画,并进一步探索了基于文本的运动控制。

数据集

作者专门构建了一个数据集,用于以解耦方式训练文本对运动的控制。该数据集来源于 WebVid10M 数据集,经过筛选和重新标注得到。

  • 来源:WebVid10M 视频-描述数据集。
  • 筛选与重新标注:原始描述经过筛选和重写,使其包含更纯粹的运动和动态描述,而非大量的场景描述。例如,描述可能被简化为“男子做俯卧撑”。
  • 构成:最终数据集包含重点关注动作和运动的描述,以及诸如“human”等类别标签。未提供明确的数据规模或划分细节,但该数据集是 WebVid10M 的一个经过处理后的子集。
  • 目的与用途:该数据集以解耦方式用于训练一个名为 DynamiCrafterDCP 的变体。在该训练中,图像条件已提供场景上下文,因此文本输入被专门设计用于传递运动/动作信息。这种解耦使模型在生成动态时具有更强的文本控制能力。
  • 处理过程:主要处理步骤是重新标注阶段,该阶段剥离了场景描述并强调用词突出动态,文中未提及除描述优化之外的额外裁剪或元数据构建。

方法

作者旨在为静态图像注入动态,生成一段既继承视觉内容又展现自然动态的短视频。他们将此建模为图像条件视频生成任务,并利用预训练视频扩散模型的生成先验来解决。

预备知识:视频扩散模型 扩散模型定义了一个将数据转化为高斯噪声的前向过程,并学习通过去噪来逆转该过程。去噪网络由以下目标函数监督:

minθEt,xpdata,ϵN(0,I)ϵϵθ(xt,t)22\min_{\boldsymbol{\theta}} \mathbb{E}_{t, \mathbf{x} \sim p_{\mathrm{data}}, \boldsymbol{\epsilon} \sim \mathcal{N}(\mathbf{0}, \mathbf{I})} \| \boldsymbol{\epsilon} - \boldsymbol{\epsilon}_{\boldsymbol{\theta}}(\mathbf{x}_t, t) \|_2^2θminEt,xpdata,ϵN(0,I)ϵϵθ(xt,t)22

对于视频生成,通常使用潜在扩散模型(LDM)来降低计算复杂度。作者基于开源视频潜在扩散模型 VideoCrafter 进行研究。视频首先被逐帧编码为潜在表征。前向扩散和反向去噪过程均在该潜在空间中执行,生成的视频通过解码器获得。

基于视频扩散先验的图像动态生成 为了利用文本到视频(T2V)生成先验为静态图像注入动态,需要将视觉信息全面地注入视频生成过程。既要理解图像以获取上下文,又要保留视觉细节。作者提出了一种双流条件图像注入范式,由文本对齐上下文表征和视觉细节引导构成。参见框架图:

文本对齐上下文表征。 为了利用图像上下文引导视频生成,作者将图像投影到文本对齐的嵌入空间。采用 CLIP 图像编码器提取图像特征。不使用单一的全局语义 token,而是使用 CLIP 图像 ViT 最后一层的完整视觉 token,以捕获更丰富的信息。一个可学习的轻量模型 P\mathcal{P}P 采用 query transformer 架构,包含堆叠的交叉注意力和前馈网络,将这些视觉 token 转化为最终的上下文表征 Fctx=P(Fvis)\mathbf{F}_{\mathrm{ctx}} = \mathcal{P}(\mathbf{F}_{\mathrm{vis}})Fctx=P(Fvis)

文本嵌入 Ftxt\mathbf{F}_{\mathrm{txt}}Ftxt 和上下文嵌入 Fctx\mathbf{F}_{\mathrm{ctx}}Fctx 通过双交叉注意力层与 U-Net 中间特征 Fin\mathbf{F}_{\mathrm{in}}Fin 交互:

Fout=Softmax(QKtxtd)Vtxt+λSoftmax(QKctxd)Vctx\mathbf{F}_{\text{out}} = \operatorname{Softmax}(\frac{\mathbf{Q}\mathbf{K}_{\mathrm{txt}}^\top}{\sqrt{d}})\mathbf{V}_{\mathrm{txt}} + \lambda \cdot \operatorname{Softmax}(\frac{\mathbf{Q}\mathbf{K}_{\mathrm{ctx}}^\top}{\sqrt{d}})\mathbf{V}_{\mathrm{ctx}}Fout=Softmax(dQKtxt)Vtxt+λSoftmax(dQKctx)Vctx

其中 λ\lambdaλ 是融合文本条件和图像条件特征的系数,通过 tanh 门控实现,并对每一层可自适应学习。

不同层的学习系数表明,图像信息对两端层的影响比中间层更大。在中间层增加 λ\lambdaλ 会抑制跨帧运动,而减小 λ\lambdaλ 则对形状保持构成挑战。如下图所示:

视觉细节引导(VDG)。 虽然丰富的上下文表征使模型能够生成与输入图像相似的视频,但由于 CLIP 编码器充分保留输入细节的能力有限,可能会出现微小差异。为增强视觉一致性,作者将条件图像与逐帧初始噪声拼接,并馈入去噪 U-Net 作为引导。这使得模型能够互补地整合全局上下文和局部细节。

即使有了丰富的上下文表征,文本提示仍然是必要的。上下文表征所携带的信息比文本嵌入更广泛,这可能使 T2V 模型负担过重并导致形状失真。额外的文本提示提供了本地的全局上下文,帮助模型高效利用图像信息。如下图所示:

训练范式 条件图像通过两个互补的流进行整合。为协同调节它们,作者设计了一个包含三个阶段的专门训练策略:

  1. 基于轻量级文本到图像(T2I)模型训练图像上下文表征网络 P\mathcal{P}P,使其专注于图像上下文学习。
  2. 通过联合训练 P\mathcal{P}P 和 T2V 模型的空间层,将 P\mathcal{P}P 适配到 T2V 模型。
  3. 结合 VDG 进行联合微调,将输入图像与逐帧噪声拼接。仅微调 P\mathcal{P}P 和空间层,以避免破坏预训练的时间先验知识。训练时,随机选取一帧作为图像条件,防止模型走捷径学习,并确保上下文表征的灵活性。

使用文本进行运动控制 由于图像可能对应多种潜在的动态,文本可以引导动态内容的生成。然而,现有数据集常常将场景描述与运动描述混合在一起。对于图像动画任务,场景描述已包含在图像条件中,因此运动描述应作为文本条件进行解耦训练。

为此,作者通过筛选和重新标注 WebVid10M 数据集构建了一个数据集。该过程包括滤除相机运动、确保描述与视频对齐、移除图形或 CGI,然后使用 GPT-4 提取动态用词和类别。如下图所示:

最终数据集包含具有更纯粹动态用词的描述。在此数据集上训练模型可以改善文本对动态的控制,与其他方法相比,模型能够更有效地响应特定运动提示。如下图所示:

实验

评估设置采用双流注入视频扩散先验,在 WebVid-10M 上训练,并在 UCF-101 和 MSR-VTT 上使用 FVD、KVD 以及一个新的感知一致性指标进行测试。与开源和商业方法的定性比较表明,DynamiCrafter 实现了更好的时序一致性、运动质量和输入图像视觉保真度,同时用户研究证实了其在运动质量和一致性方面的优越性。消融研究验证了上下文流和细节流、自适应门控以及分阶段训练范式对于生成连贯动画都至关重要,且该框架可扩展到叙事生成、循环视频和帧插值等任务。

所提方法在 UCF-101 和 MSR-VTT 上的零样本 FVD 和 PIC 指标上优于 VideoComposer 和 I2VGen-XL,在视频质量和感知一致性方面取得了大幅提升。双流图像注入设计推动了这一改进,但在 UCF-101 上 KVD 略高于 I2VGen-XL。在 MSR-VTT 上,该方法也取得了最佳的 KVD。在 UCF-101 上,与次优竞争对手相比,FVD 降低了超过 140 点,PIC 提高了超过 0.076;在 MSR-VTT 上的提升也相当显著。在 UCF-101 上,KVD 略高于 I2VGen-XL,但在 MSR-VTT 上该方法取得了最低的 KVD,优于所有竞争对手。

所提方法在运动质量、时序一致性和输入一致性方面大幅优于所有开源基线。其实现的时序一致性和输入一致性与商业产品相当,同时运动质量明显优于任何对比系统。用户研究证实,其运动质量相较于闭源和开源替代方案均具有明显优势。该方法的运动质量偏好度最高(38.84%),超过了商业产品 PikaLabs(28.60%)和 Gen-2(22.91%)。输入一致性与 PikaLabs 相当(79.88% 对比 79.07%),并远超得分低于 19% 的开源方法。

完整方法平衡了时序一致性和视觉保真度。移除上下文注入流会严重损害 FVD 和 PIC,而排除视觉细节引导流虽然改善了 FVD 和 PIC,但代价是形状失真和运动受限。在整个 T2V 模型上训练或仅以第一帧为条件会进一步损害稳定性和一致性。消融上下文流导致 FVD 大幅上升和 PIC 下降,反映出严重的时序不一致。移除视觉细节引导流获得了最佳的 FVD 和 PIC,但导致形状失真和运动微弱。省略自适应门控使 FVD 和 PIC 略有恶化,产生抖动和不自然的运动。用单一的全局 CLIP token 替换完整视觉 token 会大幅提高 FVD,同时保持 PIC 相似,仅提供语义相似性。微调整个 T2V 模型使 FVD 飙升至 364.11,并破坏了训练稳定性。仅以第一帧为条件会同时损害 FVD 和 PIC,导致内容突变效应。

该方法通过在 UCF-101 和 MSR-VTT 上的零样本视频生成、与开源和商业系统的对比用户研究,以及对其组件的消融实验进行评估。在视频质量和感知一致性上,它相较于竞争对手取得了明显提升,运动质量甚至超越了商业产品,输入保真度与之相当。双流图像注入设计至关重要,因为移除上下文注入会损害时序一致性,而省略视觉细节引导尽管改善了指标,但会导致形状失真,从而证实完整模型最佳地平衡了时序一致性和视觉保真度。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供