HyperAIHyperAI

Command Palette

Search for a command to run...

Vera:一种面向内容保持视频编辑的分层扩散模型

Hongkai Zheng Ta-Ying Cheng Benjamin Klein Yisong Yue Zhuoning Yuan

摘要

视频扩散模型在视频生成与编辑方面取得了显著进展。然而,内容保持仍是一项核心挑战:现有方法重新生成每一个像素,往往会改变本应保持不变的元素,例如人物或背景场景。我们提出 Vera,一个用于内容保持视频编辑的分层扩散框架。Vera 并非重新生成整个视频,而是生成一个编辑图层及其对应的 alpha 遮罩,用于与源视频合成,从而在机制上将创意编辑与内容保持分离开来。为促进与源视频的协调合成,我们将文本到视频的 DiT 扩展为混合 Transformer(Mixture-of-Transformers, MoT)架构,为每一层使用独立的 DiT,并通过联合自注意力进行交互。为支持 Vera 的训练,我们进一步构建了一个高质量的分层数据集,该数据集具备精确的 alpha 遮罩、多样的场景与动态以及视觉效果。在我们的定量基准测试和人类偏好研究中,Vera 在内容保持方面优于领先的开源视频编辑模型,同时在编辑质量上保持竞争力,仅使用了 486K 帧的分层训练数据。

一句话总结

加州理工学院和 Netflix 的研究人员提出了 Vera,一种分层视频扩散模型,通过生成编辑层和 alpha 遮罩并将其合成到源视频上来保留内容,采用 Mixture-of-Transformers 架构,在独立的 DiT 之间进行联合自注意力,在 486K 帧的分层数据集上训练,并且在内容保留方面优于领先的开源视频编辑模型,同时在编辑质量上保持竞争力。

核心贡献

  • Vera 引入了一个分层扩散框架,该框架生成编辑层和 alpha 遮罩,用于与源视频合成,将创意编辑与内容保留分离开来。
  • 文本到视频的 DiT 被扩展为 Mixture-of-Transformers 架构,其中每层的独立 DiT 通过联合自注意力交互,以促进连贯的合成。
  • 构建了一个高质量的分层数据集,具有精确的 alpha 遮罩、多样化的场景和视觉效果,使用了 486K 帧的训练数据;Vera 在内容保留方面优于领先的开源视频编辑模型,同时在编辑质量上保持竞争力。

引言

近期文本到视频扩散模型的突破推动了可控视频编辑的快速发展,但一个持续的障碍是内容保留编辑:即使是对背景区域的微小意外更改也可能破坏编辑并损害用户信任。现有的方法如区域约束和掩码条件仍然在端到端扩散范式内运行,这会重新生成整个视频,并可能对应该严格保留的区域引入细微更改,同时无法提供迭代制作工作流所需的分层资产。以独立的 RGBA 层形式生成编辑的分层方法将自然而然地保留原始视频,但将其应用于视频编辑会引入新的挑战:编辑层和 alpha 遮罩必须精确对齐,必须匹配源视频的相机运动、光照和空间布局,并且必须处理复杂的跨层交互,如阴影和反射,这些是以前的分层生成工作未解决的。作者提出了 Vera,一个分层扩散框架,联合生成编辑层、alpha 遮罩和合成视频,使用 Mixture-of-Transformers 架构与跨层联合自注意力,以及精心策划的分层数据集,以实现忠实的内容保留和自然的合成。

数据集

作者从开源视频中构建了一个分层视频编辑数据集,结合了手动标注和自动生成工具。该数据集旨在训练模型以完成背景更改和物体添加等任务。

总体组成和规模

  • 总共 486K 帧,分辨率均为 832 × 480。
  • 大约 6K 个样本,每个样本是四个视频的元组(输入、编辑层、alpha 遮罩、合成),每个视频 81 帧。
  • 大约 60–70% 的过滤后源视频通过该流程生成了可用的样本。

子集划分

  1. 合成合成物(物体添加和背景更改)

    • 来源:VideoMatte240K,提供精细细节(如头发)的高质量 alpha 遮罩。
    • 处理:通过修复模型生成合成背景,并与前景遮罩合成。
    • 特点:提供精确的 alpha 监督;仅限于使用静态、居中摄像机拍摄的人体主体。
  2. 真实单物体视频(物体添加和背景更改)

    • 来源:来自 Pexels 和 Mixkit 的真实世界视频。
    • 处理:一个多阶段流程,将分割、视频抠图、视频修复、生成和人工标注/过滤串联起来。
    • 特点:引入多样化的场景和动态摄像机运动;通常包含一个显著的主体,视觉效果很少。
  3. 带效果的真实多物体视频(仅物体添加)

    • 来源:通过扩展单物体流程,增加了额外的 omnimatte 优化步骤和 alpha 遮罩筛选。
    • 特点:在具有丰富动态的复杂场景中,呈现多个物体及其相关效果(阴影、反射)。仅为物体添加任务提供数据。

数据使用方式

  • 该数据集作为论文提出的模型的训练数据。
  • 合成子集为两个任务提供精确的 alpha 监督。
  • 真实单物体子集为背景更改和物体添加提供训练数据。
  • 多物体子集仅用于物体添加训练。
  • 没有详细说明明确的训练划分或混合比例;作者依赖这些互补子集来覆盖日益复杂的层次。

方法

作者通过将源视频 VsrcV_{\text{src}}Vsrc 表示为保留内容 VpreservedV_{\text{preserved}}Vpreserved 和非保留内容的组合,并由 alpha 遮罩 AeditA_{\text{edit}}Aedit 控制,来解决内容保留的视频编辑问题。给定源视频和条件信号 CCC,目标是生成编辑层 VeditV_{\text{edit}}Vedit 及其对应的 alpha 遮罩。最终输出视频合成如下:

Vcomposite=(1Aedit)Vpreserved+AeditVeditV_{\text{composite}} = (1 - A_{\text{edit}}) \circ V_{\text{preserved}} + A_{\text{edit}} \circ V_{\text{edit}}Vcomposite=(1Aedit)Vpreserved+AeditVedit

在具有最小半透明度的区域中,保留内容可以很好地近似为源视频(VpreservedVsrcV_{\text{preserved}} \approx V_{\text{src}}VpreservedVsrc)。这种分层表示明确地将创意编辑生成与内容保留分离开来。

为了建模这一点,作者利用扩散模型学习联合条件分布 p(Vedit,Aedit,VcompositeVsrc,C)p(V_{\text{edit}}, A_{\text{edit}}, V_{\text{composite}} \mid V_{\text{src}}, C)p(Vedit,Aedit,VcompositeVsrc,C)。他们选择生成合成视频而不是直接生成保留内容,因为合成视频共享自然视频的分布,与预训练的视频生成模型更一致。保留内容随后可以恢复。该模型实现为潜在扩散模型,其中所有视频使用 Wan2.1 VAE 编码到潜在空间。alpha 遮罩序列被视为具有相同 RGB 通道的视频。使用流匹配参数化,神经网络以源潜在变量 ZsrcZ_{\text{src}}Zsrc 和条件 CCC 作为输入,联合预测所有层的速度场:uθ=[uθ;edit,uθ;alpha,uθ;composite]u_{\theta} = [u_{\theta;\text{edit}}, u_{\theta;\text{alpha}}, u_{\theta;\text{composite}}]uθ=[uθ;edit,uθ;alpha,uθ;composite]。训练目标定义为:

LFM=Et,C,Zsrc,Z1,Z0uθ(Zt;t,C,Zsrc)(Z1Z0)22\mathcal{L}_{\text{FM}} = \mathbb{E}_{t, C, Z_{\text{src}}, Z_1, Z_0} \| u_{\theta}(Z_t; t, C, Z_{\text{src}}) - (Z_1 - Z_0) \|_2^2LFM=Et,C,Zsrc,Z1,Z0uθ(Zt;t,C,Zsrc)(Z1Z0)22

其中 Z0N(0,I)Z_0 \sim \mathcal{N}(0, I)Z0N(0,I)Z1=[Zedit,Zalpha,Zcomposite]Z_1 = [Z_{\text{edit}}, Z_{\text{alpha}}, Z_{\text{composite}}]Z1=[Zedit,Zalpha,Zcomposite]t[0,1]t \in [0, 1]t[0,1]Zt=tZ1+(1t)Z0Z_t = t Z_1 + (1 - t) Z_0Zt=tZ1+(1t)Z0

一个关键的设计挑战是编辑层、alpha 遮罩和合成视频具有截然不同的分布。单个共享的 transformer 将难以高效地调和这些差异。为了克服这一点,作者采用了 Mixture-of-Transformers 框架,利用三个独立的 DiT,通过联合自注意力进行交互。

如上图所示,与标准的微调或基于适配器的方法不同,所提出的架构为每个输出层分配一个专用的 DiT 块。虽然每个 DiT 保持自己的 QKV 投影和前馈网络权重,但来自所有三个分支的 token 被连接成一个序列进行自注意力操作。这使得跨层交互成为可能,同时允许每个分支专攻其特定的分布。所有三个 DiT 都从同一个预训练的文本到视频模型初始化。为了纳入条件输入,为输入视频和可选的掩码视频引入了两个额外的补丁嵌入层。源视频 token 被添加到合成 token 中,掩码 token 被添加到带噪的 alpha token 中。所有层 token 共享相同的位置编码,并为零初始化的可学习嵌入添加到 alpha 和合成 token 中,以区分不同层。

由于没有公开数据集提供合适的层次化视频编辑数据,作者从开源视频中构建了一个自定义的分层数据集。

该数据集包含大约 6,000 个样本,每个样本包含一个输入视频以及三个输出层,分辨率为 832x480,81 帧。数据被分类为复杂度递增的互补子集,包括合成合成物、真实单物体视频以及带有阴影和反射等视觉效果的真实多物体视频。

如上图所示,数据构建流程包括多阶段过程,涉及分割、视频抠图、修复和人工标注。对于物体添加,该流程使用 omnimatte 优化提取单个物体及其效果。对于背景更改,它利用修复和重新合成技术生成多样化的合成背景或移除现有物体以创建干净的编辑层。这些精心策划的数据使模型能够学习高质量分层视频编辑所需的复杂交互。

实验

Vera 在背景更改和物体添加上的评估表明,其分层编辑设计在内容保留方面显著优于现有的视频到视频方法,同时在合成质量和指令遵循方面保持竞争力。消融研究将此归因于分层范式、合成分支、Mixture-of-Transformers 架构以及多样化训练数据的使用。定性上,Vera 避免了常见的失败模式,例如扭曲本应保持不变的区域,并且人类偏好研究证实了用户对其输出的强烈偏好。

Vera 在背景更改和物体添加任务上,在内容保留方面显著优于所有现有方法,PSNR 增益超过 3 dB,并且结构误差和感知误差大幅降低。传统的视频质量指标 OC 和 TF 几乎饱和,无法区分方法。基于 VLM 的合成指标揭示了更细致的排名,VACE 在背景更改上领先,Vera 排名第二。Vera-1.3B 在物体添加上的 PSNR 比最强基线高 6.3 dB,并将 LPIPS 和结构误差减少了一半以上。Vera-14B 在物体添加上的 PSNR 优势进一步扩大到 7.1 dB。在背景更改上,VACE 实现了最高的 VLM 评判合成得分(CS、CT、IS),而 Vera 排名第二。OC 和 TF 指标在大多数模型上几乎相同,无法捕捉视频质量的差异。

与标准视频到视频模型相比,Vera-no-comp 的分层编辑显著提高了内容保留,物体添加的 PSNR 提高了超过 4 dB,SSIM 提高了 0.08,LPIPS 降低了 0.13。移除合成分支导致合成和指令遵循指标低于 1.3B V2V 基线;完整的 Vera 模型保留了合成分支,并保持这些得分具有竞争力。Vera-no-comp 在内容保留上达到 25.4 dB PSNR 和 0.942 SSIM,显著优于 1.3B V2V 基线(21.1 dB,0.861)。没有合成分支,合成得分(CS)降至 2.85,低于 1.3B V2V 模型(3.29–3.54),指令得分(IS)降至 3.54,而 V2V 模型为 3.90–4.09。完整的 Vera 模型,带有合成分支,与最佳 V2V 结果(CS 3.54,IS 4.09)相比,保持了有竞争力的 CS(3.46)和 IS(3.97)。

对架构选择的消融研究表明,每层独立的扩散 transformer 的 mixture-of-transformers(MoT)设计在物体添加方面显著优于单个密集 DiT,改善了内容保留和指令遵循。输入视频条件的通道拼接在此任务上比序列拼接产生更好的结果,零初始化补丁嵌入提供最高的保真度,而复制初始化嵌入实现了最佳的指令遵循。MoT 设计还增强了编辑层和 alpha 遮罩之间的对齐,从而实现更好的合成。MoT 架构在内容保留(PSNR、SSIM、LPIPS)和指令遵循(CS、CT、IS)方面显著优于密集 DiT。零初始化输入嵌入的通道拼接提供了最佳的内容保真度,而复制初始化嵌入在指令遵循指标上表现出色。输入条件的序列拼接对于物体添加效果较差,基于 VLM 的得分较低,感知损失较高,并且计算成本更高。

从仅合成训练数据开始,添加真实单物体视频显著改善了背景更改的保留和合成质量,而进一步包含多物体视频在物体添加性能上带来了巨大提升,但代价是背景更改指标略有下降。结果表明,多样化的真实世界数据对于跨任务泛化至关重要,但平衡数据混合对于避免权衡仍然很重要。添加真实单物体数据将背景更改 PSNR 从 33.8 dB 提高到 35.6 dB,并提升了两个任务的合成得分和指令遵循。多物体数据极大地改善了物体添加的内容保留(PSNR 从 19.1 提高到 24.8),但导致背景更改保留略有下降,表明需要任务平衡的数据混合。

为三个 DiT 分支分配不同的学习率表明,alpha 和合成分支比编辑分支受益于更快的适应。增加 alpha 分支学习率改善了背景更改的内容保留和物体添加的指令遵循,而进一步增加合成分支学习率在物体添加内容保留上带来了巨大提升。降低编辑分支学习率保持了可比的整体性能,表明模型可以容忍编辑层较慢的更新。将 alpha 分支学习率提高到基础速率的 10 倍,背景更改 PSNR 提高了 2.5 dB,并将物体添加指令得分(IS)从 3.00 提高到 4.00。进一步将合成分支学习率提高到基础速率的 10 倍,在 Config-A 基础上物体添加 PSNR 增加了 3.2 dB,同时改善了 SSIM 和 LPIPS。将编辑分支学习率降低到基础速率的 0.1 倍(Vera 配置),实现了与最佳 Config-B 相当的整体性能,两者之间没有明显赢家。所有分支采用统一学习率是次优的;alpha 和合成分支需要比编辑分支更快的适应。

论文在背景更改和物体添加任务上评估了 Vera,将其分层视频编辑方法与现有方法进行比较,并检查了架构、数据和训练设计选择。该模型在基线之上显著改善了内容保留,合成分支对于保持合成质量以及编辑和 alpha 层至关重要。消融研究表明,mixture-of-transformers 架构、通道条件以及合成数据和多样化真实世界数据的平衡混合提高了性能,而编辑、alpha 和合成分支之间的差异化学习率对于实现最佳结果至关重要。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供