HyperAIHyperAI

Command Palette

Search for a command to run...

面向视频对象插入与图层分解的显式图层建模

Kyujiin Han Seungjoo Shin Sunghyun Cho

摘要

大多数视频编辑系统仍缺乏显式的分层视频表示,这限制了它们实现逼真合成、对象复用和一致性编辑的能力。这一局限在视频对象插入和视频图层分解任务中尤为突出,由于缺少显式的前景图层监督,现有方法只能依赖隐式推理或逐场景优化。我们提出了 TriLayer,一个大规模三元组视频数据集,包含对齐的合成视频、背景视频和前景视频,其中前景图层同时包含对象外观和关联的视觉效果。这种显式监督使模型能够直接学习分层视频表示,而非隐式推断。基于该数据集,我们进一步提出 DBL-Diffusion,一种双分支扩散框架,通过共享去噪和跨分支交互,联合建模 RGB 合成图和 RGBA 前景图层。我们在两个任务中实例化了该框架:用于分层对象插入的 DBL-Insert,它生成显式 RGBA 图层以实现逼真合成和灵活的后编辑;以及用于视频图层分解的 DBL-Decompose,它利用三元组监督恢复前景和背景图层。实验表明,显式图层建模显著提升了插入保真度和分解质量。

一句话总结

POSTECH 的研究者提出了 TriLayer,一个包含对齐的合成层、背景层、前景层的大规模三元组视频数据集,以及 DBL-Diffusion,一个双分支扩散框架,通过共享去噪和跨分支交互联合建模 RGB 合成层和显式的 RGBA 前景层。在此基础上构建的 DBL-Insert 用于分层物体插入,DBL-Decompose 用于视频图层分解,二者显著提升了插入保真度和分解质量。

核心贡献

  • 提出了 TriLayer,这是首个包含对齐的合成视频、背景视频与前景视频的大规模三元组视频数据集,其中视频包含视觉特效,并配套可扩展的合成管线,为学习分层视频表示提供了显式监督。
  • 提出了 DBL-Diffusion,一个统一的双分支扩散框架,通过共享去噪和跨分支交互,联合建模 RGB 合成层和 RGBA 前景层,作为分层视频任务的通用骨架。
  • 在此框架上构建了面向分层物体插入的 DBL-Insert 和面向视频图层分解的 DBL-Decompose,实验表明,显式的图层建模相比以往隐式方法大幅提高了插入保真度和分解质量。

引言

作者指出当前生成模型缺乏分层视频表示,限制了合成质量和可编辑性。以往的物体插入方法要么扭曲背景,要么从成对数据中学习却不包含显式的前景层,从而无法分离物体与阴影、反射等效果。视频图层分解同样存在困难,现有技术针对每个场景进行优化,或是在没有前景监督的情况下推断图层,导致泛化能力很差。本文的核心贡献是 TriLayer,一个提供合成-背景-前景对应关系的大规模三元组视频数据集,以及可扩展的合成管线。在这些数据基础上,作者提出 DBL-Diffusion,一个统一的双分支扩散框架,联合建模 RGB 合成层和 RGBA 前景层,显式地捕捉物体引起的视觉特效。该框架以 DBL-Insert 和 DBL-Decompose 形式实例化,其中 DBL-Insert 是首个生成可复用 RGBA 前景层的视频分层物体插入方法,而 DBL-Decompose 则通过三元组监督显著提高了分解精度。

数据集

作者提出 TriLayer,这是一个专为监督分层视频分解与生成而设计的数据集。每个样本包含三个对齐的视频:一个合成视频(包含原始场景和物体),一个前景 RGBA 视频(同时捕获不透明物体区域以及阴影、反射等半透明效果),以及一个纯净的背景视频(既无物体也无其效果)。合成视频通过 alpha 合成将前景层叠加到背景上形成。每个样本还提供物体名称和由 VLM 生成的描述物体外观及其相关视觉特效的文本说明,这些将作为下游任务的条件信号。

关键数据集信息:

  • 总规模:3,964 个视频三元组。
  • 来源:从 Pexels 收集的开放视频。
  • 子集构成:每个三元组包含一个合成视频、一个前景 RGBA 视频、一个背景视频,以及物体名称和 VLM 文本描述。
  • 过滤规则:使用 Qwen2.5-VL-32B 进行自动语义过滤,剔除严重模糊、严重遮挡或物体极小的片段。经过多轮人工验证以确保掩膜精度、背景稳定性和前景保真度。在生成文本描述后,进行最终筛选,移除剩余的错误案例。

论文如何使用这些数据:

  • 数据集提供对齐的合成、背景和前景视频,用于训练分层视频表示。
  • 纯净的背景视频作为分层物体插入任务的输入。
  • 物体名称和 VLM 生成的文本描述作为 DBL-Diffusion 和 DBL-Decompose 的条件信号。
  • 论文未指定显式的训练集划分比例或混合比例。

处理与构建细节:

  • 原始视频被缩放并裁剪时间片段,以匹配扩散训练设置。
  • 使用 PySceneDetect 检测镜头边界;仅保留第一个纯净镜头,以避免转场伪影。
  • 逐帧物体掩膜由 Grounded-SAM2 提取,并指导使用现成的物体移除模型进行背景重建。
  • 前景 RGBA 层由 Gen-Omnimatte、MatAnyone 和 Grounded-SAM2 组合提取:最终 alpha 遮罩采用各来源的逐像素最大值,RGB 值则取自对应获胜 alpha 的来源。
  • 物体中心文本描述由 VLM 生成,既描述物体本身也描述其视觉特效。

方法

为构建 TriLayer 数据集,作者设计了一个多阶段管线,从开放视频中提取出前景-背景-合成三元组。该管线结合自动化处理与人工验证,确保高质量的分层监督。

流程从视频预处理和候选片段选择开始。原始视频被缩放并裁剪时间片段;对多镜头视频检测镜头边界,仅保留第一个纯净镜头以避免转场伪影。随后使用视觉语言模型识别主要前景物体,并剔除严重模糊、严重遮挡或物体极小的片段。接着,提取逐帧物体掩膜以引导背景重建,通过物体移除模型对前景区域进行移除和修复,得到纯净的背景视频。在前景层提取阶段,作者融合了 Gen-Omnimatte、视频抠图和分割的互补信息。最终 alpha 遮罩取各来源的逐像素最大值,RGB 值来自获胜 alpha 的来源。最后,使用视觉语言模型生成物体中心文本描述,作为下游任务的语义条件信号。整个过程伴随自动过滤和多轮人工验证,以确保掩膜精度、背景稳定性和前景保真度。

为以显式的分层表示对视频进行建模,作者提出 DBL-Diffusion,采用双分支扩散架构。该框架将前景物体及其关联的视觉特效与背景场景分离。框架包含一个 RGB 分支,用于建模场景级外观,以及一个 RGBA 分支,用于预测前景层。尽管两个分支处理不同的图层,但它们通过联合交叉注意力进行整合,实现双向信息交换和一致的分层合成。DBL-Diffusion 作为一个统一的骨架,可为不同的分层视频任务实例化,即用于分层物体插入的 DBL-Insert 和用于视频图层分解的 DBL-Decompose。

DBL-Insert 将双分支架构应用于分层物体插入。其目标是合成可无缝集成到目标背景中的前景物体图层。RGB 分支生成 RGB 合成图,提供时序上连贯的可视化效果,并充当去噪过程中的辅助信号。RGBA 分支生成包含物体及其效果在内的显式前景图层。在推理时,前景图层与背景进行 alpha 混合,得到最终的高保真结果。模型的输入包括一部背景视频、一条文本提示、一系列边界框以及第一帧的编辑结果。条件信号同时构建给两个分支,扩散骨干采用 VACE。RGB 分支工作在标准 VACE 潜在空间中,RGBA 分支则使用 WAN-alpha 的 RGBA 潜在空间。

DBL-Decompose 将该框架实例化为视频图层分解。给定一部合成视频,模型恢复出纯净的背景视频和 RGBA 前景图层。RGB 分支移除前景物体及其视觉特效以重建背景,RGBA 分支则预测前景图层,捕捉外观、边界、透明度和效果。模型的输入包括一部合成视频、一条文本提示、物体名称以及物体掩膜序列。仅包含物体的条件视频被构建用于引导 RGBA 分支,而合成视频本身则条件化 RGB 分支。

DBL-Insert 和 DBL-Decompose 均采用混合 LoRA-DoRA 适应策略进行训练,以反映两个分支的不同角色。RGB 分支处理领域内任务,在预训练扩散 Transformer 的潜在空间中预测 RGB 视频。对此分支,使用 LoRA 进行低秩适应,可高效而稳定地特化模型。相反,RGBA 分支必须学习透明度、alpha 遮罩和特定于图层的效果等跨域概念。为支持这种分布偏移,作者采用 DoRA,它将权重的幅度和方向解耦。这种保持方向性的参数化方式在保留预训练方向先验的同时,进行受控的低秩更新。

为进一步稳定联合优化,模型在 rectified-flow 框架下训练,并通过解耦的时间步采样策略进行。每个分支以其自身的噪声水平演化,从而平衡 RGB 外观学习与 RGBA 图层重建的动态。为 RGB 和 RGBA 分支分别独立采样时间步 tx,tyU(0,1)t_x, t_y \sim \mathcal{U}(0, 1)tx,tyU(0,1),并训练模型预测相应的速度场。整体目标为 RGB 与 RGBA 速度预测损失之和。这种解耦训练方案稳定了优化,并可通过独立控制各分支的噪声水平实现条件生成。

实验

实验使用带有显式三元组监督的双分支扩散 Transformer 验证 DBL 框架。DBL-Insert 通过解耦的前景合成与场景合成,在文本-视频对齐和物体一致性间取得平衡,优于基线方法和单分支消融。DBL-Decompose 超越了先前分解方法,依赖扩散先验而非严格的像素重建,交付干净的 RGBA 图层和视觉上连贯的背景。消融研究证实,混合 LoRA-DoRA 和前景条件对于稳定、高质量的输出至关重要,该模型还支持直观的图层编辑,并能处理火焰、烟雾等半透明视觉特效元素。

TriLayer 是唯一一个同时提供纯净背景视频、包含视觉特效的 alpha 遮罩以及动态真实世界物体的数据集,从而能够为视频物体插入与分解提供完整的分层监督。已有数据集至少缺失这些组成要素之一,因而无法建模阴影、反射等由物体引起的效果。所有比较的数据集都提供合成视频,但只有 TriLayer 和 ROSE++ 包含分层分解所需的纯净背景视频。TriLayer 独特地提供了既捕捉不透明区域也包含视觉特效的 alpha 遮罩,而视频抠图数据集和 ROSE++ 则不具备这一特点。与仅包含静态虚拟物体的 ROSE++ 不同,TriLayer 包含真实世界视频中的动态物体,支持逼真的物体-场景交互。Senorita-2M 和 VPData 提供二值掩膜,但缺乏 alpha 遮罩和背景视频,无法实现分层监督。TriLayer 与其他数据集的最大帧数持平,同时附加了最丰富的标注信息。

DBL-Insert 在几乎所有指标上均优于先前方法和消融的 VACE 变体,取得了最高的文本-视频对齐度、美学质量与物体身份保持,并在背景一致性和运动一致性上与最佳结果持平。与修复基线 VACE-Inp 相比,在 TriLayer 数据集上微调可提升一致性,但只有配备三元组监督的双分支设计能同时将前景身份和合成品质提升至最高水平。DBL-Insert 获得最佳的 ViCLIP-T、美学分数、CLIP-I 和 DINO-I,并在背景和物体一致性上并列第一,展现出对单分支模型和先前方法的全方位优势。微调后的单分支变体(VACE-C, VACE-F)相比 VACE-Inp 提升了背景或物体一致性,但无法匹配 DBL-Insert 的物体保真度与合成平衡,这揭示了显式三元组监督与跨分支交互的价值。

在基于生成的背景图层重建方法中,DBL-Decompose 在 Movie 和 Kubric 两个数据集上均显著优于先前工作,取得了最高的 PSNR、SSIM 和最低的 LPIPS。感知距离的降低尤为显著,Movie 上的 LPIPS 降至 0.025,而次优方法为 0.105。DBL-Decompose 还独特地报告了 SSIM,在 Movie 上达 0.962,Kubric 上为 0.979。相比 DiffuEraser,DBL-Decompose 在 Movie 上将 LPIPS 降低了 4 倍以上(0.025 vs. 0.105),展示了明显更清晰的感知背景重建。在 Kubric 上,DBL-Decompose 的 PSNR 为 38.22,LPIPS 为 0.021,将所有其他生成式基线抛在身后,最接近的竞争方法 Propainter 的 PSNR 为 34.67,LPIPS 为 0.056。

TriLayer 数据集唯一同时提供了纯净背景、包含视觉特效的 alpha 遮罩以及动态真实世界物体,从而能够为其他数据集无法支持的视频物体插入和分解任务提供完整的分层监督。采用三元组监督训练的双分支模型 DBL-Insert 持续取得最高的文本-视频对齐度、美学质量与物体身份保持,同时与最佳背景和运动一致性持平,超越了先前方法和消融变体。在背景图层重建方面,DBL-Decompose 在 Movie 数据集上将感知距离降低了四倍以上,并在 Kubric 上取得了最优的 PSNR 和 LPIPS 分数,大幅领先所有生成式基线。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供