HyperAIHyperAI

Command Palette

Search for a command to run...

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

摘要

实时视频编辑要求以有限的计算资源实现低延迟的因果生成,同时保持源视频保真度和长期时间一致性。我们提出了 JoyAI Video-Edit,这是一个 160 亿参数的自回归扩散框架,用于实时、开放式的视频编辑,无需访问未来帧或预定义视频时长。该方法结合了分块自回归适配、源锚定分布匹配蒸馏(SA-DMD)以及长时域自回归蒸馏,以减少训练与推理之间的不匹配,在两步生成过程中保持源视频保真度,并缓解累积的时间漂移。大量自动评估和人工评估表明,JoyAI-Video-Edit 显著优于现有的流式编辑器,并在短时和长时视频上均能与强大的离线系统相媲美。整个系统在单块 Nvidia B200 GPU 上实现了端到端约 30 FPS 的 720p 视频编辑。代码已开源,地址为 https://github.com/jd-opensource/JoyAI-Video-Edit

一句话总结

JoyAI-Video-Edit 是由京东 Joy Future Academy 的研究人员提出的一个 16B 参数的自回归扩散框架。该框架结合了分块自回归自适应、源锚定分布匹配蒸馏(SA-DMD)和长时域自回归蒸馏技术,在单张 Nvidia B200 GPU 上实现了 720p、约 30 FPS 的实时开放式视频编辑,显著优于现有的流式编辑器,同时性能媲美离线系统。

核心贡献

  • JoyAI Video-Edit 是一个 16B 参数的自回归扩散框架,无需未来帧或预定义视频长度即可实现实时、开放式的流式视频编辑。
  • 该框架结合了分块自回归自适应、源锚定分布匹配蒸馏(SA-DMD)和长时域自回归蒸馏技术,以减少训练与推理之间的不匹配,在两步生成过程中保持源保真度,并缓解累积的时间漂移。
  • 广泛的自动化和人工评估证明,相较现有流式编辑器,该框架取得了显著提升,在长短视频上均达到与强大的离线基线系统相竞争的性能,并可在单张 Nvidia B200 GPU 上实现端到端 720p 编辑,速度约 30 FPS。

引言

作者针对直播和互动娱乐等应用中的流式视频编辑场景展开研究,这些场景要求编辑后的帧在源视频到达时因果实时输出。现有的高质量编辑器通常是离线的,依赖双向时序处理,无法进行因果输出且内存消耗随长度增长,若简单剪辑会导致不连续。对离线模型进行简单的因果自适应会引入训练与推理的不匹配,导致在长序列流上产生误差累积和外观漂移。作者提出了 JoyAI-Video-Edit,一个 16B 参数的自回归扩散框架,将强大的双向编辑器转化为具有有界状态滑动窗口和重采样强制的逐块因果模型,对齐训练和推理的历史分布。为实现实时两步生成,他们引入了源锚定分布匹配蒸馏(SA-DMD),将迭代去噪蒸馏为一个生成器,通过锚定到时间对齐的源块来抵消漂移,并将引导吸收到单个分支中;同时进一步应用长时域自回归蒸馏来显式优化累积误差。整个系统在单张 NVIDIA B200 GPU 上处理 720p 视频编辑,速度约 30 FPS。

数据集

作者构建了两个互补的数据集:一个文本到视频的生成语料库和一个成对的视频编辑数据集。两者均针对训练统一的视频模型而量身定制。

  • 文本到视频数据

    • 组成和来源:图像和视频来自多个领域(人物、生活方式、娱乐、自然、物体、城市场景)。
    • 图像过滤:清晰度和质量检查、黑边检测,以及通过感知哈希和嵌入进行去重。
    • 视频过滤:视觉质量、美学评分、运动幅度、相机稳定性和时序有效性;模糊、旋转、演示风格和损坏的视频被丢弃。
    • 概念平衡:对过滤后的数据进行聚类;主要类别被下采样,同时保留长尾概念。
    • 运动偏差修正:额外的基于运动的过滤防止美学模型过度选择静态视频,保留具有有意义但稳定动态的片段。
    • 高质量微调子集:自动过滤后进行人工检查,排除包含明显文本、破碎结构、不合理运动或物理不一致的视频。
  • 视频编辑数据

    • 来源:从 JoyAI-Image 的图像编辑监督(图像到图像和参考到图像对)迁移而来。
    • 构建流程 1 -- 关键帧传播:从源视频中选择一个代表性关键帧,根据指令编辑,然后通过图像和视频到视频模型传播编辑内容,同时保留原始运动和未更改区域。
    • 构建流程 2 -- 潜变量共享生成:原始图像及其编辑后的对应图像用于潜变量共享的图像到视频生成;早期去噪潜变量被共享以保持运动与构图一致,后期阶段则基于不同图像条件进行以引入编辑。
    • 过滤:根据视觉质量、编辑正确性、内容保留和时序一致性过滤生成的视频对。
    • 指令优化:多模态大语言模型(MLLM)比较源视频和编辑后的视频,并优化编辑指令。
    • 编辑类型:涵盖局部编辑(主体、背景、特定区域)、全局编辑(风格、色调、运动变换)以及主体的添加、替换或移除。

这些数据集共同用于模型训练:文本到视频语料库提供基础生成能力,而视频编辑对使模型具备指令驱动的视频编辑能力。

方法

作者提出 JoyAI-Video-Edit,一个用于视频编辑的统一自回归扩散模型。如框架图所示,该架构包含多模态大语言模型(MLLM)、因果视频变分自编码器(VAE)和多模态扩散 Transformer(MM-DiT)。

MLLM 处理源视频的第一帧和对应的编辑指令,以提取条件 token,编码源感知的视觉信息和编辑意图。因果视频 VAE 将源视频编码为潜变量序列,并将可选的参考图像映射到同一潜变量空间,采用 8×24×248 \times 24 \times 248×24×24 的时空压缩比。MM-DiT 联合建模条件 token 和潜变量视觉 token,生成编辑后视频的潜变量,然后通过 VAE 解码为最终输出视频。

训练从渐进式文本到图像预训练开始,建立文本与视觉的对齐,随后引入时序建模的文本到视频训练。训练课程从低分辨率视频逐步提升到更高分辨率和帧率,并以监督微调和持续训练结束。为实现双向视频到视频编辑,作者引入图像到图像监督以学习基于指令的变换。由于高质量配对视频编辑数据稀缺,他们使用两个互补的流水线构建数据,如数据流水线图所示。

首先,根据指令编辑代表性关键帧,并使用图像和视频到视频模型将变化传播到整个视频。其次,使用潜变量共享的图像到视频生成方式从原始和编辑后的图像生成配对视频,分支共享早期去噪潜变量以保持运动与构图一致。生成的配对视频经过过滤和重新描述。双向编辑器使用流匹配目标进行训练。给定源视频、编辑指令、可选参考图像和编辑目标,因果视频 VAE 生成相应的潜变量。对于采样的噪声水平 σ\sigmaσ 和高斯噪声 ϵ\epsilonϵ,噪声目标和流目标构建为 zσ=(1σ)z0+σϵz _ { \sigma } = ( 1 - \sigma ) z _ { 0 } + \sigma \epsilonzσ=(1σ)z0+σϵv=ϵz0v ^ { \star } = \epsilon - z _ { 0 }v=ϵz0。模型被优化以最小化预测速度和目标速度之间的差异。

然后,将双向模型调整为因果范式,以支持流式生成。视频被分割成块,并采用逐块注意力机制:每个块内使用双向注意力,块间使用因果注意力。为限定计算量,跨块注意力被限制在最近历史块和全局汇聚块(第一块)的滑动窗口内。在训练期间,使用重采样强制(Resampling Forcing),用通过单步去噪重新生成的自轨迹估计替换干净的历史状态,从而缓解训练-测试分布不匹配。

为实现实时吞吐量,模型通过分布匹配蒸馏被蒸馏为少步生成器。为防止长序列生成中的源漂移和幻觉,作者引入源锚定蒸馏。该方法通过沿文本条件和源保真度轴应用无分类器引导,将教师模型锚定到时间对齐的源块:

vϕg=vϕcond+wtxt(vϕcondvϕtxt)+wsrc(vϕcondvϕsrc)v _ { \phi } ^ { g } = v _ { \phi } ^ { \mathrm { cond } } + w _ { \mathrm { txt } } ( v _ { \phi } ^ { \mathrm { cond } } - v _ { \phi } ^ { - \mathrm { txt } } ) + w _ { \mathrm { src } } ( v _ { \phi } ^ { \mathrm { cond } } - v _ { \phi } ^ { - \mathrm { src } } )vϕg=vϕcond+wtxt(vϕcondvϕtxt)+wsrc(vϕcondvϕsrc)

其中,无源预测省略了对齐的源潜变量。此公式创建了源锐化后验,直接将源保真度控制蒸馏到生成器中。为让蒸馏过程暴露于长时域推理中的复合误差,而不会导致内存溢出,在扩展生成序列上进行分段优化。将序列分割为较短的片段,累积梯度,并在各片段之间清除计算图。对于超过源视频长度的生成序列,采用动态镜像循环策略扩展条件信息以保持时序连续性。

部署时,输入的视频流以连续的八帧块进行处理。该流水线的运行时间分解如下所示。

该流水线采用 FP8 量化、算子融合和计算图编译。每个块被编码、由少步 DiT 编辑并立即解码。干净的键值状态被缓存供后续块使用,保留第一块作为全局汇聚块以及最近块的滑动窗口。此优化流水线结合有界键值复用,使模型能够在单张 GPU 上支持实时 720p 编辑,速度约 30 FPS。

实验

评估将 JoyAI-Video-Edit 与流式及离线视频编辑器在短视频基准、新构建的一分钟长视频基准、人类偏好研究以及部署效率分析方面进行比较。实验验证了该模型显著优于现有流式方法,编辑质量与强大的离线系统媲美,并在无界视频流上维持高吞吐量的连贯编辑。消融研究证实,源锚定蒸馏和长时域对齐是互补的,且部署优化使持续实时的编辑工作流成为可能,将视频编辑扩展到传统的后期制作之外。

基础模型通过多阶段课程训练,先从递增分辨率的文本到图像预训练开始,随后过渡到文本到视频训练。视频阶段混合图像和视频数据,随着分辨率和时序保真度的提高,纯视频样本数量从 3.7 亿减少到 3000 万。在更高分辨率的视频阶段,学习率减半,最终的监督微调阶段仅使用 3000 万高质量样本。图像预训练在 256×256 分辨率下使用 43 亿样本,然后在 512×512 下使用 7.93 亿样本。视频训练从 256p 分辨率、12/24 fps 和 3.7 亿视频样本开始,然后提升到 360p 分辨率、24 fps 和 1.08 亿样本。监督微调阶段使用 480p 分辨率、24 fps,仅 3000 万视频样本,学习率降低至 5×10⁻⁵。

在 OpenVE-Bench 上,JoyAI-Video-Edit 在流式视频编辑器中获得最高总分,显著优于先前的流式方法,并可媲美强大的离线系统。它在五个编辑类别中的四个类别中排名第一,其中在局部更改和局部移除方面提升尤为显著,同时保持因果推理。这一性能缩小了流式与离线编辑之间的质量差距,开源替代方案仍远远落后。JoyAI-Video-Edit 获得 3.60 的总分,比排名第二的流式方法高出 0.98 分。它在五个类别中的四个类别中领先流式方法,其中局部更改和局部移除的领先幅度最大。其局部移除分数超过了所有离线和流式方法,并在局部更改分数上与所有评估系统中的最佳成绩持平。开源模型 VACE 的总分仅为 1.57,表明在没有专有优化的情况下实现高保真流式编辑的困难。

在一分钟视频编辑任务上,JoyAI-Video-Edit 在所有评估的流式方法中取得最高的整体编辑质量和最快的吞吐量。它在每个编辑类别中均领先,在总分上大幅超越以往最强的方法,同时处理速度超过每秒 30 帧。JoyAI-Video-Edit 获得 3.30 的总分,比排名第二的流式编辑器高出 1.59 分。其吞吐量达到 30.19 FPS,是对比中最快的方法,同时也获得了最佳的局部更改和全局风格分数。

在流式视频编辑方法中,JoyAI-Video-Edit 实现了最低的完整流水线延迟和最高的吞吐量,在 720×1280 分辨率下处理 81 帧输入,速度达到 30.19 FPS。其视频自编码器以 200 FPS 运行,极大地减少了编码/解码瓶颈。尽管 SANA-Streaming 拥有更快的单一扩散 Transformer 组件,但 JoyAI-Video-Edit 的完整流水线速度是 SANA-Streaming 及所有其他对比方法的两倍多。JoyAI-Video-Edit 的端到端延迟最低,仅为 2.68 秒,30.19 FPS 的吞吐量最高,优于在更低分辨率下运行的方法。VAE 组件达到 200 FPS,远超第二快的 VAE(37.26 FPS),有效消除了自编码瓶颈。尽管 SANA-Streaming 的 DiT 单独最快(54.36 FPS),JoyAI-Video-Edit 的完整流水线整体吞吐量是 SANA-Streaming 的 2.08 倍。

源锚定蒸馏(SA-DMD)和长时域自回归蒸馏(LHAD)以互补的方式增强了视频编辑能力。SA-DMD 提供了最大的单一组件增益,特别是在全局风格和局部更改方面,而 LHAD 通过稳定长序列中的误差累积来改善背景更改和局部移除。两者的结合获得了最佳总分和在所有三个局部编辑任务上的最高结果,证实了源锚定和长时域优化的有效协同作用。SA-DMD 单独带来了最大的单次性能提升,显著提高了全局风格和局部更改分数。LHAD 单独提高了总分,并特别有利于背景更改和局部移除,这些任务最需要长序列稳定性。同时启用两个组件实现了最佳总分,并在所有局部编辑指标上领先,展现出强大的互补性。

JoyAI-Video-Edit 在 OpenVE-Bench 流式视频编辑基准上进行了评估,在流式方法中达到了新的最优水平,大幅缩小了与离线编辑器之间的质量差距。它在完整的一分钟序列上提供了最高的整体编辑质量,同时实现了最低的端到端延迟和最高的吞吐量,在 720p 分辨率下超过 30 FPS。消融研究证实,源锚定蒸馏和长时域自回归蒸馏提供了互补的增益,它们的结合在所有局部编辑类别中均产生了最佳结果。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供