HyperAIHyperAI

Command Palette

Search for a command to run...

InfinityEdit:基于轻量级编辑触发适配器的无限视频编辑

摘要

借助大型预训练模型,现有方法已有效提升了基于指令的视频编辑效果。然而,其中大多数方法依赖于原地编辑假设,即在固定时间跨度内逐帧将编辑后的视频与给定的源片段对齐。这种模式无法应对开放式视频流,例如对实时游戏进行风格化处理,或对正在进行的镜头施加运镜效果。在这些场景中,编辑必须随着未来帧的到达而持续延伸,而非应用于静态输入片段。本文研究了这一设定,并将其命名为无限视频编辑:给定前序片段和一个编辑请求,模型必须生成延续视频流并应用所请求编辑的下一片段。随着无界编辑指令序列的不断到达,这一过程反复进行。该任务带来两个挑战:编辑必须是忠实的延续而非逐帧重写,且生成质量必须在编辑不断累积的情况下保持稳定。为应对这些挑战,我们首先设计了一套面向无限视频编辑的数据采集流程。基于所采集的数据,我们提出了 InfinityEdit,一种轻量级编辑适配器,赋予流式视频生成器无界编辑能力。该适配器包含三个注意力模块:历史交叉注意力利用输入帧引导去噪帧;时序因果自注意力确保时间线索仅从较早帧流向较晚帧;编辑交叉注意力将编辑请求注入生成过程。在推理阶段,该适配器仅在编辑请求到达的块中被激活,后续块由原始模型结合重置锚帧生成。该方案在施加编辑的同时保留了原始模型的无限生成能力。大量实验表明,InfinityEdit 能够在每次编辑下忠实地延续视频流,并在无界编辑序列中保持稳定。

一句话总结

浙江大学和阿里巴巴集团的研究人员提出InfinityEdit,一种轻量级的编辑点燃适配器,为流式视频生成器配备无限编辑能力,用于无限视频编辑;它使用历史交叉注意力、时间因果自注意力以及编辑交叉注意力,仅在编辑块中激活,以忠实延续流,同时保持生成稳定性,跨越无界的编辑序列。

核心贡献

  • 论文形式化了无限视频编辑任务,其中生成的片段必须在顺序编辑请求下延续正在进行的流,并为此设置引入了数据收集流程。
  • 论文提出InfinityEdit,一种用于冻结流式视频生成器(如Helios-Distilled)的轻量级编辑适配器。它结合了历史交叉注意力、时间因果自注意力和编辑交叉注意力,在推理时仅在收到编辑请求的块中激活,而后续块使用带有重置锚帧的原始生成器。
  • 大量实验表明,InfinityEdit通过更忠实地遵循编辑请求、延续流而非逐帧重写,并在长序列中随着编辑累积保持稳定,优于基线方法。

引言

现有的基于扩散的视频编辑器是为固定长度的剪辑设计的,输出与源视频具有相同的持续时间和时间对齐。这种就地编辑范式对于开放式流(如实时游戏风格化或连续相机移动)会失效,因为新内容无限到来,编辑必须应用于未来帧。流式视频生成器可以延续片段,但未经过训练以遵循关系编辑指令,并且它们的稳定性机制常常抵制预期的更改。作者引入了无限视频编辑任务,其中编辑请求通过生成下一片段作为忠实延续来修改正在进行的流。他们提出InfinityEdit,一种轻量级适配器,为冻结的流式生成器配备三个注意力模块(历史交叉注意力、时间因果自注意力和编辑交叉注意力),并使用点燃后继续的推理策略,配合锚定滑动窗口历史,以在重复编辑中保持稳定性。

数据集

作者构建了一个视频编辑三元组数据集,每个三元组包括一个前序视频 VpcdV_{\mathrm{pcd}}Vpcd、一个编辑指令 ceditc_{\mathrm{edit}}cedit 和一个目标视频 VtgtV_{\mathrm{tgt}}Vtgt,该目标视频在应用指令的同时延续前序片段。数据集通过多阶段流程构建,并用于训练论文中描述的模型。

  • 来源与组成

    • 源视频 VpcdV_{\mathrm{pcd}}VpcdUltraVideo 数据集中采样,并调整大小至固定分辨率和帧数。
    • 基本编辑类型取自 VAP 中使用的代表性指令集;然后由 Gemini 3 Flash 将这些抽象短语扩展为具体的编辑指令 ceditc_{\mathrm{edit}}cedit,使用源视频的标题将指令基于特定实体和场景。
    • 目标视频 VtgtV_{\mathrm{tgt}}Vtgt 使用图像到视频模型 Wan2.2-I2V-A14B 合成。对于外观编辑(如风格变化),VpcdV_{\mathrm{pcd}}Vpcd 的最后一帧首先由 Qwen-Image-Edit-2511 编辑以反映所需更改,该修改后的帧作为生成的起始帧。对于相机运动编辑,原始最后一帧保持不变。
    • 生成的三元组构成完整数据集;论文未报告样本总数。
  • 后处理与过滤

    • 所有视频调整大小以匹配基础模型(Helios-Distilled)的默认训练分辨率。
    • 帧数被裁剪,使得比率 T1/T2T_1 / T_2T1/T2 与模型的输入和输出窗口长度对齐。
    • 三元组由20名人类标注员根据四个标准手动评分,每个评分从1(最差)到4(最好):
      • 对齐度VtgtV_{\mathrm{tgt}}Vtgt 满足 ceditc_{\mathrm{edit}}cedit 的程度。
      • 一致性VtgtV_{\mathrm{tgt}}VtgtVpcdV_{\mathrm{pcd}}Vpcd 延续的程度(主体稳定性,场景一致性)。
      • 合理性 – 无不合理伪影。
      • 视觉质量 – 所选源片段的质量。
    • 根据这些分数保留三元组(未指定确切阈值)。
  • 模型中的使用

    • 该数据集用于训练编辑模型,以 Helios-Distilled 作为骨干。论文未提及单独的验证或测试分割;所有经过滤的三元组在上述格式调整后用于训练。

方法

为了训练用于无限视频编辑的模型,作者构建了由前序视频 VpcdV_{\mathrm{pcd}}Vpcd、编辑指令 ceditc_{\mathrm{edit}}cedit 和目标视频 VtgtV_{\mathrm{tgt}}Vtgt 组成的三元组。源视频被采样并调整大小,基本编辑类型使用视觉语言模型扩展为详细指令。目标视频使用图像到视频模型合成。对于外观编辑,连接帧首先被编辑;对于相机运动编辑,则直接保留。最后,三元组经过后处理和基于对齐度、一致性、合理性和视觉质量的人工过滤。完整的数据生成流程如下图所示:

该系统构建在 Helios-Distilled 之上,这是一个14B的自回归视频扩散变换器,逐块生成视频。它维护一个分层多尺度记忆,以保持计算成本有界。作者将一个轻量级的编辑点燃适配器附加到冻结的骨干上,以注入编辑指令而不降低生成先验。该适配器插入在每个变换器层之后,并操作每层隐藏状态 H=[Hhist;Hcur]H = [H_{\mathrm{hist}}; H_{\mathrm{cur}}]H=[Hhist;Hcur]。它分三个阶段细化当前块 token:

  1. 历史交叉注意力 (HISTCA):通过关注历史 token,将去噪块锚定到提供的历史。
  2. 时间因果自注意力 (TEMPSA):使用因果掩码沿时间轴向前传播锚定信号。
  3. 编辑交叉注意力 (EDITCA):将编辑指令 ceditc_{\mathrm{edit}}cedit 注入所有去噪 token。 每个阶段使用基于噪声水平 σ\sigmaσ 的调制 mσ()m_{\sigma}(\cdot)mσ(),输出投影初始化为零,以从恒等映射开始,确保原始生成行为保持不变。

适配器使用流匹配目标进行训练,同时保持基础权重冻结。为了减轻推理期间由不完美生成历史引起的暴露偏差,作者在训练期间应用历史损坏,随机用噪声版本替换干净的历史潜变量。此外,他们使用单阶段固定步数的欧拉调度,并采用混合高斯采样的噪声水平 σ\sigmaσ,而不是骨干的金字塔去噪调度。这将适配器聚焦于推理期间使用的特定 σ\sigmaσ 值。训练遵循两阶段课程:第一阶段使用均匀混合权重和均匀帧权重以实现广泛覆盖,而第二阶段将权重移向较低的 σ\sigmaσ 值和较晚的帧,以细化细节。

在推理时,适配器仅用于在指令到达后的第一个块上点燃编辑,而后续块由冻结的骨干生成。完整的推理流程如下图所示:

为了确保捕获细节,在点燃块上添加了一个接近零 σ\sigmaσ 的额外去噪步骤。对于无限编辑,系统采用滑动历史窗口,并将锚帧 x0x_0x0 重置为点燃块的第一个编辑帧。这种移动锚点为当前编辑提供了稳定的参考,防止漂移,并允许骨干无限期地延续编辑后的内容。

实验

作者评估了一种建立在冻结的 Helios-Distilled 14B 骨干上的流式编辑方法,仅训练编辑适配器,并在新构建的分布外顺序编辑基准上进行测试,该基准包含200个源视频和三步编辑链。与纯骨干、就地编辑和提示切换基线的比较表明,所提出的方法整体表现最佳,尤其是在相机控制、时间稳定性、忠实度、视觉质量、场景保留和跨编辑一致性方面。它还在多轮编辑中保持稳定,并在超过1000帧的长视频中维持质量,编辑属性跨片段持续存在。定性结果进一步证实,编辑发生在预期点,同时保留源内容和流连续性。

所提出的方法在相机运动和时间闪烁得分上取得了比较方法中的最佳成绩,同时接近最佳运动平滑度结果。它在相机运动方面的优势最大,表明对定向相机编辑的控制更强。最终编辑轮次的时间闪烁表明累积顺序编辑后保持了连贯性。所提出的方法在相机运动和时间闪烁方面领先,与第二好的相机运动得分差距很大。运动平滑度接近最佳结果,而动态程度仅作为内容依赖的参考报告,而非编辑忠实度度量。

所提出的方法在无限视频编辑的所有四个VLM-as-Judge维度上排名第一,在场景身份保留和视觉质量方面优势最大。它显著优于就地编辑和提示切换基线,并且是唯一一个在三轮编辑中同时提供高编辑忠实度、内容保留和跨编辑一致性的方法。该方法在场景身份保留和视觉质量方面遥遥领先,得分远高于次优竞争者。只有该方法保持每次编辑忠实,保留未更改的源属性,并在所有三次编辑中维持连续流,与其最高的一致性和保留分数一致。

所提出的方法在所有三个顺序编辑轮次中实现了最高的编辑忠实度,保持在约3.8,变化极小(标准差0.023)。其他方法要么起步低且波动剧烈,要么显示误导性的上升趋势,实际上反映了内容漂移而非真正的编辑质量。这种稳定性证实了稳健的顺序编辑而不会退化。所提出的方法从第一次到第三次编辑保持近乎恒定的编辑忠实度(约3.8),标准差仅为0.023。提示切换方法表现出极大的不稳定性:忠实度从低于1.7开始,跃升至3.1以上,导致标准差超过0.69。

实验在运动和时序质量指标以及基于VLM的无限和顺序视频编辑判断上评估了所提出的方法。该方法在相机运动控制和时间闪烁方面领先,同时在运动平滑度上保持竞争力,并在场景身份保留和视觉质量上排名第一。在重复编辑轮次中,它始终保持高编辑忠实度,而没有基线中的不稳定或内容漂移,使其成为唯一可靠地保留未更改属性同时应用忠实顺序编辑的方法。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供