HyperAIHyperAI

Command Palette

Search for a command to run...

AVA-Encoder:迈向智能体原生视频表示学习

Chuyue Li Jinpeng Yu Haozhe Wang Tian Xueyun Zhijing Zhang Bingnan Li Shuqi Gu Kan Ren Jiaming Liu Ruihua Huang

摘要

视频创作智能体仍缺乏从高质量人类影片中学习的有效途径,这限制了它们生成电影级视频的能力。一个关键挑战在于缺少一种既忠实于影片内容、又能直接用于智能体推理与操作的结构化视频表示。为应对这一挑战,我们提出了智能体视频自编码器(AVA-Encoder),这是一种由智能体自进化驱动的新型自编码框架,用于学习智能体原生视频表示。AVA-Encoder 将视频转换为影片知识图谱(KG)表示,再将其重建回视频。该影片 KG 表示以结构化形式显式刻画实体、事件、资产及其多模态关系,便于智能体理解、查询和操作。重建残差驱动一个双环文本梯度优化框架,联合改进影片 KG 表示与智能体视频编码器。大量实验表明,AVA-Encoder 相较于最强外部基线取得了 20.7 个百分点的绝对增益,即 73.1% 的相对提升。在仅控制策略的设定下,其伪训练的智能体视频编码器策略也优于精心人工调优的策略,同时少用了 74.3% 的镜头级和 70.1% 的关键帧级系统提示词元。我们发布了完整的 AVA-Encoder 框架、一个可靠的智能体视频重建基准,以及首个高质量影片 KG 表示数据集。

一句话总结

来自阿里巴巴通义千问事业部、上海科技大学、香港科技大学及其他机构的研究人员提出 AVA-Encoder,一种将视频转换为电影知识图谱(Film Knowledge Graph)并通过双环路文本梯度优化进行重建的 agentic 自我进化自动编码器,在最强外部基线之上取得了 20.7 个百分点的绝对提升(相对提升 73.1%),并且在一个受控的仅策略设置下,产出了一个伪训练的 Agentic Video Encoder 策略,其性能优于精心人工调优的策略,同时使用的镜头级 system-prompt tokens 减少 74.3%,关键帧级 system-prompt tokens 减少 70.1%。

核心贡献

  • 本文介绍 Agentic Video Auto-Encoder (AVA-Encoder),这是一个 agentic 自动编码框架,将视频转换为电影知识图谱并将其重建回视频。一个带门控的双环路文本梯度优化过程利用重建残差来共同改进 Film KG 和分层式 Agentic Video Encoder。
  • Film KG 表示以结构化、agent 可操作的形式显式捕获实体、事件、资产和多模态关系,支持查询、操作和关联编辑,同时生成对齐的中间记录和渲染输出,用于高质量 agentic 视频创作轨迹。
  • 实验报告整体重建得分为 49.0%,在最强外部基线 28.3% 之上取得 20.7 个百分点的绝对提升和 73.1% 的相对改进;在受控的仅策略设置中,伪训练的 Agentic Video Encoder 策略达到 45.8%,而独立人工调优策略为 44.4%,且使用的镜头级 system-prompt tokens 减少 74.3%,关键帧级 system-prompt tokens 减少 70.1%。发布内容包括完整的 AVA-Encoder 框架、一个可靠的 agentic 视频重建基准,以及首个高质量 Film KG 表示数据集。

引言

基于基础模型构建的 agentic 视频创作系统已经能够起草故事、设计关键帧并生成视频,但仍无法可靠地产出电影级影片,因为其基础模型缺乏协调剧本、角色、镜头和视听元素的规划能力。一个关键障碍在于,人类执导的电影视频以紧密耦合的多模态形式包含丰富的电影制作知识,而 agent 需要结构化、可编辑的表示,如文本、代码、计划和图谱。先前的视频表示只能部分解决这一问题:低级像素和潜在表示保留了视觉细节,但 agent 难以查询或编辑;字幕可读但丢失结构;现有的场景图或知识图谱面向检索和问答设计,因此只保留稀疏事实,不足以重建一个镜头。作者提出 Film KG 表示和 AVA-Encoder,一个自进化的 agentic 视频自动编码框架,将影片编码为 agent 原生、以文本为中心的知识图谱,并据此重建影片。重建质量成为忠实度信号,并配有多级编码器、分层图结构和双环路文本梯度优化。该工作还贡献了一个重建忠实度基准和发布的 Film KG 数据集,支持基于图谱的编辑。

方法

作者将 agent 原生的视频表示学习形式化为一个 agentic 自动编码问题。Agentic Video Auto-Encoder (AVA-Encoder) 框架通过三个基础组件对高维电影视频 VVV 进行映射、压缩和重建:Agentic Video Encoder、Film Knowledge Graph (KG) 表示空间以及固定的 Video Decoder。整体过程由方程 VE(;P)GDecV^V \xrightarrow{E(\cdot; P)} G \xrightarrow{\text{Dec}} \hat{V}VE(;P)GDecV^ 控制,其中编码器 EEE 在编码策略 PPP 下将视频映射到结构化中间 Film KG 表示 GGG,静态解码器 Dec\text{Dec}Dec 依次生成重建视频 V^\hat{V}V^

Agentic Video Encoder 通过三级专业化理解和层级间上下文注入来应对保留细粒度电影信息的挑战。给定输入视频,编码器首先将其划分为按时间排序的电影镜头序列,并选择运动稳定的关键帧。然后通过三个阶段执行分层 agentic 理解:影片级理解捕获全局叙事和跨镜头关系,同时为角色、场景和物体初始化共享注册表;镜头级理解捕获时序、视听和摄影机动态;关键帧级理解提取细粒度视觉构图。为防止阶段孤立导致的误判,层级间上下文注入将更高层上下文传播到更细粒度阶段,确保信息从影片到镜头再到关键帧明确流动。最后,结构化文本结果和注册表链接被组装为 Film KG 表示 GGG

Film KG 表示 G=(NG,EG,AG)G = (N_G, \mathcal{E}_G, \mathcal{A}_G)G=(NG,EG,AG) 是一个离散的、以文本为中心的图,旨在保留复杂的信息依赖关系。它将多模态内容组织为结构化文本节点和关联的多模态资产。图包含十种节点类型,包括由 Story、Event 和 Shot 节点构成的叙事层级,以及镜头特定的状态节点(Character、Scene、Object、Style、Camera 和 Audio)和关键帧节点。类型化边保留制作、时序和语义依赖,例如层级包含关系、时序过渡和因果关系。资产层 AG\mathcal{A}_GAG 存储或引用生成的图像、音频和视频资产,使表示可被 agent 直接用于推理和编辑。

为实现向高保真视频表示的可靠自进化,作者开发了一个双环路文本梯度进化框架。该框架使用固定解码器暴露重建失败,将其转化为细粒度文本梯度,并将每个梯度应用于适当的优化目标。

优化通过两个互补环路进行。外环执行数据无关编码策略伪训练(Data-Agnostic Encoding Policy Pseudo-Training),以学习可跨视频复用的编码行为。它通过处理源视频流更新编码策略 PPP 的镜头和关键帧组件。对于每个视频,框架重建选定镜头,通过冻结的 QA 库识别失败的原子事实,并制定策略级文本梯度。语言重写 agent 提出候选策略更新,并根据当前和历史回放数据进行验证。Anti-Forgetting Gate 确保候选更新在提升当前视频性能的同时,在接受前限制视觉退化和历史退化。

内环在测试时执行可选的数据相关 KG 表示精化(Data-Dependent KG Representation Refinement),以修正输入特定的重建残差。在完全策略固定的情况下,该环直接调整当前视频的 Film KG 表示 GGG。它通过直接比较 ground-truth 与重建关键帧差异或 shot-reward 清单不匹配来诊断失败。这些失败被转换为资产级文本梯度,以修改特定的图像或视频生成 payload。Anti-Degradation Gate 验证候选表示,确保局部修正不会导致已正确内容出现回归。两个环都依赖重建残差信号,该信号将详细优化反馈与独立的最终评估协议分离。

实验

实验通过四个研究问题评估 AVA-Encoder,涵盖重建忠实度、分层理解与两个优化阶段的贡献、电影知识图谱可操作性以及下游复用。使用固定基础模型、共享表示预算和以 ground-truth 为锚的基准,该方法在各类重建方向上均优于所有基线。消融实验表明,影片-镜头-关键帧分层编码和两个优化环提供了明显增益,而接受门控防止目标维度折中和遗忘。定性图谱编辑研究证实,局部编辑在关联镜头间一致传播,且不会干扰不相关资产;相同的表示在作为单一文本输入提供时,也能改善下游 agentic 视频生成系统。

AVA-Encoder 在视频、关键帧、视频反向字幕和关键帧反向字幕的重建忠实度上均领先所有比较方法。其最大优势体现在直接视频和关键帧比较中,反向字幕方向提升较为温和但仍有利于 AVA-Encoder。所有方法在视频反向字幕上得分最低。AVA-Encoder 在视频上比最强基线高 21.1 分,在关键帧比较上高 34.2 分。在反向字幕方面,AVA-Encoder 在视频反向字幕上领先最佳基线 13.9 分,在关键帧反向字幕上领先 11.6 分。

消融实验表明,分层视频理解显著优于朴素的单级编码,且两个优化环提供互补增益:移除任一个环都会降低整体重建,而同时移除两个环则进一步降低。接受门控也改善了所有比较方向的表现,且直接视频和关键帧评估始终强于其反向字幕对应项。在初始策略下的分层编码相比朴素单级配置提供了较大的整体增益。数据相关 KG 精化和数据无关策略伪训练各自改善了整体重建,而组合两个环得到最佳结果。接受门控通过防止非目标退化和历史退化改善了每个比较方向。各种配置下,直接视频和关键帧比较始终优于视频反向字幕和关键帧反向字幕。

将完整 AVA-Encoder 表示作为单一文本注入,可改善所有被评估 agentic 视频生成框架的整体下游故事视频质量。提升集中在角色、情节和风格维度,而摄影机和视听维度变化较小或没有变化。改进无需框架特定的适配器或 prompt 调优。当 AVA-Encoder 表示作为文本提供一次时,MovieAgent 和 FilmAgent 在总体质量上均有提升。两个框架的角色和风格得分大幅上升,而视听得分仍然最低且几乎不变。

第一项实验评估视频、关键帧和反向字幕比较中的重建忠实度,表明 AVA-Encoder 始终优于基线,并在直接视频和关键帧重建中增益最强。消融研究验证了分层视频理解、两个互补优化环和接受门控均对性能有贡献,而直接比较在各种配置下始终强于反向字幕。第三项实验通过将 AVA-Encoder 表示作为文本注入 agentic 框架来测试下游故事视频生成,发现 MovieAgent 和 FilmAgent 的整体质量持续改善,尤其是角色、情节和风格方面,而摄影机和视听方面变化很小。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供